b2科目四模拟试题多少题驾考考爆了怎么补救
b2科目四模拟试题多少题 驾考考爆了怎么补救

深入分析搜索引擎的原理结构

电脑杂谈  发布时间:2020-04-11 02:16:00  来源:网络整理

的存储引擎_威豆数据引擎 海量数据存储_搜索引擎原理 存储

蜘蛛会根据重要性从要访问的地址库中提取URL,然后访问并爬网页面,然后从要访问的地址库中删除URL,然后将其放入已访问的地址库中. 大多数主流搜索引擎为网站管理员提供了一种提交URL的表格. 但是,这些提交的URL仅存储在地址中. 是否包括它们取决于页面的重要性. 搜索引擎中包含的大多数页面是蜘蛛通过其自身的链接获得的. 可以说,提交页面基本上是没有用的,搜索引擎更喜欢沿着链接本身查找新页面.

4. 文件存储

跟踪链接后,需要存储跟踪的信息. 存储的对象,第一个是url,第二个是页面内容(文件大小,最后更新时间,http状态代码,页面源代码等).

第二,预处理[索引]

提取数据后,需要对其进行预处理,这通常称为索引. 主要从文本提取,中文分词,停用词,去噪,重复数据删除,前向索引,倒排索引,链接分析,特殊文件处理等方面.

1. 提取文字

这应该很好理解,在源代码中提取文本. 当然,应该注意的是,这将包括元信息和一些替代文本,除了用户可见的文本信息之外,代码中还包含文本信息(例如alt标签). 搜索引擎当前基于文本. 除了用户在浏览器中看到的文本外,还有许多HTML格式标签,DIV + CSS标签,JavaScript程序等无法用于排名. 因此,搜索引擎的第一步是从HTML代码中删除抓取的标签,程序等,并提取可用于排名处理的页面的文本内容. 除了可见文本之外,搜索引擎还将提取一些包含文本信息的特殊代码,例如Meta标签,alt标签中的文本,被FLASH文件替换的文本,链接的锚文本等.

2. 分词

中文分词(Chinese Word Segmentation)是指将汉字序列分为单个单词. 分词是根据某些规范将连续的单词序列重组为单词序列的过程. 我们知道,在英语写作中,空格是单词之间的自然分隔符,而在中文中,只有单词,句子和段落很容易用明显的分隔符来分隔,但单词没有正式的分隔符,尽管英语也存在问题在词组划分方面,中文比英文复杂和困难得多. 分词方法主要包括: 基于理解的分词,基于字符串匹配的分词,基于统计的分词. 在这里不多说,分词可以说是搜索引擎最重要的部分. 中文分词的框架如下图所示:

3. 去停止说话

搜索引擎原理 存储_威豆数据引擎 海量数据存储_的存储引擎

无论是英文还是中文,页面内容中都会出现一些频繁出现但对内容没有影响的单词,例如“的”,“地”,“得”,“啊”,“诸如” ha”,“ ah”之类的感叹词,诸如“ thus”,“ yes”,“ but”之类的介词,这些词被称为停用词,因为它们对页面的主要含义没有影响. 停用词,例如a,a,an,to等. 搜索引擎将在索引页面之前删除这些停用词,从而使索引数据的主题更加突出,并减少了不必要的计算.

4. 降噪

对于搜索引擎,并非页面的所有部分都需要爬网,并且某些部分对于排名计算毫无意义,例如导航栏,版权文字说明,广告和其他块. 考虑到搜索引擎需要处理的网页数量非常大,这部分毫无意义的内容的绝对数量也非常大. 为了节省计算资源并提高排名计算速度,搜索引擎将在预处理后删除这些内容. . 此过程称为降噪.

现在,搜索引擎应用的降噪技术可以分为三类: 基于网页结构的方法,基于模板的方法和基于视觉信息的方法.

A. 基于视觉信息的方法: 是指使用页面中元素的布局信息,以便可以使用布局信息来划分页面,保留页面的中间区域,其他区域为被认为是噪音.

B. 一种基于网页结构的方法: 即根据html标签对页面进行分区,并划分标题,导航,正文,广告等一些块,仅重要部分如正文被抓住.

C. 基本模板方法: 是指从一组网页中提取相同的模板,然后使用这些模板从网页中提取有用的信息.

5. SEOer如何人为地降低噪音?

A. 搜索引擎将根据视觉信息识别噪音,因此马海翔建议SEO人员在构建网页时应遵循一般原则,并将文本内容安排在页面中间,而不是制作一些非常个性化的页面. 搜索引擎难以识别噪音.

B. 搜索引擎会根据网页的结构识别噪音,因此马海翔建议SEO人员在处理网页的结构时建议引入JS代码,并实现页面标题,广告,版权声明的内容. 等等通过JS调用. 当然,您不希望对某些部分进行爬网,因为这些部分可能会在网站中重复出现,尤其是广告,版权和评论. 一旦包含在内,很容易引起重复的内容积累并影响整个网站的内容质量得分.

C. 搜索引擎会基于网页模板识别噪声,因此SEO员工在构建网页时应尝试使用同一组模板,尤其是在修订过程中不要移动模板以帮助搜索引擎识别噪声块.

6. 重复数据删除

搜索引擎原理 存储_的存储引擎_威豆数据引擎 海量数据存储

暂停后,去噪后的其余短语已经可以很好地表达页面的主要含义. 为了使内容不会被搜索引擎重复包含,搜索引擎需要一种算法来执行重复数据删除过程. 例如,众所周知且常用的MD5算法,搜索引擎会根据特征关键字来计算指纹差异.

7. 前进索引

转发索引简称为索引. 经过前五个步骤后,搜索引擎将提取文本中的关键字,根据分词程序对单词进行划分,并记录页面上每个单词的出现频率,出现次数和格式(例如粗体,斜体,粗体,H标签,添加颜色,锚文本等),位置(例如文本的第一段或页面的最后一段等). 然后将这些单词记录为一组字符串关键字,然后还将记录这些单词的相关信息,例如格式和权重. 实际上,搜索引擎中的每个关键字也都转换为ID形式记录,然后每个文件ID对应于一串关键字ID. 每个文件ID对应于一串关键字ID的数据结构称为前向索引. 例如,文章A对应于三个关键字1、2和3,文章B对应于三个关键字2、4和5.

8,倒排索引

前向索引不能直接应用于关键字排名. 假设用户搜索关键字2,则搜索引擎将扫描索引库中的所有文件,因此时间太长,无法满足用户返回结果的速度,因此在此处使用它对索引进行排序并映射文章ID的关键字ID. 例如,关键字2对应于文章A和文章B. 通过这种方式,搜索引擎将扫描索引库中的文件并缩短扫描时间.

9. 链接算法

在此阶段,还将收集每个页面之间的链接关系. 页面上的导入链接是什么,这些链接指向何处,以及哪个链接指向该页面,是使用URL或锚文本的链接,这些复杂的链接关系构成了页面的链接权重,而锚文本将作为重要的排名基础,是在计算关键词排名的步骤中将包含相当大的锚文本.

10. 处理特殊文件

除了HTML文件之外,搜索引擎通常还可以抓取和索引多种基于文本的文件类型,例如PDF,Word,WPS,XLS,PPT,TXT文件等. 但是,搜索引擎目前无法处理图片,视频和Flash等非文本内容,也无法执行脚本和程序.

三,排名

创建索引文件后,下一步是排名.

的存储引擎_搜索引擎原理 存储_威豆数据引擎 海量数据存储

1. 搜索词的处理

此步骤需要像先前的预处理一样对中文进行分词和停用词. 还需要命令处理,拼写错误纠正和集成的搜索触发. 上面基本相同.

2. 文件匹配

从上面我们可以看到搜索引擎蜘蛛一直在爬行. 此外,他们继续组织和存储爬网数据. 这些过程不是由用户在搜索时执行的,而是在搜索之前进行预处理的. 当用户搜索某个关键字时,搜索引擎仅需要在自己的中进行搜索,而无需实时进行搜索. 搜索Internet上的所有网站. 搜索引擎将简单地计算并匹配与该关键字相对应的所有文件,以找到匹配的页面.

3. 初始子集选择

为了更快地满足用户需求,搜索引擎需要从所有相关页面中进行选择,并且仅计算权重较高的页面才能返回给用户. 此过程通常称为初始子集筛选. 您可以想象,当我们搜索某个关键字时搜索引擎原理 存储,包含该关键字的页面数通常很大搜索引擎原理 存储,甚至数十万或数百万. 如果搜索引擎从如此大的数据中进行匹配,则时间显然会更长. 为了更好地满足用户的需求,搜索引擎只会选择要匹配的权重较高的页面(约1000个).

4. 相关计算

(1),关键字的常用程度

分词后的多个关键字对整个搜索字符串的含义的贡献不同. 较常用的词对搜索词的含义的贡献较小,而较不常用的词对搜索词的含义的贡献更大. 例如,假设用户输入的搜索词是“马海翔博客”. “博客”一词非常常用,并出现在许多页面上. 它对搜索词“马海翔博客”的识别程度和意义相关性贡献很小. 查找包含单词“ blog”的页面对搜索排名的相关性影响很小. 太多页面包含“博客”一词. 术语“马海翔”的使用较少,它对搜索词“马海翔博客”的含义贡献更大. 那些包含“ Ma Haixiang”字样的页面与搜索词“ Ma Haixiang Blog”更为相关. 常用词的极端是停用词,它对页面的含义没有影响.

因此,搜索引擎不会平等对待搜索字符串中的关键字,而是根据常用程度对其进行加权. 不常见的单词具有较高的加权系数,而常用的单词具有较低的加权系数. 排序算法更加注意不常见的单词. 假定两个页面“ A”和“ B”出现单词“ blog”和“ Ma Haixiang”. 但是单词“ blog”出现在A页的普通文本中,而单词“ Ma Haixiang”出现在A页的标题标签中. B页则相反. 标题标签中显示“博客”,普通文本中显示“马海翔”. 然后,对于搜索词“马海翔博客”,页面A会更相关.

(2),单词频率和密度

的存储引擎_搜索引擎原理 存储_威豆数据引擎 海量数据存储

通常认为,在没有关键字累积的情况下,搜索词在页面上的出现频率更高,并且密度越高,页面与搜索词的相关性就越高. 当然,这只是一般规则,实际情况可能并非如此,因此相关计算中还有其他因素. 出现的频率和密度只是影响因素的一部分,它们的重要性越来越低.

(3),关键字位置和形式

如索引部分所述,页面关键字的格式和位置记录在索引库中. 关键字出现在更重要的位置,例如标题标签,粗体,H1等,指示该页面与关键字更相关. 这是seo必须解决的页面.

(4),关键字距离

细分关键字看起来完全匹配,表明它们与搜索词最相关. 例如,当搜索“呼叫中心”时,页面上四个单词“呼叫中心”的连续和完整外观是最相关的. 如果“呼叫”和“中心”这两个词似乎不连续匹配,则距离更近,搜索引擎认为它的相关性更高.

(5),链接分析和页面权重

除了页面本身的因素的文本,等等.

5. 排名过滤和调整,过滤一些作弊行为等等.

通过各种算法的调整(例如百度最近的Luluo算法和石榴算法),过滤一些作弊网站,并通过算法规则或手动调整来减少非法网站的权力,以提取显示高质量网站的信息

6. 搜索缓存

搜索引擎的搜索缓存也称为缓存,这是计算机领域中非常普遍的技术. 我们最熟悉它,它可能是浏览器缓存. 搜索引擎缓存可以简单地描述如下: 在高速存储硬件设备中创建一个数据存储区,以存储搜索用户查询,索引数据,搜索中间结果或最终搜索结果. 缓存的大小是有限的,并且不可能无限期地存储数据. 因此,搜索引擎将采用缓存更新策略和缓存消除策略来管理和维护存储在缓存区域中的数据. 搜索引擎缓存的值搜索引擎缓存具有两个值: 加快对搜索用户查询的响应,改善搜索用户体验; b. 减少搜索引擎后台的计算量并节省计算资源.

7. 排名结果显示

根据信息的有效性,独创性,信息的识别程度以及网站本身的权重,将给出相应的排名显示. 然后查询并单击日志,对搜索用户的搜索进行统计,最后根据用户的搜索习惯给出相应的结果.


本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-171265-1.html

    相关阅读
      发表评论  请自觉遵守互联网相关的政策法规,严禁发布、暴力、反动的言论

      热点图片
      拼命载入中...