吉林面试资料

首页 > 吉林军队文职 > 备考资料 > 面试资料

2021年军队文职计算机岗面试考点及试题解析:百度搜索引擎的原理

吉林华图 | 2021-09-07 09:32

收藏

  【题目】

  简述百度搜索引擎的原理。

  【解题思路】

  组织流程题,可按照事前、事中、事后三部分开展。

  【参考答案】

  大概分为三个阶段:

  第一,爬行和抓取。为了抓取网上尽量多的页面,搜索引擎蜘蛛会跟踪页面上的超链接,从一个页面爬到下一个页面。整个互联网是由相互链接的网站及页面组成的。从理论上说,蜘蛛从任何一个页面出发,顺着超链接都可以爬行到网上的所有页面。

  第二,预处理。“预处理”也被简称为“索引”。搜索引擎蜘蛛抓取的原始页面,还要做大量的预处理工作,为最后的查询排名做好准备。其中,最重要的就是提取关键词,建立索引文件。其他还包括内容过滤去除重复网页、一些明显的欺骗用户的网页,死链接,空白内容页面(这些网页对用户和百度来说,都是没有价值的);分词(中文)、判断网页类型、分析超链接、计算网页的重要度、丰富度等。

  第三,排名结果输出。用户输入关键词后,排名程序调用索引库数据,会对其进行一系列复杂的分析,并根据分析的结论在索引库中寻找与之最为匹配的一系列网页,按照用户输入的关键词所体现的需求强弱和网页的优劣进行打分,并按照最终的分数进行排列,展现给用户该关键词最匹配最有价值的网页。

分享到

微信咨询

微信中长按识别二维码 咨询客服

全部资讯

copyright ©2006-2020 华图教育版权所有