SEO技术

SEO技术

Products

当前位置:首页 > SEO技术 >

探索百度蜘蛛:如何使用进行网站抓取?

96SEO 2025-04-24 08:30 10



抓取系统原理与索引建库,让SEOer对[百度蜘蛛](/e/.html)的收录索引建库有更多了解。 抓取系统的基本框架,互联网信息爆发式增长,如何有效的获取并利用这些信息是搜索引擎工作中的首要环节。数据抓取系统作为整个搜索系统中的上游,主要负责互联网信息的搜集、保存、更新环节,它像蜘蛛一样在网络间爬来爬去,因此通常会被叫做“”。例如我们常用的几家通用[搜索引擎蜘蛛](/e/.html)被称为:、、Sogou Web 等。 主要抓取策略类型,上图看似简单,但其实在抓取过程中面对的是一个超级复杂的网络环境,为了使系统可以抓取到尽可能多的有价值资源并保持系统及实际环境中页面的一致性同时不给网站体验造成压力,会设计多种复杂的抓取策略。以下做简单介绍: 抓取友好性,互联网资源庞大的数量级,这就要求抓取系统尽可能的高效利用带宽,在有限的硬件和带宽资源下尽可能多的抓取到有价值资源。这就造成了另一个问题,耗费被抓网站的带宽造成访问压力,如果程度过大将直接影响被抓网站的正常用户访问行为。因此,在抓取过程中就要进行一定的抓取压力控制,达到既不影响网站的正常用户访问又能尽量多的抓取到有价值资源的目的。 新链接重要程度判断,在建库环节前,会对页面进行初步内容分析和链接分析,通过内容分析决定该网页是否需要建索引库,通过链接分析发现更多网页,再对更多网页进行抓取——分析——是否建库 & 发现新链接的流程。理论上,会将新页面上所有能“看到”的链接都抓取回来,那么面对众多新链接,根据什么判断哪个更重要呢?两方面: 第一,对用户的价值,内容独特,百度搜索引擎喜欢的内容;主体突出,切不要出现网页主体内容不突出而被搜索引擎误判为空短页面不抓取;内容丰富;广告适当。 第二,链接重要程度,目录层级——浅层优先;链接在站内的受欢迎程度。 百度优先建重要库的原则,抓了多少页面并不是最重要的,重要的是有多少页面被建索引库,即我们常说的“建库”。众所周知,搜索引擎的索引库是分层级的,优质的网页会被分配到重要索引库,普通网页会待在普通库,再差一些的网页会被分配到低级库去当补充材料。目前%的检索需求只调用重要索引库即可满足,这也就解释了为什么有些网站的收录量超高流量却一直不理想。 哪些网页无法建入索引库,上述优质网页进了索引库,那其实互联网上大部分网站根本没有被[百度收录](/e/.html)。并非是百度没有发现他们,而是在建库前的筛选环节被过滤掉了。那怎样的网页在最初环节就被过滤掉了呢: 重复内容的网页;主体内容空短的网页;有些内容使用了百度无法解析的技术,如JS、AJAX等,虽然用户访问能看到丰富的内容,依然会被搜索引擎抛弃;加载速度过慢的网页,也有可能被当作空短页面处理,注意广告加载时间算在网页整体加载时间内;很多主体不突出的网页即使被抓取回来也会在这个环节被抛弃;部分作弊网页。 更多关于抓取系统原理与索引建库,请前往百度站长论坛查看文档。

标签:

提交需求或反馈

Demand feedback