百度对网站页面收录的原理

原标题:百度对网站页面收录的原理

通过几期前面内容的介绍,大家应该大致了解了搜索引擎的工作方式,下面我们来介绍页面收录的原理。页面收录原理经过修改页面收录流程能够把握放慢网站被收录的办法,从而改善搜索引擎收录的数目。假设把一个网站页面组成的页面看作是一个有向图,沿着页面中的链接,依照某种特定的战略对网站中的页面停止遍历。

不停地从URL列表中移出曾经拜访的URL,同时提取原始页面中的URL的消息,再将URL分为域名及外部URL两大类,同时判定URL能否被拜访过,递归地扫描URL列表,直至耗尽一切URL资源为止,如图所示。

搜索引擎收录页面的工作原理

在搜索引擎中要获取相对重要的页面,就涉及到了搜索引擎的页面收录方式。页面收录方式是指搜索引擎抓取页面时所使用的战略,目的是为了能在互联网中挑选出绝对主要的消息。假设使用相同的抓取战略,搜索引擎在异样的工夫内能够在某一网站中抓取到更多的页面资源,则会在该网站停止更长的工夫,收录的页面数自然也就多了。因而,加强对搜索引擎页面收录方式的熟悉,有益于为网站树立敌对的构造,进步被收录的数目。搜索引擎收录页面的方式主要有广度优先、深度优先及用户提交(用户提交暂时不讲)三种。

1.广度优先如果把整个网站看做一棵树,首页就是根,每个页面就是叶子。广度优先是一种横向的页面抓取方式,先从树的较浅层开始抓取页面,直接抓完同层次的所有页面后才进入下一层。因此,在对网站进行优化时,应该把网站相对重要的信息展示在层次比较浅的页面上(如在首页推荐一些热门的内容)。反过来,通过广度优先的抓取方式,搜索引擎就可以首先抓取到网站中相对重要的页面。首先,蜘蛛从网站的首页出发,抓取首页上所有连接指向的页面,形成页面集合A,并分析出A中所有页面中的链接,再跟踪这些链接抓取下一层的页面,形成页面集合B。就这样递归地从浅层页面中解析出链接,再延伸到深层页面,直到满足某个设定的条件才停止抓取进程,如图所示。

广度优先抓取流程

2.深度优先与广度优先的抓取方式相反,深度优先首先跟踪浅层页面中的某一连接后逐步抓取深层页面,直到抓完最深层的页面才返回浅层页面再跟踪另一链接,继续向深层页面抓取,这是一种纵向的页面抓取方式。使用深度优先的抓取方式,搜索引擎可以抓取到网站中较为隐蔽、冷门的页面,这样就能满足更多用户的需求。首先,搜索引擎会抓取网站的首页,并提取首页中的链接,再沿着其中的一个连接抓取到页面A-1,同时获取A-1中的链接并抓取页面B-1,获取B-1中的来链接并抓取页面C-1,如此不断地重复,满足到某个条件后,再从A-2抓取页面及链接,如图所示。

深度优先的抓取方式返回搜狐,查看更多

责任编辑:

相关文章
weinxin
我的微信
微信扫一扫
744700076@qq.com
  • 本文由 发表于 2022年10月1日 01:24:43
  • 转载请务必保留本文链接:http://seo3g.com/seojc/gjcyhjc/559.html
匿名

发表评论

匿名网友 填写信息

:?: :razz: :sad: :evil: :!: :smile: :oops: :grin: :eek: :shock: :???: :cool: :lol: :mad: :twisted: :roll: :wink: :idea: :arrow: :neutral: :cry: :mrgreen: