蜘蛛web

核心提示不知道大家平时有没有听过网络爬虫?作为一个网站的运营者,小聪倒是想搜索引擎的蜘蛛多点光顾自家的网站,其他的就不是很想了!那么这里的蜘蛛到底是什么?今天小聪就给大家介绍一下在互联网里面的蜘蛛。网页蜘蛛,又称网络爬虫、网络机器人;不过在FOAF

不知道大家有没有听说过网络爬虫?作为一个网站的运营者,小聪真的很想让搜索引擎的蜘蛛多访问自己的网站,但他其实并不想要别的!那么这里的蜘蛛是什么?今天小聪就给大家介绍一下网络中的蜘蛛。

蜘蛛,又称网络爬虫、网络机器人;然而,在FOAF社区,人们更习惯称之为“网页追逐者”。它不是真正的动物,而是按照一定规则从万维网上自动抓取信息的程序或脚本;不知道为什么一开始叫蜘蛛小聪,现在很多人直接把它形象化为蜘蛛,其实只是一串字符码,没有实体!而且这些网络爬虫如果按照体系结构和实现技术分类,大致可以分为四种:通用网络爬虫、聚焦网络爬虫、增量网络爬虫和深度网络爬虫;这些技术通常是结合在一起的,合在一起就是我们通常所说的“网络爬虫系统”。那么这四种爬行动物有什么区别呢?

1.万能网络爬虫:又称“网络爬虫”。爬行对象从一些种子URL延伸到整个万维网,主要是为“门户搜索引擎”和“大型Web服务提供商”收集数据。这个技术主要是平时经常说的几大搜索引擎在用,大佬们并没有公布他们的技术细节。毕竟在这个商业市场,利益永远是第一位的吧?这类爬虫的抓取范围和数量巨大,对抓取速度和存储空的要求较高,但对抓取页面的要求相对较低。而且因为搜索引擎上等待刷新的页面太多,一般都是并行工作,但是页面刷新一次还是要花很长时间。想想目前互联网上的网页数量,就能知道这些蜘蛛平时做了多少工作。因此,尽管“通用网络爬虫”技术存在一些缺陷,但它仍然是搜索引擎平台上被广泛搜索的话题,具有很强的应用价值。

随着计算机网络的飞速发展,万维网现在已经成为大量信息的载体,每天注册的网页可能有成千上万个。那么我们如何有效地提取和利用对我们来说是必要的信息呢?还有上面提到的搜索引擎,比如,360,Google,Yahoo等。这些传统的通用搜索引擎平台现在广为人知。经常上网的人都知道,这些平台已经成为辅助网民在万维网上搜索信息的工具,也成为访问万维网的门户和渠道。但是任何事情都有两面性。这些通用搜索引擎在给网民带来便利的同时,也有一定的局限性:

①不同领域、职业、背景的用户往往有不同的搜索目的和需求。一般搜索引擎返回的结果包含大量用户不关心的网页,或者与用户搜索结果无关的网页。

②通用搜索引擎的目标是实现最大的网络覆盖,有限的搜索引擎服务器资源和无限的网络数据资源之间的矛盾会进一步加深。

③随着万维网数据形式的丰富和网络技术的不断发展,出现了大量不同的数据,如图片、数据库、音频、视频和多媒体等。一般的搜索引擎往往无法找到并获取这些信息内容密集、结构确定的数据。

④一般的搜索引擎,大多提供基于“关键词”的搜索,很难支持基于语义信息的查询。

基于这些限制,以定向方式抓取相关页面资源的“聚焦网络爬虫”应运而生。

2.焦点网络爬虫:又称“主题网络爬虫”,是一种自动下载网页的程序。它根据既定的爬取目标,有选择地访问万维网上的网页和相关链接,获取所需信息;一般来说,预先定义一个主题,然后有选择地抓取与该主题相关的网页的网络爬虫。说白了,比如现在我们只需要收集与“服务器”相关的网页。定义好爬虫的程序脚本后,爬虫会静默执行命令,只访问与“服务器”相关的页面。通常说的是网站的关键词,这里蜘蛛在抓取的时候会判断页面的关键词。

聚焦网络爬虫的工作流程比较复杂,需要按照一定的“网页分析算法”过滤掉与主题无关的链接,保留有用的链接,放入URL队列等待抓取。然后按照一定的搜索策略,它会从队列中选择下一个网页的URL,重复上述过程,直到达到系统的某个条件。

此外,爬虫抓取的所有网页都会存储在系统中,进行一定程度的分析和过滤,并进行索引,以方便后续的查询和检索。因此,对于聚焦的网络爬虫来说,在这个过程中得到的分析结果也可能对以后的爬行过程给予反馈和指导。

因此,与一般的网络爬虫相比,聚焦网络爬虫只需要抓取与主题相关的页面,大大节省了硬件和网络资源,而且保存的页面由于数量少,可以快速更新,也能很好地满足一些特定人群对特定领域信息的需求。因此,在聚焦网络爬虫中增加了两个模块,即“链接评价模块”和“内容评价模块”。因为其抓取策略实现的关键是评估页面内容和链接的重要性。在这里,你也可以根据自己的需要设置不同的方法,这样计算出来的重要性也不同,从而导致链接的访问顺序不同。但是,与聚焦网络爬虫相比,还存在一些问题:①对要爬行的目标的描述或定义;②网页或数据的分析过滤;URL的搜索策略。

三。增量式网络爬虫:这种爬虫指的是增量式更新下载网页的爬虫,只爬行新的或变化的网页。可以在一定程度上保证抓取的页面尽可能的新。通俗一点就是增量爬虫只会在需要的时候抓取新生成或者更新的页面,不会重新下载没有变化的页面。可以有效减少数据下载量,及时更新抓取的页面,减少时间和空的开销,但是增加了抓取算法的复杂度和难度。

4.深度网络爬虫:想了解这类爬虫,首先要解释一下“深度网络”。一般来说,我们平时接触的网页,根据其存在的方式,可以分为“表层网页”和“深层网页”。表层页面是指可以被传统搜索引擎索引的页面,网页主要由超链接可以到达的静态页面组成。深度网页是指那些大部分内容无法通过静态链接获取,而是隐藏在搜索表单后面,只有用户提交部分关键词才能获取的网页。比如那迅网官网注册后才能看到的产品详情,就属于深度页面,注册前看到的只是大概的想法。可以增加或减少的服务器配置只能在登录后显示。

相信大家通过上述内容对这四类网络爬虫都有所了解。随着互联网技术的发展和网页的迅速增加,“蜘蛛”的流行只会导致许多问题。

早在2007年底,互联网上的网页数量已经超过160亿,根据当年的网络研究,其中有30%的页面是重复的;2015年底,全球网页总量超过60万亿,是否还有更进一步的空间,肖聪不得而知。基于这种庞大的网页数量,动态页面的存在,以及客户端和服务器端脚本语言的应用,指向同一网页信息的URL数量也呈指数级增长。

然而,在数万亿的网页之下,网络爬虫的工作面临着巨大的挑战;主要体现在web信息容量巨大,爬虫在给定时间内只能下载少量网页。对互联网的研究表明,目前,没有一个搜索引擎能够索引超过16%的互联网网页。而且,即使可以提取所有页面,也没有足够的空空间来存储这个顺序的内容。

因此,爬虫需要在单位时间内获得尽可能多的高质量页面,这也是蜘蛛面临的难题之一:如何提高爬行效率。

目前有五种方式来表示页面的质量以提高效率:①页面与抓取主题的相似度;②网页在网络图中的渗透程度;③指向它的所有页面的平均权重之和;④网页图中页面的大小;⑤页面的信息位置。

另一个问题是爬行动物的反复爬行。在介绍通用网络爬虫时提到,为了提高爬行速度,目前的搜索引擎中有四种爬虫技术并存,它们通常采用“并行爬行”的工作模式,这也产生了新的问题:①重复性:并行爬虫或爬行线程同时运行时,会增加重复页面;②质量问题:并行运行时,每个爬虫或爬行线程只能获得部分页面,导致页面质量下降;③通信带宽成本:并行运行时,爬虫或爬行线程之间的一些通信是不可避免的,需要一定的带宽资源。

上有政策,下有对策,面对新的问题,蜘蛛也有相应的解决办法:①独立方式:各爬虫独立抓取页面,互不通信;②动态分配法:一个中央协调器动态协调分配URL给所有爬虫;③静态分配法:预先将URL划分给各个爬虫。

当然,这个设置是留给程的,他拥有爬行动物!小聪对技术一窍不通。小聪只希望各大搜索引擎的蜘蛛来纳讯踩地盘!今天的文章到此为止。你最喜欢的是那迅网——小聪笑话IDC最大的期待!

 
友情链接
鄂ICP备19019357号-22