童话说说技术创业美文职业
投稿投诉
职业母婴
职场个人
历史治疗
笔记技能
美文纠纷
幽默家庭
范文作文
乐趣解密
创业案例
社会工作
新闻家居
心理安全
技术八卦
仲裁思考
生活时事
运势奇闻
说说企业
魅力社交
安好健康
传统笑话
童话初中
男女饮食
周易阅读
爱好两性

了解入门爬虫技术原理,看这篇就够了

3月11日 不星湖投稿
  爬虫技术就是一个高效的下载系统,能够将海量的网页数据传送到本地,在本地形成互联网网页的镜像备份。本文从爬虫技术的诞生开始,为你详细解析爬虫技术原理。
  一、爬虫系统的诞生
  通用搜索引擎的处理对象是互联网网页,目前互联网网页的数量已达百亿,所以搜索引擎首先面临的问题是:如何能够设计出高效的下载系统,以将如此海量的网页数据传送到本地,在本地形成互联网网页的镜像备份。
  网络爬虫能够起到这样的作用,完成此项艰巨的任务,它是搜索引擎系统中很关键也很基础的构件。
  本文主要介绍与网络爬虫相关的技术,尽管爬虫经过几十年的发展,从整体框架上来看已经相对成熟,但随着互联网的不断发展,也面临着一些新的挑战。
  二、通用爬虫技术框架
  爬虫系统首先从互联网页面中精心选择一部分网页,以这些网页的链接地址作为种子URL,将这些种子放入待抓取URL队列中,爬虫从待抓取URL队列依次读取,并将URL通过DNS解析,把链接地址转换为网站服务器对应的IP地址。
  然后将其和网页相对路径名称交给网页下载器,网页下载器负责页面的下载。
  对于下载到本地的网页,一方面将其存储到页面库中,等待建立索引等后续处理;另一方面将下载网页的URL放入已抓取队列中,这个队列记录了爬虫系统已经下载过的网页URL,以避免系统的重复抓取。
  对于刚下载的网页,从中抽取出包含的所有链接信息,并在已下载的URL队列中进行检查,如果发现链接还没有被抓取过,则放到待抓取URL队列的末尾。在之后的抓取调度中会下载这个URL对应的网页。
  如此这般,形成循环,直到待抓取URL队列为空,这代表着爬虫系统将能够抓取的网页已经悉数抓完,此时完成了一轮完整的抓取过程。
  通用爬虫架构
  上述是一个通用爬虫的整体流程,如果从更加宏观的角度考虑,处于动态抓取过程中的爬虫和互联网所有网页之间的关系,可以概括为以下5个部分:
  已下载网页结合:爬虫已经从互联网下载到本地进行索引的网页集合。
  已过期网页结合:由于网页数量庞大,爬虫完整抓取一轮需要较长时间,在抓取过程中,很多已下载的网页可能已经更新了,从而导致过期。之所以如此,是因为互联网网页处于不断的动态变化过程中,所以易产生本地网页内容和真实互联网不一致的情况。
  待下载网页集合:处于待抓取URL队列中的网页,这些网页即将被爬虫下载。
  可知网页集合:这些网页还没有被爬虫下载,也没有出现在待抓取URL队列中,通过已经抓取的网页或者在待抓取URL队列中的网页,总是能够通过链接关系发现它们,稍晚时候会被爬虫抓取并索引。
  未知网页集合:有些网页对于爬虫是无法抓取到的,这部分网页构成了未知网页结合。事实上,这部分网页所占的比例很高。
  互联网页面划分
  从理解爬虫的角度看,对互联网网页给出如上划分有助于深入理解搜索引擎爬虫所面临的主要任务和挑战。绝大多数爬虫系统遵循上文的流程,但是并非所有的爬虫系统都如此一致。根据具体应用的不同,爬虫系统在许多方面存在差异,大体而已,可以将爬虫系统分为如下3种类型:
  1。批量型爬虫:批量型爬虫有比较明确的抓取范围和目标,当爬虫达到这个设定的目标后,即停止抓取过程。
  至于具体目标可能各异,也许是设定抓取一定数量的网页即可,也许是设定抓取的时间等,各不一样。
  2。增量型爬虫:增量型爬虫与批量型爬虫不同,会保持持续不断的抓取,对于抓取到的网页,要定期更新。
  因为互联网网页处于不断变化中,新增网页、网页被删除或者网页内容更改都很常见,而增量型爬虫需要及时反映这种变化,所以处于持续不断的抓取过程中,不是在抓取新网页,就是在更新已有网页。通用的商业搜索引擎爬虫基本都属此类。
  3。垂直型爬虫:垂直型爬虫关注特定主题内容或者属于特定行业的网页,比如对于健康网站来说,只需要从互联网页面里找到与健康相关的页面内容即可,其他行业的内容不在考虑范围。
  垂直型爬虫一个最大的特点和难点就是:如何识别网页内容是否属于指定行业或主题。
  从节省系统资源的角度来讲,不可能把所有互联网页面下载之后在进行筛选,这样会造成资源过度浪费,往往需要爬虫在抓取阶段就能够动态识别某个网址是否与主题相关,并尽量不去抓取无关页面,以达到节省资源的目的。垂直搜索网站或者垂直行业网站往往需要此种类型的爬虫。
  三、优秀爬虫的特性
  优秀爬虫的特性对于不同的应用来说,可能实现的方式各有差异,但是实用的爬虫都应该具备以下特性:
  1。高性能
  互联网的网页数量是海量的,所以爬虫的性能至关重要。这里的性能主要是指爬虫下载网页的抓取速度,常见的评价方式是以爬虫每秒能够下载的网页数量作为性能指标,单位时间能够下载的网页数量越多,爬虫的性能越高。
  要提高爬虫的性能,在设计时程序访问磁盘的操作方法及具体实现时数据结构的选择很关键,比如对于待抓取URL队列和已抓取URL队列,因为URL数量非常大,不同实现方式性能表现迥异,所以高效的数据结构对于爬虫性能影响很大。
  2。可扩展性
  即使单个爬虫的性能很高,要将所有网页都下载到本地,仍然需要相当长的时间周期,为了能够尽可能缩短抓取周期,爬虫系统应该有很好地可扩展性,即很容易通过增加抓取服务器和爬虫数量来达到此目的。
  目前实用的大型网络爬虫一定是分布式运行的,即多台服务器专做抓取。每台服务器部署多个爬虫,每个爬虫多线程运行,通过多种方式增加并发性。
  对于巨型的搜索引擎服务商来说,可能还要在全球范围、不同地域分别部署数据中心,爬虫也被分配到不同的数据中心,这样对于提高爬虫系统的整体性能是很有帮助的。
  3。健壮性
  爬虫要访问各种类型的网站服务器,可能会遇到很多种非正常情况:比如网页HTML编码不规范、被抓取服务器突然死机,甚至爬虫陷阱等。爬虫对各种异常情况能否正确处理非常重要,否则可能会不定期停止工作,这是无法忍受的。
  从另外一个角度来讲,假设爬虫程序在抓取过程中死掉,或者爬虫所在的服务器宕机,健壮的爬虫应能做到:再次启动爬虫时,能够恢复之前抓取的内容和数据结构,而不是每次都需要把所有工作完全从头做起,这也是爬虫健壮性的一种体现。
  4。友好性
  爬虫的友好性包含两方面的含义:一是保护网站的部分私密性;另一是减少被抓取网站的网络负载。爬虫抓取的对象是各类型的网站,对于网站所有者来说,有些内容并不希望被所有人搜到,所以需要设定协议,来告知爬虫哪些内容是不允许抓取的。目前有两种主流的方法可达到此目的:爬虫禁抓协议和网页禁抓标记。
  爬虫禁抓协议指的是由网站所有者生成一个指定的文件robot。txt,并放在网站服务器的根目录下,这个文件指明了网站中哪些目录下的网页是不允许爬虫抓取的。具有友好性的爬虫在抓取该网站的网页前,首先要读取robot。txt文件,对于禁止抓取的网页不进行下载。
  网页禁抓标记一般在网页的HTML代码里加入metaname”robots”标记,content字段指出允许或者不允许爬虫的哪些行为。可以分为两种情形:一种是告知爬虫不要索引该网页内容,以noindex作为标记;另外一种情形是告知爬虫不要抓取网页所包含的链接,以nofollow作为标记。通过这种方式,可以达到对网页内容的一种隐私保护。
  遵循以上协议的爬虫可以被认为是友好的,这是从保护私密性的角度来考虑的;另外一种友好性则是,希望爬虫对某网站的访问造成的网路负载较低。
  爬虫一般会根据网页的链接连续获取某网站的网页,如果爬虫访问网站频率过高,会给网站服务器造成很大的访问压力,有时候甚至会影响网站的正常访问,造成类似DOS攻击的效果。
  为了减少网站的网络负载,友好性的爬虫应该在抓取策略部署时考虑每个被抓取网站的负载,在尽可能不影响爬虫性能的情况下,减少对单一站点短期内的高频访问。
  四、爬虫质量的评价标准
  如果从搜索引擎用户体验的角度考虑,对爬虫的工作效果有不同的评价标准,其中最主要的3个标准是:抓取网页的覆盖率、抓取网页时新性及抓取网页重要性。如果这3方面做得好,则搜索引擎用户体验必定好。
  对于现有的搜索引擎来说,还不存在哪个搜索引擎有能力将互联网上出现的所有网页都下载并建立索引,所有搜索引擎只能索引互联网的一部分。而所谓的抓取覆盖率指的是爬虫抓取网页的数量占互联网所有网页数量的比例,覆盖率越高,等价于搜索引擎的召回率越高,用户体验越好。
  索引网页和互联网网页对比
  抓取到本地的网页,很有可能已经发生变化,或者被删除,或者内容被更改,因为爬虫抓取完一轮需要较长的时间周期,所以抓取到的网页当中必然会有一部分是过期的数据,即不能在网页变化后第一时间反应到网页库中。所以网页库中过期的数据越少,则网页的时新性越好,这对用户体验的改善大有裨益。
  如果时新性不好,搜索到的都是过期数据,或者网页被删除,用户的内心感受可想而知。
  互联网尽管网页繁多,但是每个网页的差异性都很大,比如来自腾讯、网易新闻的网页和某个作弊网页相比,其重要性犹如天壤之别。如果搜索引擎抓取到的网页大部分是比较重要的网页,则可以说明在抓取网页重要性方面做得比较好。这方面做的越好,则越说明搜索引擎的搜索精度越高。
  通过以上3个标准的说明分析,可以将爬虫研发的目标简单描述如下:在资源有限的情况下,既然搜索引擎只能抓取互联网现存网页的一部分,那么就尽可能给选择比较重要的那部分页面来索引;对于已经抓取到的网页,尽可能快的更新内容,使得索引网页和互联网对应页面内容同步更新;在此基础上,尽可能扩大抓取范围,抓取到更多以前无法发现的网页。
  3个“尽可能”基本说清楚了爬虫系统为增强用户体验而奋斗的目标。
  大型商业搜索引擎为了满足3个质量标准,大都开发了多套针对性很强的爬虫系统。以Google为例,至少包含两套不同的爬虫系统:一套被称为FreshBot,主要考虑网页的时新性,对于内容更新频繁的网页,目前可以达到以秒计的更新周期;另外一套被称之为DeepCrawlBot,主要针对更新不是那么频繁的网页抓取,以天为更新周期。
  除此之外,Google投入了很大精力研发针对暗网的抓取系统,后续,有时间再说明暗网系统。
  Google的两套爬虫系统
  五、最后的总结
  阅读本文,通过了解爬虫的技术架构、爬虫的类型、优秀爬虫的特性、爬虫质量标准,相信你对爬虫系统已经有了一个初步的系统性的认识,最后将主要知识点做一个简短的纲领性总结:
  爬虫抓取网页的工作流程:选择待抓取网页,按顺序放入待抓取队列;系统依次将网页链接地址转换为IP地址,下载到本地后,按顺序进行存储和标记,避免重复下载;继续执行新一轮的抓取,周而复始。
  爬虫和互联网所有网页之间的关系:已下载网页结合、已过期网页结合、待下载网页结合、可知网页结合、未知网页结合
  爬虫类型:批量型爬虫、增量型爬虫、垂直型爬虫
  优秀爬虫的特性:高性能、可扩展性、健壮性、友好性
  爬虫质量的评价标准:抓取网页的覆盖率、抓取网页时新性及抓取网页重要性
投诉 评论 转载

无卡出行竞品分析:小米公交VSApplePay公交ApplePay公交以及小米公交其产品体验已被广大用户所接受认可,具有一定的参考价值。因此在产品体验和功能设计方面值得借鉴学习,以此来对产品进行功能和体验优化。目录……“得到”产品分析报告得到,是一款聚集国内头部精品资源的知识服务App,这里有一份关于它的产品的详细分析报告,一起来看看吧一、产品简介得到,是一款聚集国内头部精品资源的知识服务App,主……从6个方面,对LinkedIn中国进行详细的分析和讨论LinkedIn领英在全球职场社交市场上占的份额特别大,然而进入中国市场后却表现平平。本文对领英这一产品进行了详细拆分,并对其在中国市场的发展提出了一些建议。Linked……当超级APP越来越重,我们是否低估了轻量应用?当下各APP平台之间你争我抢,为了能吸引更多流量,app功能越来越多,体积越来越大。那么那些功能比较单一的轻量级应用是否越来越难以生存呢?其实不然,这反而是他们新的机遇。……毛豆新车vs弹个车:AT的汽车新零售之争AT巨头的汽车新零售布局,不是小打小闹,也不是开辟新战场,而是直接动起了4S店汽车经销商的蛋糕。本文作者将对毛豆vs弹个车,做个简单而妥善的竞品分析。enjoy毛豆vs弹……美团滴滴大战正酣,解读滴滴外卖的业务逻辑美团与滴滴的外卖大战正在进行,因美团做出行在前,滴滴做外卖在后,很多人看好美团打车而唱衰滴滴外卖。本文作者却另有看法,具体原因如下文。王兴和程维是当世瑜亮,两人私交不错,……从五个方面谈谈:关于One的一点看法One是一款文艺阅读应用,在刚上线之初,受到了大量文艺青年的喜爱。可慢慢的。大家开始不再打开这个软件,不再去阅读里面的文章。而又是什么原因导致了这种状况,本文就从六个方面,来谈……美团入局,看滴滴的劣势、优势和出路最近,关于滴滴的讨论很多,基本上都围绕着我这篇文章标题中凸显出来的三个方面。这篇文章并不是对各路观点的简单梳理与汇总,而是在“巨人的肩膀”上谈谈我的看法。一、滴滴的劣势……快手与抖音功能对比:观看体验和评论功能抖音和快手是短视频APP领域的两大巨头,本文主要谈谈关于快手与抖音的观看体验和评论功能的分析与对比。最近网友们都在调侃:“南抖音,北快手”,虽然是调侃,但也说明抖音和快手……对“搜狗云表情”工具型产品的一些思考表情包现在是大家网上交流的必备工具,有很大的市场需求。本文作者深入体验“搜狗云表情”app,并对其功能提出了一下意见和建议。需求:针对表情包工具的功能进行一些简单的设计规……了解入门爬虫技术原理,看这篇就够了爬虫技术就是一个高效的下载系统,能够将海量的网页数据传送到本地,在本地形成互联网网页的镜像备份。本文从爬虫技术的诞生开始,为你详细解析爬虫技术原理。一、爬虫系统的诞生……从时间轴说起,分析抖音发展的3个阶段2018开年以来,抖音的表现优异得让人惊讶。单单因为在春节登顶单日下载量榜单,持续领先QQ、微信、淘宝,就足以让大众的目光聚焦。这个上线仅500多天的APP是怎么在短视频领域杀……
为什么好的文案都是“具象化思维”?搞清楚三个底层逻辑,父亲节文案没问题写文案,要有“颗粒感”papi酱,文案又火了!这些文案真皮!有些广告表面上卖货,实际上是动物世界向小朋友学习写文案无灵感时,如何进行文案创作?好的卖货文案,开头都符合这3个原则6句中年人文案,与你有关。。你的文案“补偿”了谁?用这4招写文案,让用户觉得“占便宜”
归还造句用归还造句大全跌落的湖南富豪张勇创业4年营收180亿,创业10年破产清算为什么宫缩乏力会导致产后出血冬瓜蛋花汤怎么做?详细方法在这里!孙烈臣简介孙烈臣有后代吗孙烈臣家人都有谁云顶天宫会员收官白澍张博宇赵东泽青铜门外终极决战烤箱做蛋糕多少度用多少时间原生家庭之痛来自孩子的质问如果我在别人家长大,肯定会优秀青春与责任演讲稿五星小前锋哈里森英格拉姆承诺NCAA斯坦福大学土房表达与拒绝都是权利

友情链接:中准网聚热点快百科快传网快生活快软网快好知文好找作文动态热点娱乐育儿情感教程科技体育养生教案探索美文旅游财经日志励志范文论文时尚保健游戏护肤业界