Heritrix部署直接能运行的项目

lancyf 44 0 rar 2020-04-29 08:04:07

Heritrix是IA的开放源代码,可扩展的,基于整个Web的,归档网络爬虫工程 Heritrix工程始于2003年初,IA的目的是开发一个特殊的爬虫,对网上的 资源进行归档,建立网络数字图书馆,在过去的6年里,IA已经建立了400TB的数据。 IA期望他们的crawler包含以下几种: 宽带爬虫:能够以更高的带宽去站点爬。 主题爬虫:集中于被选择的问题。 持续爬虫:不仅仅爬更当前的网页还负责爬日后更新的网页。 实验爬虫:对爬虫技术进行实验,以决定该爬什么,以及对不同协议的爬虫爬行结果进行分析的。 Heritrix的主页是http://crawler.

用户评论
请输入评论内容
评分:
Generic placeholder image 卡了网匿名网友 2020-04-29 08:04:07

学习用,不太好用

Generic placeholder image 卡了网匿名网友 2020-04-29 08:04:07

Generic placeholder image 卡了网匿名网友 2020-04-29 08:04:07

可以,直接当demo用了

Generic placeholder image 卡了网匿名网友 2020-04-29 08:04:07

用不了,太坑啦

Generic placeholder image 卡了网匿名网友 2020-04-29 08:04:07

解压文件出现错误,不能够打开文件,郁闷死

Generic placeholder image 卡了网匿名网友 2020-04-29 08:04:07

解压直接显示错误 烦死啦