Grub-分布式Web爬虫

Grub 非彼 GRUB (GNU GRUB)。今天看到卢亮的 Larbin 一种高效的搜索引擎爬虫工具 一文提到 Nutch,Google 找了一下,发现了这个 Grub。此 Grub 是个分布式应用程序(类似 SETI@home ,寻找地外智能生物),该软件的目标有些惊人:

track down every site in the world and provide a real-time map of the Web

Grub 的资助者是 Looksmart 公司。如果感兴趣,可以下载客户端工具,用空闲的 CPU 资源与网络带宽为 Web 搜索添加一份自己的力量,共同构建世界上最大的最灵敏(?)的 URL 信息数据库。客户端工具目前有 Windows 版本和 Linux 版本,最新的版本号是 2.5 。

该工具的界面一瞥:

Grub.Distributed Web Crawling.png

在这里可以查看一些用户统计信息,可以看到排名第一的用户已经贡献了768,071,848 个 URL (to Dec-24-2004)。


Leave a Reply

Your email address will not be published. Required fields are marked *