为什么不能用Nutch编写分布式爬虫

本篇内容介绍了“为什么不能用Nutch编写分布式爬虫”的有关知识，在实际案例的操作过程中，不少人都会遇到这样的困境，接下来就让小编带领大家学习一下如何处理这些情况吧！希望大家仔细阅读，能够学有所成！

成都创新互联公司成立与2013年，是专业互联网技术服务公司，拥有项目成都网站制作、成都网站建设网站策划，项目实施与项目整合能力。我们以让每一个梦想脱颖而出为使命，1280元平江做网站,已为上家服务,为平江各地企业和个人服务,联系电话:18982081108

1、Nutch依靠hadoop运行，hadoop本身就会花费大量的时间。

若集群机数量较少，爬行速度反而不如单机爬虫快。

2、Nutch是为搜索引擎设计的爬虫，不精确。

大多数用户需要一个爬虫来爬取准确的数据(提取精确)。在Nutch运行的一整套过程中，三分之二是为搜索引擎设计的，对精选没有多大意义。也就是说，用Nutch做数据抽取，会浪费很多的时间在不必要的计算上。并且，通过二次开发Nutch，使其适用于精选业务，基本上破坏Nutch的框架，使Nutch的脸完全不同，具有修正Nutch的能力，与其自己重写分布式爬虫框架相比。

3、Nutch可以提供提取功能。

但开发Nutch插件的人都知道Nutch插件系统有多糟糕。使用反射机制装入和调用插件，使程序的编写和调试变得非常困难，更别提在上面开发一套复杂的精提取系统了。

4、用Nutch爬虫的编写和调试所需的时间长

通常是单机爬虫的十倍以上。学习Nutch源代码的成本很高，在调试过程中会出现各种问题，除了程序本身。

“为什么不能用Nutch编写分布式爬虫”的内容就介绍到这里了，感谢大家的阅读。如果想了解更多行业相关的知识可以关注创新互联网站，小编将为大家输出更多高质量的实用文章！

本文名称：为什么不能用Nutch编写分布式爬虫
标题链接：http://myzitong.com/article/ppcojo.html

为什么不能用Nutch编写分布式爬虫

其他资讯