现在的位置: 首页 > 综合 > 正文

heritrix总结——HostnameQueueAssignmentPolicy改写

2014年08月22日 ⁄ 综合 ⁄ 共 714字 ⁄ 字号 评论关闭

Heritrix多线程默认是根据域名来分下载队列,但是这种策略非常不符合垂直搜索的要求,故需要引入ELFHash来改进分配策略

指定的链接队列中以host作为key值进行hash,这样使得即使配置了100个线程,也只有一个线程在运行,因为heritrix默认每次从一个队列中取出来一个url进行抓取,等抓取结束之后再取另外一个。因为指定路径基本上都是在一个host里面,这样就会变成单线程爬取,非常的慢。

无奈之下继续改写,这次是修改HostnameQueueAssignmentPolicy,也是系统默认的。其中主要是getClassKey这个函数,是生成队列的key值得,使用ELFHash哈希算法进行url的hash。

代码如下:

 //实现多线程的算法,对key进行散列
    public String getClassKey(CrawlController controller, CandidateURI cauri) {
	    String uri = cauri.getUURI().toString();
        long hash = ELFHash(uri);
        String a = Long.toString(hash);
        
        return a;
	}
    
	//ELFHash散列算法
    public long ELFHash(String str)
    {
       long hash = 0;
       long x    = 0;
       for(int i = 0; i < str.length(); i++)
       {
          hash = (hash << 4) + str.charAt(i);
          if((x = hash & 0xF0000000L) != 0)
          {
             hash ^= (x >> 24);
             hash &= ~x;
          }
       }
       return (hash & 0x7FFFFFFF);
    }

改完之后速度嗖嗖的,截图如下:

抱歉!评论已关闭.