JAVA开源爬虫，WebCollector,简单易用，有界面。 | 学步园

返回顶部
查看留言
转到底部

现在的位置: 首页 > 综合 > 正文

JAVA开源爬虫，WebCollector,简单易用，有界面。

2017年12月21日 ⁄ 综合 ⁄ 共 329字 ⁄ 字号小中大 ⁄ 评论关闭

如果你想用爬虫下载整站内容，又不想配置heritrix之类的复杂爬虫，可以选择WebCollector。项目在github上持续更新。

github源码地址：https://github.com/CrawlScript/WebCollector

github下载地址：http://crawlscript.github.io/WebCollector/

运行方式：

1.解压从http://crawlscript.github.io/WebCollector/ 页面下载的压缩包。

2.解压后找到webcollector-版本号-bin.zip,解压。

3.如果是windows，双击里面的start.bat，如果是linux，用命令行进入文件夹，执行sh start.sh

返回

【上篇】JAVA爬虫WebCollector教程列表 WebCollector入门教程（中文版）用WebCollector对指定URL进行爬取和解析用WebCollector进行二次开发，定制自己的爬虫JAVA爬虫Nutch、WebCollector的正则约束用WebCollector制作一个爬取《知乎》并进行问题精准抽取的爬虫（JAVA）用WebCollector爬取新浪微博利用WebCollector爬虫内核定制自己的爬虫——任务生成器Generator利用WebCollector爬虫内核定制自己的爬虫——抓取器Fetcher
【下篇】java常用代码三（粘贴即用）—获取html源码

作者: bountiful

该日志由 bountiful 于6年前发表在综合分类下，最后更新于 2017年12月21日.
转载请注明: JAVA开源爬虫，WebCollector,简单易用，有界面。 | 学步园 +复制链接

抱歉!评论已关闭.

返回首页

Copyright © 2013-2018 学步园保留所有权利.
软文销售 QQ客服：2265327166

点击这里给我发消息

（其他合作也可洽谈）