CrawlScript语言轻松实现网络爬虫——轻松爬取整站信息

现在的位置: 首页 > 综合 > 正文

2018年04月10日 ⁄ 综合 ⁄ 共 536字 ⁄ 字号小中大 ⁄ 评论关闭

CrawlScript语言在beta0.3版本中集成了整站爬虫的功能，只需要简单几句，就可以完成对整站的爬取。

首先下载CrawlScript beta 0.3:
CrawlScript beta 0.3版及demo下载。

下载后解压，在CrawlScript-bin文件夹中有一个demo.js，这个代码虽然只有几行，但是实现了对整个新华网的新闻正文的爬取和抽取，一个完整的网络爬虫。

运行方式：用命令行进入CrawlScript-bin文件夹，输入命令：

java -jar crawlscript.jar demo.js

爬虫的启动可能需要半分钟（这是因为这里的爬虫是允许在中断后继续爬取的，所以需要预处理很多信息）。然后就会发现不断刷新新信息。查看CrawlScript-bin下的download文件夹，会发现新华网的新闻在不断地加入：

想了解更多，加入QQ讨论群或者发邮件咨询：

      CrawlScript爬虫脚本语言官方QQ群：250108697
      CrawlScript爬虫脚本语言官方邮箱：briefcopy@126.com
      注：CrawlScript是开源软件，不会向您索要任何费用。

抱歉!评论已关闭.

返回首页

（其他合作也可洽谈）