现在的位置: 首页 > 综合 > 正文

JAVA分析html算法(JAVA网页蜘蛛算法)

2013年08月30日 ⁄ 综合 ⁄ 共 2390字 ⁄ 字号 评论关闭

   近来有些朋友在做蜘蛛算法,或者在网页上面做深度的数据挖掘。但是遇到复杂而繁琐的html页面大家都望而却步。因为很难获取到相应的数据。

   最古老的办法的是尝试用正则表达式,估计那么繁琐的东西得不偿失,浪费我们宝贵的时间。

   第二个办法用开源组织htmlparser的包,这个是一个比较老的项目,但是效果估计不是很好,好像不可以深入分析html,只能分析5级的结构;

   我这里有个htmlparser的源代码,可以获取所有的超链接的

  

 

   第三个办法,也是我现在一直在用的办法,首先把html清理为xml,然后用java解析xml获取数据,现在上传一个java clean html的源代码:

   

 

  以上代码大家一起分享,有什么看法,大家要提出沟通。希望以上代码有助于大家开发一个数据挖掘程序。 

抱歉!评论已关闭.