六狼论坛

 找回密码
 立即注册

QQ登录

只需一步,快速开始

新浪微博账号登陆

只需一步,快速开始

搜索
查看: 42|回复: 0

htmlparser获取网页上所有有用链接的方法

[复制链接]

升级  32%

90

主题

90

主题

90

主题

举人

Rank: 3Rank: 3

积分
296
 楼主| 发表于 2013-2-7 15:12:11 | 显示全部楼层 |阅读模式
public static void getAllLink(String html, String parentUrl) {Parser parser = new Parser();try {parser.setInputHTML(html);NodeFilter filter = new NodeClassFilter(LinkTag.class);NodeList nodes = parser.parse(filter);for (Node node : nodes.toNodeArray()) {LinkTag linkTag = (LinkTag) node;String link = linkTag.getLink().trim();// 过滤,过滤方法可以添加,比如在增加只爬去本域名或本主机名下的网站等等if (!"".equals(link)) {//处理一下那些不是以“http://”开头的url,比如以"/html/....或 html/...."开头的URI uri = new URI(parentUrl);URI _uri = new URI(uri, link);String newUrl = _uri.toString();urls.add(link);}}} catch (ParserException e) {throw new RuntimeException("htmlparser解析html文件时异常" + e);} catch (URIException e) {e.printStackTrace();}}
您需要登录后才可以回帖 登录 | 立即注册 新浪微博账号登陆

本版积分规则

快速回复 返回顶部 返回列表