最近要抓取 别的网页的信息, 找了一些相关的信息:
jsoup
网站:http://jsoup.org/
jsoup 是一款 Java 的HTML 解析器,可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API,可通过DOM,CSS以及类似于JQuery的操作方法来取出和操作数据。
jsoup的主要功能如下:
- 从一个URL,文件或字符串中解析HTML;
- 使用DOM或CSS选择器来查找、取出数据;
- 可操作HTML元素、属性、文本;
EXample:
Document doc = Jsoup.connect("http://en.wikipedia.org/").get();
Elements newsHeadlines = doc.select("#mp-itn b a");
Document doc = Jsoup.connect("http://jsoup.org").get();
Element link = doc.select("a").first();
String relHref = link.attr("href"); // == "/"
String absHref = link.attr("abs:href"); // "http://jsoup.org/"
HtmlParser
网站:http://htmlparser.sourceforge.net/
HTML Parser 是一个对HTML进行分析的快速实时的解析器
NekoHTML
http://nekohtml.sourceforge.net/
NekoHTML是一个Java语言的 HTML扫描器和标签补全器(tag balancer) ,使得程序能解析HTML文档并用标准的XML接口来访问其中的信息
分享到:
相关推荐
Delphi通过MSHTML实现一个HTML解析类,delphi7可用,快速解析html代码
html解析,轻量级html解析,不希望大家下载,我自己的备份 下下来也有密码,解压不了的
一个c语言的html解析 简单易用只有30多行左右 使用vs2010编译 适合初学者使用
C# HTMLParser HTML解析类库(含Demo,手册)
html解析器,进行网页源代码分析,分门别类的列出脚本文件、超链接等,能有效帮助防止恶意代码
C++版HTML解析器,能生成dom tree,也能SAX方式解析
C语言 HTML解析器 Gumbo 已编译好的Example,源文件请自行至Gumbo官网下载。本文件只支持linux系统。Windows请自行编译。
htmlcleaner html解析器htmlcleaner html解析器
jsoup 是一款 Java 的HTML 解析器,可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API,可通过DOM,CSS以及类似于JQuery的操作方法来取出和操作数据。 jsoup的主要功能如下: 从一个URL,文件或...
MSHTML最好用的HTML解析程序,最好用的HTMLParser,比HtmlAgilityPack好用一万倍
html解析为xml html解析为xml html解析为xml html解析为xml html解析为xml
XML/HTML解析器(Swift).zip,Ji (戟) is an XML/HTML parser for Swift
基于java的开发源码-HTML解析器 jsoup.zip 基于java的开发源码-HTML解析器 jsoup.zip 基于java的开发源码-HTML解析器 jsoup.zip 基于java的开发源码-HTML解析器 jsoup.zip 基于java的开发源码-HTML解析器 jsoup.zip ...
jsoup:Java HTML 解析器 jsoup是一个用于处理现实世界 HTML 的 Java 库。它使用最好的 HTML5 DOM 方法和 CSS 选择器,提供了一个非常方便的 API,用于获取 URL 以及提取和操作数据。 jsoup实现了WHATWG HTML5规范...
Html解析工具源码,可用于网络爬虫的解析过程
纯Java写的html解析类,解析为自上而下顺序解析。解析效率一般,不支持js,可以满足日常使用。
jsoup Java HTML解析器 jsoup Java HTML解析器 jsoup Java HTML解析器 jsoup Java HTML解析器 jsoup Java HTML解析器
跨平台的Html解析代码_武稀松_HtmlParser.rar
HtmlAgilityPack是.net下的一个HTML解析类库。支持用XPath来解析HTML。这个意义不小,为什么呢?因为对于页面上的元素的xpath某些强大的浏览器能够直接获取得到,并不需要手动写。节约了大半写正则表达式的时间,...