[java] jsoup使用简介-汇率换算器实现-插曲2
[java] jsoup使用简介-汇率换算器实现-插曲2
[java] jsoup使用简介-汇率换算器实现-插曲2
Table of Contents
2 更多参考资料
3 解释遍历一个html文档和html字符串
传送门 http://www.open-open.com/jsoup/parsing-a-document.htm http://www.open-open.com/jsoup/parse-document-from-string.htm
原文中给出的例子如下:
String html = "<html><head><title>First parse</title></head>"
+ "<body><p>Parsed HTML into a doc.</p></body></html>";
Document doc = Jsoup.parse(html);
单单这个示例, 就引出了以下问题:
- 能够直接运行吗?
- 直接输出Document的结果?
3.1 运行环境设置及运行
下载jsoup.jar包, 将其放置到yourpath, 编写代码的时候具体import的内容, 应该根据jsoup的tree 进行import, 如上面的例子中使用了 Jsoup 和 Document, 那么在文件的开头就应该有这样两句话:
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
剩下的完整的内容如下:
// 再简单地将示例放入main函数中
public class JsoupDemo{
public static void main(String[] args)
throws Exception {
// Document doc = Jsoup.connect("http://en.wikipedia.org/").get();
String html = "<html><head><title>First parse</title><head>"
+ "<body><p>Parsed Html into a doc.</p></body></html>";
Document doc = Jsoup.parse(html);
System.out.println(doc);
}
}
3.2 直接输出Document
编译运行如下(linux):
javac -classpath yourpath/jsoup.jar JsoupDemo.java
java -cp yourpath/jsoup.jar:./ JsoupDemo
最后可以发现通过parse处理后输出地结果为格式化后的html代码:
<html>
<head>
<title>First parse</title>
</head>
<body>
<p>Parsed Html into a doc.</p>
</body>
</html>
3.3 parse(String html, String baseUri)中baseUri具体指什么
如在html中出现了相对路径, 如 href="page/a.html", 那么就会被解析为 href="$baseUri/page/a.html" 如将示例进行修改为:
String html = "<html><head><title><a href=\"/page/a.html\">标题</a></title></head></html>"
然后调用:
Document doc = Jsoup.parse(html, "http://example.com/");
最后输出的doc依然和String html相同. 那么这个额外的baseUri是怎么起作用的呢. google了一下, 参见: stackoverflow中的解释 , 可见需要下述的方式才能够起作用:
for (Element link : doc.select("a")) {
System.out.println(link.absUrl("href"));
}
4 解释一个body片断
传送门 http://www.open-open.com/jsoup/parse-body-fragment.htm
Jsoup.parseBodyFragment 方法可以将字符串中的<html><head>标签忽略, 剩下的内容都为body部份. 可以将示例中的String html改为下面的方式, 并比较两者之间不同的输出结果:
String html = "<html><head><title>what</title></head><body><div><p>Lorem ipsum.</p></body></html>";
5 从一个URL, 文件加载一个Document对象
传送门 http://www.open-open.com/jsoup/load-document-from-url.htm http://www.open-open.com/jsoup/load-document-from-file.htm
通过以下尝试, 得知Jsoup在connect过程中, 已经对html文档的相应的编码方式进行了处理:
Document doc = Jsoup.connect("http://www.baidu.com/").get();
System.out.println(doc)
6 其他更多文档中的内容请参见
7 其中常用的数据结构简介
7.1 Element
html的element包括形如: <tag attribute="" id="" class="">text</tag> 的部份.
常用的方法有:
- attr: 获得相应属性的内容
- getElementsBy{many different kinds}: 获取不同类型的集合
- text: 获取这个元素以及子集所包含的文本
- 其他参见: http://jsoup.org/apidocs/org/jsoup/nodes/Element.html
7.2 Elements
表示结构相同的element的集合
常用的方法:
- 对element进行遍历:
Elements eles = ...;
for (Element ele : eles) {} 对elements进行遍历 - select: 选择相应结构的elements
- get: 获取特定index的element
- 其他参见: http://jsoup.org/apidocs/org/jsoup/select/Elements.html
Date: 2014-05-14 Wed
Author: Zhong Xiewei
Org version 7.8.11 with Emacs version 24
[java] jsoup使用简介-汇率换算器实现-插曲2的更多相关文章
- [java] 注释以及javadoc使用简介-汇率换算器的实现-插曲3
[java] 注释以及javadoc使用简介-汇率换算器的实现-插曲3 // */ // ]]> [java] 注释以及javadoc使用简介-汇率换算器的实现-插曲3 Table of C ...
- [java] 汇率换算器实现-插曲1-正则表达式(1)
[java] 汇率换算器实现-插曲1-正则表达式(1) // */ // ]]> // */ // ]]> [java] 汇率换算器实现-插曲1-正则表达式(1) Table of C ...
- [java] 更好的书写equals方法-汇率换算器的实现(4)
[java] 更好的书写equals方法-汇率换算器的实现(4) // */ // ]]> [java] 更好的书写equals方法-汇率换算器的实现(4) Table of Content ...
- [java] 汇率换算器实现(3)
[java] 汇率换算器实现(3) // */ // ]]> [java] 汇率换算器实现(3) Table of Contents 1 系列文章地址 2 前言 3 提取简单表单信息 3.1 ...
- [java] 汇率换算器实现(2)
[java] 汇率换算器实现(2) // */ // ]]> // */ // ]]> [java] 汇率换算器实现(2) Table of Contents 1 系列文章地址 2 前 ...
- [java] 汇率换算器实现(1)
[java] 汇率换算器实现(1) // */ // ]]> [java] 汇率换算器实现(1) Table of Contents 1 问题描述 2 类设计 3 初步实现 3.1 建立项目 ...
- 【菜鸟学Python】案例一:汇率换算
汇率换算V1.0 案例描述: 设计一个汇率换算器程序,其功能是将外币换算成人民币,或者相反 案例分析: 分析问题:分析问题的计算部分: 确定问题:将问题划分为输入.处理及输出部分: 设计算法:计算部分 ...
- 汇率换算自然语言理解功能JAVA DEMO
>>>>>>>>>>>>>>>>>>>>>>>> 欢迎转 ...
- 万航单位换算器 V1.0 绿色版
软件名称: 万航单位换算器软件语言: 简体中文授权方式: 免费软件运行环境: Win 32位/64位软件大小: 347KB图片预览: 软件简介:万航单位换算器是一个可以随意转换单位的绿色软件,这个软件 ...
随机推荐
- PPC MPC85xx e500学习笔记
powerpc的内存体系结构 E500内核中包含内存管理单元MMU,其包含两个查找表(TLB0 Transaction Lookside Buffer)和TLB1来实现虚拟地址和物理地址的转化,其中T ...
- html+css实现简易下拉菜单
<!DOCTYPE html> <html> <head> <style> div { width:100px; height:40px; overfl ...
- IOS 获取当前对象所在的VC
id next = [self nextResponder] ; while (next != nil) { next = [next nextResponder]; if ([next isKind ...
- FUND
The Shaanxi Natural Science Plan Project of China Grant NO.: 2014JM8322
- iOS 删除已经配置的类库和移除CocoaPods
引言 我们使用CocoaPods非常高效地将一些第三方类库导入到我们的项目中,但是不由得产生一个疑问:如果发现某个类库不适用,甚至是整个CocoaPods我们都不想再在项目中持有,那么我们要怎么把这些 ...
- 解剖SQLSERVER 第七篇 OrcaMDF 特性概述(译)
解剖SQLSERVER 第七篇 OrcaMDF 特性概述(译) http://improve.dk/orcamdf-feature-recap/ 时间过得真快,这已经过了大概四个月了自从我最初介绍我 ...
- mongoDB研究笔记:复制集概述
自我学习,仅供参考: 数据库总是会遇到各种失败的场景,如网络连接断开.断电等,尽管journaling日志功能也提供了数据恢复的功能,但journaling通常是针对单个节点来说的,只能保证单节点数据 ...
- 负载均衡的mariadb集群搭建
集群介绍: Galera是一个MySQL(也支持MariaDB,Percona)的同步多主集群软件,目前只支持InnoDB引擎. 主要功能: 同步复制 真正的multi-master,即所有节点可以同 ...
- ASP.Net MVC的ViewBag一个坑,不要跳进去
如鹏的学习管理系统是使用ASP.net MVC 5开发的,今天一个新版本发布后网站出现一个Bug,学生在下拉列表中选中的项再加载显示的时候发现仍然没被选中.详细一点说吧:假如有这样一个Action: ...
- 介绍Oedis - Redis OH/RM
作死造轮子 Oedis是近段时间为了解决日志型数据如何与Entity Framework的查询整合的问题写的一个Redis的OH /RM.虽然Redis出来蛮久了,各路高手也都提出了实践方案,但是或许 ...