Jsoup使用教程

一、解析和遍历一个HTML文档
1、解析Html及Url链接

 String html = "<html><head><title>First parse</title></head>"

   + "<body><p>Parsed HTML into a doc.</p></body></html>";

 Document doc = Jsoup.parse(html);//解析html文档

 Document doc = Jsoup.connect("http://example.com/").get();//解析Url链接地址

 String title = doc.title();

2、解析body片段

 String html = "<div><p>Lorem ipsum.</p>";

 Document doc = Jsoup.parseBodyFragment(html);

 Element body = doc.body();

parseBodyFragment 方法创建一个空壳的文档，并插入解析过的HTML到body元素中。假如你使用正常的 Jsoup.parse(String html) 方法，通常你也可以得到相同的结果，但是明确将用户输入作为 body片段处理，以确保用户所提供的任何糟糕的HTML都将被解析成body元素。
Document.body() 方法能够取得文档body元素的所有子元素，与 doc.getElementsByTag("body")相同

3、使用Dom获取元素

查找元素

4、从元素抽取属性，文本和HTML

 String html = "<p>An <a href='http://example.com/'><b>example</b></a> link.</p>";

 Document doc = Jsoup.parse(html);//解析HTML字符串返回一个Document实现

 Element link = doc.select("a").first();//查找第一个a元素

 String text = doc.body().text(); // "An example link"//取得字符串中的文本

 String linkHref = link.attr("href"); // "http://example.com/"//取得链接地址

 String linkText = link.text(); // "example""//取得链接地址中的文本

 String linkOuterH = link.outerHtml();

     // "<a href="http://example.com"><b>example</b></a>"

 String linkInnerH = link.html(); // "<b>example</b>"//取得链接内的html内容

二、与百度链接在一起

如何设置百度搜索结果显示更多条数
【必备参数】:

　　wd——查询的关键词(Keyword)

　　pn——显示结果的页数(Page Number)

　　cl——搜索类型(Class),cl=3为网页搜索

　　【可选参数】:

　　rn——搜索结果显示条数(Record Number),取值范围在10--100条之间,缺省设置rn=10

Jsoup使用教程的更多相关文章

Jsoup 使用教程：数据抽取
1.使用DOM方法来遍历一个文档问题你有一个HTML文档要从中提取数据,并了解这个HTML文档的结构. 方法将HTML解析成一个Document之后,就可以使用类似于DOM的方法进行操作.示例代 ...
Jsoup 使用教程：输入
使用背景: 使用网络爬虫(或者手动复制),从别的网站上下载下来的内容,都是一堆的html,很多标签.样式等等都可能是你所不需要的,或者想要变成你想要的样式.那么该怎么办呢? 我们知道,每一个网页都 ...
Jsoup教程jsoup开发指南,jsoup中文使用手册,jsoup中文文档
jsoup 是一款Java 的HTML解析器,可直接解析某个URL地址.HTML文本内容.它提供了一套非常省力的API,可通过DOM,CSS以及类似于jQuery的操作方法来取出和操作数据. jsou ...
Jsoup教程,jsoup开发指南,jsoup中文使用手册,jsoup中文文档
jsoup 是一款Java 的HTML解析器,可直接解析某个URL地址.HTML文本内容.它提供了一套非常省力的API,可通过DOM,CSS以及类似于jQuery的操作方法来取出和操作数据. jsou ...
Java上的jQuery？解析HTML利器—Jsoup
也许大家有过在java运行平台上解析html的经历,通常的方式是将HTML以XML的形式进行结点解析,调用java本身的xml解析类库.这样的方式很容易理解并且很方便,但习惯用jQuery的各位是否在 ...
JAVA爬虫 WebCollector
JAVA爬虫 WebCollector 爬虫简介: WebCollector是一个无须配置.便于二次开发的JAVA爬虫框架(内核),它提供精简的的API,只需少量代码即可实现一个功能强大的爬虫. 爬虫 ...
用WebCollector制作一个爬取《知乎》并进行问题精准抽取的爬虫（JAVA）
简单介绍: WebCollector是一个无须配置.便于二次开发的JAVA爬虫框架(内核),它提供精简的的API.仅仅需少量代码就可以实现一个功能强大的爬虫. 怎样将WebCollector导入项目请 ...
[web开发] Vue+Spring Boot 上海大学预约系统开发记录
前端界面使用Quasar将组件都排好,用好css. Quasar 入门 # 确保你在全局安装了vue-cli # Node.js> = 8.9.0是必需的. $ npm install -g ...
C# 从需要登录的网站上抓取数据
[转] C# 从需要登录的网站上抓取数据背景:昨天一个学金融的同学让我帮她从一个网站上抓取数据,然后导出到excel,粗略看了下有1000+条记录,人工统计的话确实不可能.虽说不会,但作为一个学计算 ...

随机推荐

创建zend framework 项目要注意的
1.必须要设置变量环境我的电脑右击-属性-高级-环境变量则在环境变量中添加变量名:PATH 环境值:D:\phpserver\php5.4;D:\ZendFramework\bin 把php.e ...
jquery 展开关闭效果
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/ ...
求n!末尾0的个数
题目连接 /* £:离散数学. £:n!中2的个数>5的个数. £:2*5=10: */ #include<cstdio> #include<cstring> #incl ...
FRP 浅析
一.Reactive? 请先看一个非常简单的小应用,它允许用户在一个搜索输入框里输入关键词,然后在其下方的结果区域实时显示从Flicker网站搜索得到的图片,当用户输入的关键词发生变化,显示的图片也会 ...
GenericApp SampleApp SimpleAp的区别
SampleApp3.2 Zigbee2007 协议栈实验例程表演说明C:\Texas Instruments\ZStack-2.0.0-1.2.0\Projects\zstack\Samples\S ...
Kyoto Cabinet--nosql型单机数据库
摘要: Kyoto Cabinet是轻量级nosql型本地内存数据库简介 Kyoto Cabinet是一个数据库管理的 lib,是 Tokyo Cabinet 的改进版本.数据库是一个简单的包含记录 ...
Entity Framework 学习初级篇5--ObjectQuery查询及方法
ObjectQuery 类支持对实体数据模型 (EDM) 执行 LINQ to Entities 和 Entity SQL 查询.ObjectQuery 还实现了一组查询生成器方法,这些方法可用于按 ...
Android音乐编程:管理音频焦点
Android 系统保持相互独立的音频流通道来播放音乐,报警,通知,来电铃声,系统声音,呼叫(通话)音量,和 DTMF 音调(键盘拨号).这样做主要是为了使用户能够独立地控制每个流的音量. AD: h ...
access restriction
一.既然存在访问规则,那么修改访问规则即可.打开项目的Build Path Configuration页面,打开报错的JAR包,选中Access rules条目,选择右侧的编辑按钮,添加一个访问规则即 ...
数据的软删除-管理员的CRUD
数据的“软删除”---把数据真正删除在某些时候会有问题.IsDeleted字段,false表示不删除,而是让用户可以看到,true表示是软删除,用户看不到. 一个表引用另外一张表的时候一定要引用主键. ...

Jsoup使用教程

查找元素

如何设置百度搜索结果显示更多条数【必备参数】:

Jsoup使用教程的更多相关文章

随机推荐

热门专题

如何设置百度搜索结果显示更多条数
【必备参数】: