Python3爬虫（五）解析库的使用之XPath

Infi-chu:

http://www.cnblogs.com/Infi-chu/

XPath：

全称是 XML Path Language，XML路径语言，它是一门在XML文档中和HTML文档中查找信息的语言

1.XPath常用规则

表达式　　　　描述

nodename　　选取此节点的所有子节点

/　　　　　　从当前节点选取直接子节点

//　　　　　　从当前节点选取子孙节点

.　　　　　　选取当前节点

..　　　　　　选取当前节点的父节点

@ 　　　　　选取属性

2.准备工作：安装 lxml 库

3.例子：

from lxml import etree

text =

'''

<div>

<ul>

<li class="ex1"><a href="ex1.html">ex1</a></li>

<li class="ex2"><a href="ex2.html">ex2</a>

</ul>

</div>

'''

html = etree.HTML(text)    # 调用HTML类进行html初始化工作

r = etree.tostring(html)     # 修复HTML代码，补全其他选项

print(r.decode('utf-8'))       # 结果返回是bytes，我们将其转化成UTF-8

4.所有节点

选取所有节点：

from lxml import etree

html = etree.parse('./test.html',etree.HTMLParser())

res = html.xpath('//*')    # 选取所有

print(res)

5.子节点

选取li节点的所有直接a子节点：

from lxml import etree

html = etree.parse('./test.html',etree.HTMLParser())

res = html.xpath('//li/a')

print(res)

6.父节点

使用.和..

7.属性匹配

from lxml import etree

html = etree.parse('./test.html',etree.HTMLParser())

res = html.xpath('//li[@class='ex1']')

print(res)

8.文本属性

选取li节点的内部文本，两种方法，推荐第二种

from lxml import etree

html = etree.parse('./test.html',etree.HTMLParser())

res = html.xpath('//li[@class='ex1']/a/text()')

print(res)

b.推荐，信息更全

from lxml import etree

html = etree.parse('./test.html',etree.HTMLParser())

res = html.xpath('//li[@class="ex1"]//text()')

print(res)

9.属性获取

获取所有li节点下所有a节点的href属性

from lxml import etree

html = etree.parse('./test.html',etree.HTMLParser())

res = html.xpath('//li/a/@href')

print(res)

10.属性多值匹配

from lxml import etree

text =

'''

<div>

<ul>

<li class="li li-first"><a href="ex1.html">li1</a></li>

</ul>

</div>

'''

html = etree.HTML(text)

res = html.xpath('//li[contains(@class,"li")]/a/text()')

print(res)

【注】

contains()中，

第一个参数传入属性名称，第二个参数传入属性值

11.多属性匹配

根据多个属性确定一个节点

from lxml import etree

text =

'''

<div>

<ul>

<li class="li" name="123"><a href="ex1.html">ex1</a></li>

</ul>

</div>

'''

html = etree.HTML(text)

res = html.xpath('//li[@contains(@class,"li") and @name="123"]/a/text()')

print(res)

12.按序选择（多个节点）

from lxml import etree

text =

'''

<div>

<ul>

<li class="ex1"><a href="ex1.html">ex1</a></li>

<li class="ex2"><a href="ex2.html">ex2</a></li>

<li class="ex3"><a href="ex3.html">ex3</a></li>

</ul>

</div>

'''

html = etree.HTML(text)

res = html.xpath('//li[1]/a/text()')    # 第一个li

res = html.xpath('//li[last()]/a/text()')    #  最后一个li

res = html.xpath('//li[position()<3]/a/text()')    # 前两个li

res = html.xpath('//li[last()-2]/a/text()')    # 第一个li

【注】

序号从1开始

13.节点轴选择

from lxml import etree

text =

'''

<div>

<ul>

<li class="ex1"><a href="ex1.html">ex1</a></li>

<li class="ex2"><a href="ex2.html">ex2</a></li>

<li class="ex3"><a href="ex3.html">ex3</a></li>

</ul>

</div>

'''

html = etree.HTML(text)

res = html.xpath('//li[1]/ancestor::*')    # 获取祖先节点

res = html.xpath('//li[1]/ancestor::div')    # 获取祖先div节点

res = html.xpath('//li[1]/attribute::*')    # 所有属性值

res = html.xpath('//li[1]/child::a[href="ex1.html"]')    # 所有直接子节点

res = html.xpath('//li[1]/descendant::span')    # 所有子孙节点

res = html.xpath('//li[1]/following::*[2]')    # 当前节点之后的所有节点

res = html.xpath('//li[1]/following-sibling::*')    # 当前节点之后的所有同级节点

　【注】这些都是轴

ancestor、attribute、child、descendant、following、following-sibling

Python3爬虫（五）解析库的使用之XPath的更多相关文章

【XPath Helper：chrome爬虫网页解析工具 Chrome插件】XPath Helper：chrome爬虫网页解析工具 Chrome插件下载_教程_安装 - 开发者插件 - Chrome插件网
[XPath Helper:chrome爬虫网页解析工具 Chrome插件]XPath Helper:chrome爬虫网页解析工具 Chrome插件下载_教程_安装 - 开发者插件 - Chrome插 ...
Python爬虫【解析库之beautifulsoup】
解析库的安装 pip3 install beautifulsoup4 初始化 BeautifulSoup(str,"解析库") from bs4 import BeautifulS ...
Python爬虫【解析库之pyquery】
该库跟jQuery的使用方法基本一样 http://pyquery.readthedocs.io/ 官方文档解析库的安装 pip3 install pyquery 初始化 1.字符串初始化 htm ...
python爬虫三大解析库之XPath解析库通俗易懂详讲
目录使用XPath解析库 @(这里写自定义目录标题) 使用XPath解析库 1.简介 XPath(全称XML Path Languang),即XML路径语言,是一种在XML文档中查找信息的语言. ...
爬虫之解析库-----re、beautifulsoup、pyquery
一.介绍 Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式.Beautiful Soup会帮你 ...
python3爬虫之Urllib库（一）
上一篇我简单说了说爬虫的原理,这一篇我们来讲讲python自带的请求库:urllib 在python2里边,用urllib库和urllib2库来实现请求的发送,但是在python3种在也不用那么麻烦了 ...
python爬虫之解析库Beautiful Soup
为何要用Beautiful Soup Beautiful Soup是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式, 是一个 ...
python3爬虫之Urllib库（二）
在上一篇文章中,我们大概讲了一下urllib库中最重要的两个请求方法:urlopen() 和 Request() 但是仅仅凭借那两个方法无法执行一些更高级的请求,如Cookies处理,代理设置等等 ...
python爬虫之解析库正则表达式
上次说到了requests库的获取,然而这只是开始,你获取了网页的源代码,但是这并不是我们的目的,我们的目的是解析链接里面的信息,比如各种属性 @href @class span 抑或是p节点里 ...

随机推荐

laravel + haproxy + https 后生成分页 url 非 https 解决办法
更合适的解决办法:在 AppServiceProvider boot 方法中使用 \URL::forceScheme('https'); 即可. 背景近日对所有的客户都上线了 https ,本来在 ...
April 2 2017 Week 14 Sunday
You only live once, but if you do it right, once is enough. 人生只有一次,但如果活对了,一次也就够了. Maybe I am going t ...
如何在ubuntu上安装virtualbox的driver module vboxdrv
干净的ubuntu安装完毕之后是没有vboxdrv这个driver module的. 新建一个folder jerry_virtualbox: 使用wget下载virtualbox安装包:https: ...
JVM文章学习
JVM 文章 Java虚拟机学习 - 体系结构内存模型http://blog.csdn.net/java2000_wl/article/details/8009362 Java虚拟机学习 - 对象 ...
MySQL：数据库入门篇1
1,什么是数据库?——存储数据的仓库数据库技术是计算机应用领域中非常重要的技术,它产生于20世纪60年代末,是数据管理的最新技术,也是软件技术的一个重要分支. 简单的说,数据库就是一个存放数据的仓库 ...
【[SCOI2010]生成字符串】
\(n=m\)时候经典的卡特兰那\(n!=m\)呢,还是按照卡特兰的方式来推首先总情况数就是\(\binom{n+m}{n}\),在\(n+m\)个里选择\(n\)个\(1\) 显然有不合法的情况 ...
kiwi installation
Mainly the installstion methods follow the url: https://github.com/emolch/kiwi/wiki/Installation the ...
（第四场）G Maximum Mode 【YY+暴力】
链接:https://www.nowcoder.com/acm/contest/142/G 来源:牛客网题目描述 The mode of an integer sequence is the val ...
[18/11/29] 继承(extends)和方法的重写(override，不是重载)
一.何为继承?(对原有类的扩充) 继承让我们更加容易实现类的扩展. 比如,我们定义了人类,再定义Boy类就只需要扩展人类即可.实现了代码的重用,不用再重新发明轮子(don’t reinvent w ...
GPU CUDA编程中threadIdx, blockIdx, blockDim, gridDim之间的区别与联系
前期写代码的时候都会困惑这个实际的threadIdx(tid,实际的线程id)到底是多少,自己写出来的对不对,今天经过自己一些小例子的推敲,以及找到官网的相关介绍,总算自己弄清楚了. 在启动kerne ...

Python3爬虫（五）解析库的使用之XPath

Python3爬虫（五）解析库的使用之XPath的更多相关文章

随机推荐

热门专题