XPath是一种在XML文档中查找信息的语言,使用路径表达式在XML文档中进行导航。学习XPath需要对XML和HTML有基本的了解。

在XPath中,有七种类型的节点:文档(根)节点、元素、属性、文本、命名空间、处理指令、注释,XML 文档是被作为节点树来对待的,树的根被称为文档节点或者根节点。

<?xml version="1.0" encoding="UTF-8"?>
<bookstore> <!--bookstore为根节点-->
<book> <!--book为元素节点-->
<title lang="en">Harry Potter</title> <!--lang="en"为属性节点-->
<author>J K. Rowling</author> <!--K. Rowling为文本节点-->
<year>2005</year>
<price>29.99</price>
</book>
<book category="COOKING">
<title lang="en">Everyday Italian</title>
<author>Giada De Laurentiis</author>
<year>2005</year>
<price>30.00</price>
</book>
</bookstore>

requests基本用法

使用requests可获取网页的源代码,需要先安装这个模块pip3 install requests

import requests

req = requests.get(url)  #req为<Response [200]>,req.text为整个网页源代码

XPath的基本使用方法:

要使用XPath,需要安装一个第三方库lxml,直接在cmd命令窗口中通过pip3 install lxml即可。

from lxml import etree       #导入lxml模块的etree

selector = etree.HTML(源码)    #将源码转化为能被XPath匹配的格式

info1 = selector.xpath("//标签1[@属性1='值1']/标签2[@属性2='值2']/.../标签n[@属性n='值n'] ")   #返回匹配到的元素节点,类型为列表

info2 = selector.xpath("//标签1[@属性1='值1']/标签2[@属性2='值2']/.../text()")    #返回匹配到的元素节点的文本值,类型为列表

info3 = selector.xpath("//标签1[@属性1='值1']/标签2[@属性2='值2']/.../@属性x")    #返回匹配到的元素节点的x属性值,类型为列表

基本节点选取方式

通过nodename选取返回的列表的每一个元素为元素节点,类型为class 'lxml.etree._Element'对象,最后一个元素名称不能再加/否则会报错。

text()和@attrname则可以直接获取到元素节点的文本值和属性值。

selector = etree.HTML(source)                        #source为上述bookstore所在的整个代码块
title_ele = selector.xpath('//book/title') #返回title元素节点对象
title_text = selector.xpath('//book/title/text()') #返回title元素节点的文本
title_attr = selector.xpath('//book/title/@lang') #返回title元素节点的lang属性值
print(title_ele[0],type(title_ele[0]))
print(title_text[0],type(title_text[0]))
print(title_attr[0],type(title_attr[0]))
# <Element title at 0x298d540ffc8> <class 'lxml.etree._Element'>
# Harry Potter <class 'lxml.etree._ElementUnicodeResult'>
# en <class 'lxml.etree._ElementUnicodeResult'>

获取元素的文本值,除了在匹配规则中直接通过/text(),也可以获取到元素对象再通过对象.text来获取,以下两种方式等价。

title1 = selector.xpath('//book/title/text()')
title2 =list( map(lambda x:x.text,selector.xpath('//book/title') ) )

除了上述基本的选取方法之外,还可以按条件进行选取,条件都放在节点名称的方括号[ ]内

限定位置选取

i1 = selector.xpath('//book[1]/title/text()')             #book元素的第一个元素(注意不是从0开始)
i2 = selector.xpath('//book[last()]/title/text()') #book元素的最后一个元素
i3 = selector.xpath('//book[last()-1]/title/text()') #book元素的倒数第二个元素
i4 = selector.xpath('//book[position()<3]/title/text()') #book元素的前2个元素

限定属性选取,属性前面需加@标识

i5 = selector.xpath('//book[@class="story"]/title/text()')               #class属性为story的book元素
i6 = selector.xpath('//book[@category="COOKING"]/title/text()') #category属性为COOKING的book元素
i7 = selector.xpath('//book[@category]/title/text()') #有category属性的book元素
i8 = selector.xpath('//book[starts-with(@category,"ch")]/title/text()') #category属性以ch开头的book元素,没有ends-with方法
i9 = selector.xpath('//book[contains(@category,"oo")]/title/text()') #category属性包含oo的book元素

限定文本值选取

i10 = selector.xpath('//book[price>30]/title/text()')               #price的文本值大于30的book元素
i11 = selector.xpath('//book[contains(title,"day")]/title/text()') #title的文本值包含day的book元素

| 同时按多个匹配规则进行选取

i12 = selecotr.xpath('//book/title/text() | //book/@category')  #同时获取book元素的title元素文本值和category属性值

通配符 *

i13 = selector.xpath('//book/*')        #book元素下的所有直接子元素
i14 = selector.xpath('//book/title[@+]') #book元素下有属性的title元素

python xpath的基本用法的更多相关文章

  1. Python Xpath语法

    Python    Xpath语法   一.选取节点 常用的路劲表达式: 表达式 描述 实例   nodename 选取nodename节点的所有子节点 xpath('//div') 选取了div节点 ...

  2. 使用python+xpath 获取https://pypi.python.org/pypi/lxml/2.3/的下载链接

    使用python+xpath 获取https://pypi.python.org/pypi/lxml/2.3/的下载链接: 使用requests获取html后,分析html中的标签发现所需要的链接在& ...

  3. python 中del 的用法

    python中的del用法比较特殊,新手学习往往产生误解,弄清del的用法,可以帮助深入理解python的内存方面的问题. python的del不同于C的free和C++的delete. 由于pyth ...

  4. Python多进程并发(multiprocessing)用法实例详解

    http://www.jb51.net/article/67116.htm 本文实例讲述了Python多进程并发(multiprocessing)用法.分享给大家供大家参考.具体分析如下: 由于Pyt ...

  5. xpath的一般用法与特殊用法

    # xpath的使用 安装lxml from lxml import etree Selector = etree.HTML(网页代码) Selector.xpath(一段神奇的代码) xpath的一 ...

  6. Python dictionary 字典 常用法

    Python dictionary 字典 常用法 d = {} d.has_key(key_in)       # if has the key of key_in d.keys()          ...

  7. 【python】 del 的用法

    转自 https://blog.csdn.net/love1code/article/details/47276683 python中的del用法比较特殊,新手学习往往产生误解,弄清del的用法,可以 ...

  8. Python Numpy shape 基础用法(转自他人的博客,如涉及到侵权,请联系我)

    Python Numpy shape 基础用法 shape函数是numpy.core.fromnumeric中的函数,它的功能是读取矩阵的长度,比如shape[0]就是读取矩阵第一维度的长度.它的输入 ...

  9. python中argparse模块用法实例详解

    python中argparse模块用法实例详解 这篇文章主要介绍了python中argparse模块用法,以实例形式较为详细的分析了argparse模块解析命令行参数的使用技巧,需要的朋友可以参考下 ...

随机推荐

  1. VS2017 快捷键

    VS2017注释:先CTRL+K 然后CTRL+C   (ctrl按住不松,松开k按c) 取消注释:先CTRL+K,然后CTRL+U  (ctrl按住不松,松开k按c)

  2. Python之浅谈深浅拷贝

    目录 深浅拷贝 拷贝 浅拷贝 深拷贝 深浅拷贝 拷贝 s=['tim','age'] s2=s #这里的s2列表指向与s相同的id 当s2为s的拷贝对象时,s内的可变类型变化,s2变化;s内的不可变类 ...

  3. [CEOI1999]Parity Game 题解

    P5937 [CEOI1999]Parity Game 洛谷P5937 P5937 [CEOI1999]Parity Game 前言: 个人感觉这道题初看想不到并查集啊!(说实话我题都没读懂,第二遍才 ...

  4. pycharm一直显示Process finished with exit code 0

    后来排查发现原来是解释器的问题我之前使用的解释器是pycharm提供的虚拟解释器#####如何查看解释器点file–>new projects 如果选择的是2就是使用了pycharm提供的虚拟解 ...

  5. 一个ioc例子jdk和spring版本导致问题

    今天橘子松在做一个简单例子的时候,出现bug让我久久找了半小时... 天啊 不会吧 错误如下:   java.lang.NoSuchMethodError: org.springframework.a ...

  6. JSOI BZOJ4472 salesman

    题目传送门 题目大意 某售货员小T要到若干城镇去推销商品,由于该地区是交通不便的山区,任意两个城镇之间都只有唯一的可能经过其它城镇的路线. 小T 可以准确地估计出在每个城镇停留的净收益.这些净收益可能 ...

  7. C#foreach原理

    本文主要记录我在学习C#中foreach遍历原理的心得体会. 对集合中的要素进行遍历是所有编码中经常涉及到的操作,因此大部分编程语言都把此过程写进了语法中,比如C#中的foreach.经常会看到下面的 ...

  8. 配置类需要标注@Configuration却不知原因?那这次就不能给你涨薪喽

    专注Java领域分享.成长,拒绝浅尝辄止.关注公众号[BAT的乌托邦]开启专栏式学习,拒绝浅尝辄止.本文 https://www.yourbatman.cn 已收录,里面一并有Spring技术栈.My ...

  9. day23 作业

    day23 作业 目录 day23 作业 1.把登录与注册的密码都换成密文形式 2.文件完整性校验(考虑大文件) 3.注册功能改用json实现 4.项目的配置文件采用configparser进行解析 ...

  10. JVM 专题二十一:垃圾回收(五)垃圾回收器 (二)

    3. 回收器 3.1 Serial回收器:串行回收 3.1.1 概述 Serial收集器是最基本.历史最悠久的垃圾收集器了.JDK1.3之前回收新生代唯一的选择. Serial收集器作为Hotspot ...