【BOOK】解析库--pyquery

CSS选择器

1、初始化

html='''

<div>

    <ul>

        <li class="item-0">first item</li>

        <li class="item-1"><a href="link2.html">second item</a></li>

        <li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>

        <li class="item-1 active"><a href="link4.html">fourth item</a></li>

        <li class="item-0 "><a href="link5.html">fifth item</a></li>

    </ul>

</div>

'''

from pyquery import PyQuery as pq

## 字符串初始化

doc = pq(html)

print(doc('li'))

## URL初始化

doc= pq(url='https://cuiqingcai.com')

print(doc('title'))

## 文件初始化

doc = pq(filename='test.html')

print(doc('li'))

2、CSS选择器

# CSS选择器

from pyquery import PyQuery as pq

doc = pq(html)

## id用 #，class用 .

print(doc('#container .list li'))

3、查找节点

html='''

<div id="container">

    <ul class="list">

        <li class="item-0">first item</li>

        <li class="item-1"><a href="link2.html">second item</a></li>

        <li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>

        <li class="item-1 active"><a href="link4.html">fourth item</a></li>

        <li class="item-0 "><a href="link5.html">fifth item</a></li>

    </ul>

</div>

'''

##查找节点

from pyquery import PyQuery as pq

doc = pq(html)

items = doc('.list')

print(items)

## find() 查找所有地子孙节点

lis = items.find('a')

print(lis)

## children() 只查找子节点

lis = items.children('.active')

print(lis)

## parent() 查找父节点

container = items.parent()

print(container)

## parents() 查找祖先节点

ancestor = items.parents()

print(ancestor)

## siblings() 查找兄弟节点

li = doc('.item-0.active')

print(li.siblings('.active'))

4、遍历　

from pyquery import PyQuery as pq

doc = pq(html)

## 调用items()得到一个生成器，for in 进行遍历

lis = doc('li').items()

for li in lis:

    print(li)

5、获取内容

from pyquery import PyQuery as pq
doc = pq(html)
a = doc('.item-0 a')
print(a)

## 获取 a节点的 href的属性值
## attr()只返回第一个结果
print(a.attr('href'))
print(a.attr.href)

## 通过遍历获取所有的属性值
for item in a.items():
    print(item.attr('href'))

## 只获取文本 多个节点的文本内容用 空格 间隔开

print(a.text()) ## third item fifth item

## 获取包含 a节点内部所有内容，包含节点，返回第一个 a节点 内部的HTML文本

print(a.html()) # <span class="bold">third item</span>

6、节点操作

## 节点操作

## remove()

html ='''

<div class="wrap">

    Hello World

    <p>呱呱呱</p>

</div>

'''

## 只想获得Hello World

from pyquery import  PyQuery as pq

doc = pq(html)

wrap = doc('.wrap')

## 移除 p节点

wrap.find('p').remove()

print(wrap.text())

7、伪类选择器

html='''

<div id="container">

    <ul class="list">

        <li class="item-0">first item</li>

        <li class="item-1"><a href="link2.html">second item</a></li>

        <li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>

        <li class="item-1 active"><a href="link4.html">fourth item</a></li>

        <li class="item-0 "><a href="link5.html">fifth item</a></li>

    </ul>

</div>

'''

from pyquery import PyQuery as pq

doc = pq(html)

## 第一个li节点

li = doc('li:first-child')

print(li)

## 最后一个li节点

li = doc('li:last-child')

print(li)

## 第2个li节点

li = doc('li:nth-child(2)')

print(li)

## 包含‘second’文本的li节点

li = doc('li:contains(second)')

print(li)

【BOOK】解析库--pyquery的更多相关文章

python3解析库pyquery
pyquery是一个类似jquery的python库,它实现能够在xml文档中进行jQuery查询,pyquery使用lxml解析器进行快速在xml和html文档上操作,它提供了和jQuery类似的语 ...
小白学 Python 爬虫（23）：解析库 pyquery 入门
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
Python的网页解析库-PyQuery
PyQuery库也是一个非常强大又灵活的网页解析库,如果你有前端开发经验的,都应该接触过jQuery,那么PyQuery就是你非常绝佳的选择,PyQuery 是 Python 仿照 jQuery 的严 ...
Python3编写网络爬虫07-基本解析库pyquery的使用
三.pyquery 简介:同样是一个强大的网页解析工具它提供了和jQuery类似的语法来解析HTML文档,支持CSS选择器,使用非常方便安装: pip install pyquery 验证: im ...
爬虫之解析库pyquery
初始化安装: pip install pyquery 字符串的形式初始化 html = """ <html lang="en"> < ...
pyquery 的用法 --爬虫解析库
如果你对Web有所涉及,如果你比较喜欢用CSS选择器,如果你对jQuery有所了解,那么这里有一个更适合你的解析库--pyquery. 接下来,我们就来感受一下pyquery的强大之处. 1. 准备工 ...
Python爬虫【解析库之pyquery】
该库跟jQuery的使用方法基本一样 http://pyquery.readthedocs.io/ 官方文档解析库的安装 pip3 install pyquery 初始化 1.字符串初始化 htm ...
【Python爬虫】PyQuery解析库
PyQuery解析库阅读目录初始化基本CSS选择器查找元素遍历获取信息 DOM操作伪类选择器 PyQuery 是 Python 仿照 jQuery 的严格实现.语法与 jQuery 几乎 ...
（最全）Xpath、Beautiful Soup、Pyquery三种解析库解析html 功能概括
一.Xpath 解析 xpath:是一种在XMl.html文档中查找信息的语言,利用了lxml库对HTML解析获取数据. Xpath常用规则: nodename :选取此节点的所有子节点 // : ...
Python3 BeautifulSoup和Pyquery解析库随笔
BeautifuSoup和Pyquery解析库方法比较 1.对象初始化: BeautifySoup库: from bs4 import BeautifulSoup html = 'html strin ...

随机推荐

使用win10 wsl中的Debian编译lean 的 lede
安装Debian发行版启用windows 适用于linux 的 windows子系统安装Debian 参考p3terx的文章把debian装到非系统盘上: https://p3terx.com/a ...
zabbix编译安装，安装mysql数据库：configure: error: Not found mysqlclient library
在编译时,可能会出现题目中所示的错误,可以通过安装mysql-devel这个库解决: # yum install mysql-devel 注:如果出现"configure: error : ...
openssl常用操作
参考:https://www.golinuxcloud.com/openssl-view-certificate/ 查看证书信息 openssl x509 -in server.crt -text - ...
unable to access 'https://github.com/.../...git': Recv failure: Connection was reset
解决git下载报错:fatal: unable to access 'https://github.com/.../...git': Recv failure: Connection was rese ...
斐讯K2_V22.6.507.43降级+刷机整个过程
K2刷机整个过程 (包括降级) 开始之前请先下载好相对应的工具包,其中包括: 官方固件:"K2_V22.6.506.28.bin"."K2_V22.6.507.43.bi ...
在线访问GET/POST及格式化json工具
http://coolaf.com/在线访问及格式化json工具谷歌浏览器json插件不是很好实现.安装,替代方案
Kotlin源码分析 - 元编程（使用自身语言编写生成自身代码）
Kotlin源码分析 Kotlin模块FIR分析发现,在生成fir tree的时候,kotlin使用了元编程的技术,以前看到这个技术还是在JastAdd上,使用jastadd语法去写代码,生成Java ...
twenty four
vue基础代码 <script src="vue路径"></script> <script> const vm = new Vue({ //el ...
Prettier 与 ESLint 对函数名后空格的处理
问题 Prettier 格式化 JavaScript 代码之后,默认不会在函数与 () 添加空格,而 ESLint 默认情况下则要求函数与 () 之间必须有一个空格. 保留空格的方案配置方案 1 在 ...
python代码规范PEP8
1.引言本文档给出了 Python 编码规约,主要 Python 发行版中的标准库即遵守该规约.对于 C 代码风格的 Python 程序,请参阅配套的 C 代码风格指南. 本文档和 PEP 257( ...

【BOOK】解析库--pyquery

【BOOK】解析库--pyquery的更多相关文章

随机推荐

热门专题