1.安装方法

pip install pyquery

2.引用方法

from pyquery import PyQuery as pq

3.简介

　pyquery 是类型jquery 的一个专供python使用的html解析的库，使用方法类似bs4。

4.使用方法

　　4.1 初始化方法：

from pyquery import PyQuery as pq

doc =pq(html) #解析html字符串

doc =pq("http://news.baidu.com/") #解析网页

doc =pq("./a.html") #解析html 文本

4.2 基本CSS选择器

from pyquery import PyQuery as pq

html = '''

    <div id="wrap">

        <ul class="s_from">

            asdasd

            <link href="http://asda.com">asdadasdad12312</link>

            <link href="http://asda1.com">asdadasdad12312</link>

            <link href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

'''

doc = pq(html)

print doc("#wrap .s_from link")

　　运行结果：

<link href="http://asda.com">asdadasdad12312</link>

            <link href="http://asda1.com">asdadasdad12312</link>

            <link href="http://asda2.com">asdadasdad12312</link>

　　#是查找id的标签 .是查找class 的标签 link 是查找link 标签中间的空格表示里层

　　4.3 查找子元素

from pyquery import PyQuery as pq

html = '''

    <div id="wrap">

        <ul class="s_from">

            asdasd

            <link href="http://asda.com">asdadasdad12312</link>

            <link href="http://asda1.com">asdadasdad12312</link>

            <link href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

'''

#查找子元素

doc = pq(html)

items=doc("#wrap")

print(items)

print("类型为:%s"%type(items))

link = items.find('.s_from')

print(link)

link = items.children()

print(link)

　　运行结果：

<div id="wrap">

        <ul class="s_from">

            asdasd

            <link href="http://asda.com">asdadasdad12312</link>

            <link href="http://asda1.com">asdadasdad12312</link>

            <link href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

类型为:<class 'pyquery.pyquery.PyQuery'>

<ul class="s_from">

            asdasd

            <link href="http://asda.com">asdadasdad12312</link>

            <link href="http://asda1.com">asdadasdad12312</link>

            <link href="http://asda2.com">asdadasdad12312</link>

        </ul>

<ul class="s_from">

            asdasd

            <link href="http://asda.com">asdadasdad12312</link>

            <link href="http://asda1.com">asdadasdad12312</link>

            <link href="http://asda2.com">asdadasdad12312</link>

        </ul>

　　根据运行结果可以发现返回结果类型为pyquery，并且find方法和children 方法都可以获取里层标签

　 4.4查找父元素

from pyquery import PyQuery as pq

html = '''

    <div href="wrap">

        hello nihao

        <ul class="s_from">

            asdasd

            <link href="http://asda.com">asdadasdad12312</link>

            <link href="http://asda1.com">asdadasdad12312</link>

            <link href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

'''

doc = pq(html)

items=doc(".s_from")

print(items)

#查找父元素

parent_href=items.parent()

print(parent_href)

　　运行结果:

<ul class="s_from">

            asdasd

            <link href="http://asda.com">asdadasdad12312</link>

            <link href="http://asda1.com">asdadasdad12312</link>

            <link href="http://asda2.com">asdadasdad12312</link>

        </ul>

<div href="wrap">

        hello nihao

        <ul class="s_from">

            asdasd

            <link href="http://asda.com">asdadasdad12312</link>

            <link href="http://asda1.com">asdadasdad12312</link>

            <link href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

　　parent可以查找出外层标签包括的内容，与之类似的还有parents,可以获取所有外层节点

　　4.5 查找兄弟元素

from pyquery import PyQuery as pq

html = '''

    <div href="wrap">

        hello nihao

        <ul class="s_from">

            asdasd

            <link class='active1 a123' href="http://asda.com">asdadasdad12312</link>

            <link class='active2' href="http://asda1.com">asdadasdad12312</link>

            <link class='movie1' href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

'''

doc = pq(html)

items=doc("link.active1.a123")

print(items)

#查找兄弟元素

siblings_href=items.siblings()

print(siblings_href)

　　运行结果：

<link class="active1 a123" href="http://asda.com">asdadasdad12312</link>

<link class="active2" href="http://asda1.com">asdadasdad12312</link>

            <link class="movie1" href="http://asda2.com">asdadasdad12312</link>

　　根据运行结果可以看出，siblings 返回了同级的其他标签

　　结论：子元素查找，父元素查找，兄弟元素查找，这些方法返回的结果类型都是pyquery类型，可以针对结果再次进行选择

　　4.6 遍历查找结果

from pyquery import PyQuery as pq

html = '''

    <div href="wrap">

        hello nihao

        <ul class="s_from">

            asdasd

            <link class='active1 a123' href="http://asda.com">asdadasdad12312</link>

            <link class='active2' href="http://asda1.com">asdadasdad12312</link>

            <link class='movie1' href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

'''

doc = pq(html)

its=doc("link").items()

for it in its:

    print(it)

　　运行结果：

<link class="active1 a123" href="http://asda.com">asdadasdad12312</link>

<link class="active2" href="http://asda1.com">asdadasdad12312</link>

<link class="movie1" href="http://asda2.com">asdadasdad12312</link>

　　4.7获取属性信息

from pyquery import PyQuery as pq

html = '''

    <div href="wrap">

        hello nihao

        <ul class="s_from">

            asdasd

            <link class='active1 a123' href="http://asda.com">asdadasdad12312</link>

            <link class='active2' href="http://asda1.com">asdadasdad12312</link>

            <link class='movie1' href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

'''

doc = pq(html)

its=doc("link").items()

for it in its:

    print(it.attr('href'))

    print(it.attr.href)

　　运行结果：

http://asda.com

http://asda.com

http://asda1.com

http://asda1.com

http://asda2.com

http://asda2.com

　　4.8 获取文本

from pyquery import PyQuery as pq

html = '''

    <div href="wrap">

        hello nihao

        <ul class="s_from">

            asdasd

            <link class='active1 a123' href="http://asda.com">asdadasdad12312</link>

            <link class='active2' href="http://asda1.com">asdadasdad12312</link>

            <link class='movie1' href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

'''

doc = pq(html)

its=doc("link").items()

for it in its:

    print(it.text())

　　运行结果

asdadasdad12312

asdadasdad12312

asdadasdad12312

　　4.9 获取 HTML信息

from pyquery import PyQuery as pq

html = '''

    <div href="wrap">

        hello nihao

        <ul class="s_from">

            asdasd

            <link class='active1 a123' href="http://asda.com"><a>asdadasdad12312</a></link>

            <link class='active2' href="http://asda1.com">asdadasdad12312</link>

            <link class='movie1' href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

'''

doc = pq(html)

its=doc("link").items()

for it in its:

    print(it.html())

　　运行结果：

<a>asdadasdad12312</a>

asdadasdad12312

asdadasdad12312

5.常用DOM操作

　　5.1 addClass removeClass

　　添加，移除class标签

from pyquery import PyQuery as pq

html = '''

    <div href="wrap">

        hello nihao

        <ul class="s_from">

            asdasd

            <link class='active1 a123' href="http://asda.com"><a>asdadasdad12312</a></link>

            <link class='active2' href="http://asda1.com">asdadasdad12312</link>

            <link class='movie1' href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

'''

doc = pq(html)

its=doc("link").items()

for it in its:

    print("添加:%s"%it.addClass('active1'))

    print("移除:%s"%it.removeClass('active1'))

　　运行结果

添加:<link class="active1 a123" href="http://asda.com"><a>asdadasdad12312</a></link>

移除:<link class="a123" href="http://asda.com"><a>asdadasdad12312</a></link>

添加:<link class="active2 active1" href="http://asda1.com">asdadasdad12312</link>

移除:<link class="active2" href="http://asda1.com">asdadasdad12312</link>

添加:<link class="movie1 active1" href="http://asda2.com">asdadasdad12312</link>

移除:<link class="movie1" href="http://asda2.com">asdadasdad12312</link>

　　需要注意的是已经存在的class标签不会继续添加

　　5.2 attr css

　　attr 为获取/修改属性 css 添加style属性

from pyquery import PyQuery as pq

html = '''

    <div href="wrap">

        hello nihao

        <ul class="s_from">

            asdasd

            <link class='active1 a123' href="http://asda.com"><a>asdadasdad12312</a></link>

            <link class='active2' href="http://asda1.com">asdadasdad12312</link>

            <link class='movie1' href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

'''

doc = pq(html)

its=doc("link").items()

for it in its:

    print("修改:%s"%it.attr('class','active'))

    print("添加:%s"%it.css('font-size','14px'))

　　运行结果

C:\Python27\python.exe D:/test_his/test_re_1.py

修改:<link class="active" href="http://asda.com"><a>asdadasdad12312</a></link>

添加:<link class="active" href="http://asda.com" style="font-size: 14px"><a>asdadasdad12312</a></link>

修改:<link class="active" href="http://asda1.com">asdadasdad12312</link>

添加:<link class="active" href="http://asda1.com" style="font-size: 14px">asdadasdad12312</link>

修改:<link class="active" href="http://asda2.com">asdadasdad12312</link>

添加:<link class="active" href="http://asda2.com" style="font-size: 14px">asdadasdad12312</link>

　　attr css操作直接修改对象的

　　5.3 remove

　　remove 移除标签

from pyquery import PyQuery as pq

html = '''

    <div href="wrap">

        hello nihao

        <ul class="s_from">

            asdasd

            <link class='active1 a123' href="http://asda.com"><a>asdadasdad12312</a></link>

            <link class='active2' href="http://asda1.com">asdadasdad12312</link>

            <link class='movie1' href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

'''

doc = pq(html)

its=doc("div")

print('移除前获取文本结果:\n%s'%its.text())

it=its.remove('ul')

print('移除后获取文本结果:\n%s'%it.text())

　　运行结果

移除前获取文本结果:

hello nihao

asdasd

asdadasdad12312

asdadasdad12312

asdadasdad12312

移除后获取文本结果:

hello nihao

其他DOM方法参考：请点击

6.伪类选择器

from pyquery import PyQuery as pq

html = '''

    <div href="wrap">

        hello nihao

        <ul class="s_from">

            asdasd

            <link class='active1 a123' href="http://asda.com"><a>helloasdadasdad12312</a></link>

            <link class='active2' href="http://asda1.com">asdadasdad12312</link>

            <link class='movie1' href="http://asda2.com">asdadasdad12312</link>

        </ul>

    </div>

'''

doc = pq(html)

its=doc("link:first-child")

print('第一个标签:%s'%its)

its=doc("link:last-child")

print('最后一个标签:%s'%its)

its=doc("link:nth-child(2)")

print('第二个标签:%s'%its)

its=doc("link:gt(0)") #从零开始

print("获取0以后的标签:%s"%its)

its=doc("link:nth-child(2n-1)")

print("获取奇数标签:%s"%its)

its=doc("link:contains('hello')")

print("获取文本包含hello的标签:%s"%its)

　　运行结果

第一个标签:<link class="active1 a123" href="http://asda.com"><a>helloasdadasdad12312</a></link>

最后一个标签:<link class="movie1" href="http://asda2.com">asdadasdad12312</link>

第二个标签:<link class="active2" href="http://asda1.com">asdadasdad12312</link>

获取0以后的标签:<link class="active2" href="http://asda1.com">asdadasdad12312</link>

            <link class="movie1" href="http://asda2.com">asdadasdad12312</link>

获取奇数标签:<link class="active1 a123" href="http://asda.com"><a>helloasdadasdad12312</a></link>

            <link class="movie1" href="http://asda2.com">asdadasdad12312</link>

获取文本包含hello的标签:<link class="active1 a123" href="http://asda.com"><a>helloasdadasdad12312</a></link>

更多css选择器可以查看：请点击

Spider-Python爬虫之PyQuery基本用法的更多相关文章

python爬虫---selenium库的用法
python爬虫---selenium库的用法 selenium是一个自动化测试工具,支持Firefox,Chrome等众多浏览器在爬虫中的应用主要是用来解决JS渲染的问题. 1.使用前需要安装这个 ...
Python爬虫之PyQuery使用（六）
Python爬虫之PyQuery使用 PyQuery简介 pyquery能够通过选择器精确定位 DOM 树中的目标并进行操作.pyquery相当于jQuery的python实现,可以用于解析HTML网 ...
Python爬虫之BeautifulSoup的用法
之前看静觅博客,关于BeautifulSoup的用法不太熟练,所以趁机在网上搜索相关的视频,其中一个讲的还是挺清楚的:python爬虫小白入门之BeautifulSoup库,有空做了一下笔记: 一.爬 ...
python爬虫神器PyQuery的使用方法
你是否觉得 XPath 的用法多少有点晦涩难记呢? 你是否觉得 BeautifulSoup 的语法多少有些悭吝难懂呢? 你是否甚至还在苦苦研究正则表达式却因为少些了一个点而抓狂呢? 你是否已经有了一些 ...
【Python爬虫】selenium基础用法
selenium 基础用法阅读目录初识selenium 基本使用查找元素元素互交操作执行JavaScript 获取元素信息等待前进后退 Cookies 选项卡管理异常处理初识sele ...
python爬虫之PyQuery的基本使用
PyQuery库也是一个非常强大又灵活的网页解析库,如果你有前端开发经验的,都应该接触过jQuery,那么PyQuery就是你非常绝佳的选择,PyQuery 是 Python 仿照 jQuery 的严 ...
python爬虫之pyquery学习
相关内容: pyquery的介绍 pyquery的使用安装模块导入模块解析对象初始化 css选择器在选定元素之后的元素再选取元素的文本.属性等内容的获取 pyquery执行DOM操作.css ...
【Python爬虫】PyQuery解析库
PyQuery解析库阅读目录初始化基本CSS选择器查找元素遍历获取信息 DOM操作伪类选择器 PyQuery 是 Python 仿照 jQuery 的严格实现.语法与 jQuery 几乎 ...
python爬虫---requests库的用法
requests是python实现的简单易用的HTTP库,使用起来比urllib简洁很多因为是第三方库,所以使用前需要cmd安装 pip install requests 安装完成后import一下 ...
Python爬虫系列-PyQuery详解
强大又灵活的网页解析库.如果你觉得正则写起来太麻烦,如果你觉得BeautifulSoup语法太难记,如果你熟悉jQuery的语法,那么PyQuery就是你的最佳选择. 安装 pip3 install ...

随机推荐

【插件开发】—— 10 JFace开发详解
前文回顾: 1 插件学习篇 2 简单的建立插件工程以及模型文件分析 3 利用扩展点,开发透视图 4 SWT编程须知 5 SWT简单控件的使用与布局搭配 6 SWT复杂空间与布局搭配 7 SWT布局详解 ...
Tensor Operation
Main operation categories that encompass the operations of tensors. Reshaping operations Element-wis ...
Veeam对于新病毒防御的建议
Veeam对于新病毒防御的建议前言勒索软件GandCrab 上周末,在我们大家晒娃和欢度六一的时候.勒索软件分发平台 GandCrab 宣布将在一个月内关闭其RaaS(勒索软件即服务)业务平台.据 ...
[POI2007]天然气管道Gaz
Description Mary试图控制成都的天然气市场.专家已经标示出了最好的天然气井和中转站在成都的地图.现在需要将中转站和天然气井连接起来.每个中转站必须被连接到正好一个钻油井,反之亦然. Ma ...
Zznu 1913: yifan and matrix (多路归并)
题目链接: 1913: yifan and matrix 题目描述: 有一个n*n的矩阵,在每一行取出一个数,可以得到n个数的和,问前n小的和分别是多少? 解题思路: 对于两个数组a[n],b[n], ...
UML 活动图（转载）
活动图:用于表示系统中各种活动的次序,它的应用非常广泛,即可用来描述用例的工作流程,也可用来描述类中某个方法的操作行为.常用于表示业务流程,对系统功能建模,强调对象之间的控制流.活动图是由状态图变化而 ...
442 Find All Duplicates in an Array 数组中重复的数据
给定一个整数数组 a,其中1 ≤ a[i] ≤ n (n为数组长度), 其中有些元素出现两次而其他元素出现一次.找到所有出现两次的元素.你可以不用到任何额外空间并在O(n)时间复杂度内解决这个问题吗? ...
ural1437
1437 记忆化模拟倒水过程 #include <iostream> #include<cstdio> #include<cstring> #include< ...
AJPFX讲解java单例模式
单例设计模式概述: 单例模式就是要确保类在内存中只有一个对象,该实例必须自动创建,并且对外提供单例模式有以下特点: 1.单例类只能有一个实例. 2.单例类必须自己自己创建自己的唯一实例. 3 ...
spark 学习路线及参考课程
一.Scala编程详解: 第1讲-Spark的前世今生第2讲-课程介绍.特色与价值第3讲-Scala编程详解:基础语法第4讲-Scala编程详解:条件控制与循环第5讲-Scala编程详解:函数 ...

Spider-Python爬虫之PyQuery基本用法

1.安装方法

Spider-Python爬虫之PyQuery基本用法的更多相关文章

随机推荐

热门专题