PyQuery使用

PyQuery库是一个非常强大的网页解析库，如果你有前端开发经验的，都应该接触过jQuery,那么PyQuery就是你非常绝佳的选择，PyQuery 是 Python 仿照 jQuery 的严格实现。它的语法与 jQuery 几乎完全相同，所以不用再去费心记一些奇怪的方法了。
官网地址：http://pyquery.readthedocs.io/en/latest/
jQuery参考文档： http://jquery.cuishifeng.cn/

1、字符串的初始化

from pyquery import PyQuery as pq

html = '''<div>
<ul>
<li class="item-0">first item</li>
<li class="item-1"><a href="link2.html">second item</a></li>
<li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>
<li class="item-1 active"><a href="link4.html">fourth item</a></li>
<li class="item-0"><a href="link5.html">fifth item</a></li>
</ul></div>'''

doc = pq(html)
print(doc)
print(type(doc))
print(doc('li'))

2、打开html文件

注意路径问题

from pyquery import PyQuery as pq
doc = pq(filename='index.html')
print(doc)
print(doc('head'))

3、打开某个网站

doc = pq('https://www.baidu.com')
# doc1 = pq(url='https://www.baidu.com')
print(doc)
print(doc('head'))
　　

4、基于CSS选择器查找

from pyquery import PyQuery as pq

html = '''<div>
<ul id = 'haha'>
<li class="item-0">first item</li>
<li class="item-1"><a href="link2.html">second item</a></li>
<li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>
<li class="item-1 active"><a href="link4.html">fourth item</a></li>
<li class="item-0"><a href="link5.html">fifth item</a></li>
</ul></div>'''

doc = pq(html)
print(doc)
#id等于haha下面的class等于item-0下的a标签下的span标签（注意层级关系以空格隔开）
print(doc('#haha .item-0 a span'))

5、可以通过已经查找到的标签，查找这个标签下的子标签或者父标签，而不用从头开始查找。

from pyquery import PyQuery as pq

html = '''<div class=‘content’>
<ul id = 'haha'>
<li class="item-0">first item</li>
<li class="item-1"><a href="link2.html">second item</a></li>
<li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>
<li class="item-1 active"><a href="link4.html">fourth item</a></li>
<li class="item-0"><a href="link5.html">fifth item</a></li>
</ul></div>'''

doc = pq(html)
item = doc('div ul')
print(item)
#我们可以通过已经查找到的标签，再次查找这个标签下面的标签
print(item.parent())
print(item.children())

----------------------------------------------------------------

from pyquery import PyQuery as pq

doc = pq(html)
item = doc('div ul')
print(item)
#注意这里查找ul标签的所有子标签，也就是li标签，下面是查找class属性的标签，如果你把class换成href肯定不行，它指的只是儿子并不是子子孙孙
print(item.children('[class]'))

6、获取属性值

from pyquery import PyQuery as pq

doc = pq(html)
#注意class=item-0 active是一个class的属性，但是在pyquery里面要是中间也是空格隔开的话，
#就变成了item-0下的active标签下的a标签了，所以这里空格必须改成点
item = doc(".item-0.active a")
print(type(item))
print(item)
#获取属性值的两种方法
print(item.attr.href)
print(item.attr('href'))

7、获取标签的内容

from pyquery import PyQuery as pq

doc = pq(html)
a = doc("a").text()
print(a)

8、Dom操作

　　1、属性的增加删除操作

　　from pyquery import PyQuery as pq

　　html = '''<div class=‘content’>
　　<ul id = 'haha'>
　　<li class="item-0">first item</li>
　　<li class="item-1"><a href="link2.html">second item</a></li>
　　<li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>
　　<li class="item-1 active"><a href="link4.html">fourth item</a></li>
　　<li class="item-0"><a href="link5.html">fifth item</a></li>
　　</ul></div>'''

　　doc = pq(html)
　　li = doc('.item-0.active')
　　print(li)
　　#删除classactive
　　print(li.removeClass('active'))
　　#增加class属性haha
　　print(li.addClass('haha'))

　　2、attrs和css

　　注意：下列操作有则改之，无则加之。

　　from pyquery import PyQuery as pq

　　html = '''<div class=‘content’>
　　<ul id = 'haha'>
　　<li class="item-0">first item</li>
　　<li class="item-1"><a href="link2.html">second item</a></li>
　　<li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>
　　<li class="item-1 active"><a href="link4.html">fourth item</a></li>
　　<li class="item-0"><a href="link5.html">fifth item</a></li>
　　</ul></div>'''

　　doc = pq(html)
　　li = doc('.item-0.active')
　　print(li)
　　print(li.attr('id','id_test'))
　　print(li.css('font-size','20px'))

　　3、删除某个标签，在爬取过程中我们通常抓取到的内容总会有一些不想要的标签，这个时候我们可以用以下类似的方法来删除这些标签。

　　from pyquery import PyQuery as pq

　　html = '''<div class='content'>
　　<ul id = 'haha'>
　　<li class="item-0">first item</li>
　　<li class="item-1"><a href="link2.html">second item</a></li>
　　<li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>
　　<li class="item-1 active"><a href="link4.html">fourth item</a></li>
　　<li class="item-0"><a href="link5.html">fifth item</a></li>
　　</ul></div>'''

　　doc = pq(html)
　　data = doc('.content')
　　print(data.text())
　　#删除所有a标签
　　data.find('a').remove()
　　#再次打印
　　print(data.text())

PyQuery使用的更多相关文章

pyquery的问题
在使用pyquery时发现一些问题, 1.爬取的html中如果有较多的错误时,不能很好的补全. 2.如果要获取某个class中的内容时,如果内容太多不能取完整!只能取一部分. 这个在现在的最新版本中还 ...
python爬虫神器PyQuery的使用方法
你是否觉得 XPath 的用法多少有点晦涩难记呢? 你是否觉得 BeautifulSoup 的语法多少有些悭吝难懂呢? 你是否甚至还在苦苦研究正则表达式却因为少些了一个点而抓狂呢? 你是否已经有了一些 ...
windows下python安装pyquery
安装pyquery之前首先要明确一点,easyinstall 是一款python包管理器,类似于node的npm,用于安装python的扩展包,它安装的包是以*.egg的方式. 要安装pq需要经历以下 ...
Python开发包推荐系列之xml、html解析器PyQuery
使用python,喜欢她的简洁是一方面,另外就是它有着丰富的开发包好用又方便接下来会给大家推荐一系列很赞的开发包. 在解析html.xml过程中,我们有不少的包可以用.比如bs.lxml.xmlt ...
python - PyQuery
偶尔的机会,知道这么个扩展,手贱翻了下文档,发现似乎挺有意思,遂记录一二. what: 这是一个python版本的jquery,而且是后端执行的,至少官方是这么说的: pyquery allows y ...
【pyQuery】抓取startup news首页
#! /usr/bin/python # coding: utf-8 from pyquery import PyQuery c=PyQuery('http://news.dbanotes.net/' ...
【pyQuery分析实例】分析体育网冠军联盟比赛成绩
目标地址:http://www.espncricinfo.com/champions-league-twenty20-2012/engine/match/574265.html liz@nb-liz: ...
【PyQuery】PyQuery总结
pyquery库是jQuery的Python实现,可以用于解析HTML网页内容, 官方文档地址是:http://packages.python.org/pyquery/. 二.使用方法 ? 1 fro ...
win7下python安装pyquery
安装pyquery之前首先要明确一点,easyinstall 是一款python包管理器,类似于node的npm,用于安装python的扩展包,它安装的包是以*.egg的方式. 要安装pq需要经历以下 ...
Python抓取页面中超链接(URL)的三中方法比较(HTMLParser、pyquery、正则表达式) <转>
Python抓取页面中超链接(URL)的3中方法比较(HTMLParser.pyquery.正则表达式) HTMLParser版: #!/usr/bin/python # -*- coding: UT ...

随机推荐

火狐浏览器下载文件中文乱码，文件名中的空格变加号("+")的问题
解决一下问题: 1.火狐浏览器下载文件,中文变乱码 2.IE浏览器下载文件,丢失文件扩展名或强制扩展名为".txt" 3.浏览器下载文件,文件名中的空格变成加号("+&q ...
PHP中的类函数和类对象
1.class_exists()函数接受表示类的字符串,检查并返回布尔值.如果类存在,返回true,否则返回false: echo class_exists('Computer'); 2.get_cl ...
深入浅出JDK动态代理(一)
1.何为代理代理,即代替主角完成一些额外的事情.例如,明星都有经纪人,明星参演电影之前,经纪人作为明星的代理人和出资方洽谈片酬.排期等,而真正参与拍戏的还是明星本人,明星拍完戏后,由经纪人代理明星去 ...
oracle中单引号的处理
当想让输出的结果中字段带有单引号', 场景一:连续三个单引号''' select '''helin''' from dual; ---'helin' 场景二:拼接字段的结果集--连续4个单引号 sel ...
郑晔谈 Moco 框架的开发：写一个好的内部 DSL ，写一个表达性好的程序
作者:张龙出处:http://www.infoq.com/cn/news/2013/07/zhengye-on-moco 郑晔谈Moco框架的开发:写一个好的内部DSL,写一个表达性好的程序作者 ...
linux软链接与硬链接详解
软连接命令: ln -s 原文件目标文件特征: 1.相当于windows的快捷方式 2.只是一个符号连接,所以软连接文件大小都很小 3.当运行软连接的时候,会根据连接指向找到真正的文件,然后执行 ...
【henuacm2016级暑期训练-动态规划专题 B】Coloring Trees
[链接] 我是链接,点我呀:) [题意] 在这里输入题意 [题解] f[i][j][k]前i个位置,第i个位置放j这个颜色,然后形成了k个联通块的最小花费分第i个位置有没有已经放颜色两种情况考虑. ...
iBase4J部署总结
iBase4J部署总结序言最近看到个分布式框架,只有一个字:好.所以部署起来看看.开始的时候说实话遇到了点困难.去码云上看了下,貌似想得到指导要加入一个群,而且需要收费的,反正闲来无事,索性自己搞 ...
《深入理解Android 卷III》第五章深入理解Android输入系统
<深入理解Android 卷III>即将公布.作者是张大伟.此书填补了深入理解Android Framework卷中的一个主要空白.即Android Framework中和UI相关的部分. ...
闭包(closure)与协程共用时要注意的事情
闭包是一种能够让你用非常舒服的方式来编程的小技巧,Go也支持闭包. 假设从来没有接触过闭包,想在一開始就弄懂什么是闭包(closure)是非常困难的,就像递归一样,直到你真正写过.用过它,你才干真正的 ...

PyQuery使用

PyQuery使用的更多相关文章

随机推荐

热门专题