python中的BeautifulSoup使用小结

1.安装

pip install beautifulsoup4

2.代码文件中导入

from bs4 import BeautifulSoup

解析器	使用方法	优势	劣势
Python标准库	BeautifulSoup(markup, “html.parser”)	Python的内置标准库执行速度适中文档容错能力强	Python 2.7.3 or 3.2.2)前的版本中文档容错能力差
lxml HTML 解析器	BeautifulSoup(markup, “lxml”)	速度快文档容错能力强	需要安装C语言库
lxml XML 解析器	BeautifulSoup(markup, [“lxml”, “xml”])BeautifulSoup(markup, “xml”)	速度快唯一支持XML的解析器	需要安装C语言库
html5lib	BeautifulSoup(markup, “html5lib”)	最好的容错性以浏览器的方式解析文档生成HTML5格式的文档	速度慢不依赖外部扩展

r = requests.get('http://www.baidu.com/')

soup = BeautifulSoup(r.text, 'html.parser')

soup = BeautifulSoup(open('index.html'))

print soup.prettify()  #美化HTML代码显示

Beautiful Soup将复杂HTML文档转换成一个复杂的树形结构,每个节点都是Python对象:

soup.head

soup.a

#显示第一个同名标签

soup.head.name #显示标签名称，这里输出‘head’

soup.head.attrs  #显示标签的属性，以字典形式返回所有属性

soup.head['class'] #显示head标签的class属性值

soup.head['class'] = 'newclass' #修改head标签class属性值为‘newclass’

del soup.head['class'] #删除head标签的class属性

soup.head.string  #获取标签内的正文内容，返回值类型为NavigableString

6.遍历

soup.body.contents[0]  #获取body标签的第一个子结点，contents是一个列表

for child in soup.body.children:

    print(child.string)     #children与contents一样，都获取全部直接子结点，只不过children是一个生成器，需遍历取出

for child in soup.body.descendants:

    print(child.string)    #递归遍历获取自身下面所有层级的所有节点，从最高一层列出然后下一层，直到最底层。

for string in soup.body.children.strings:

    print(repr(string))    #strings获取多个正文内容，需遍历取出，stripped_strings去掉每个字符串前后空格及空行，多余的空格或空行全部去掉，使用方法与strings一致

soup.body.parent #获取父节点

for parent in soup.head.title.string.parents:

    print(parent.name)    #遍历上级节点路径，返回结果为title,head,html

.next_sibling   #下一兄弟节点

.previous_sibling  #上一兄弟节点

.next_siblings  #往下遍历所有兄弟节点

.previous_siblings  #往上遍历所有兄弟节点

.next_element    #下一节点，不分层级

.previous_element    #上一节点，不分层级

.next_elements     #往下顺序遍历所有节点，不分层级

.previous_elements   #往上遍历所有节点，不分层级

7.搜索查找标签

find_all( name , attrs , recursive , text , **kwargs )

#例：

#（1）name参数

soup.find_all('a')  #查找所有a标签

soup.body.div.find_all('a')  #查找body下面第一个div中的所有a标签

for tag in soup.find_all(re.compile('^b'))；

    print(tag.name)      #正则表达式查找所有以b开头的标签

soup.find_all(['a','b'])  #列表查找，返回所有a标签和b标签

soup.find_all(True)    #为True时，所有标签都满足搜索条件，返回所有标签

#以下为自定义过滤条件，筛选满足自定义条件的标签

def has_class_but_no_id(tag):

    return tag.has_attr('class') and not tag.has_attr('id')

soup.find_all(has_class_but_no_id)  #返回所有具有class属性但无id属性的标签

#（2）attrs参数，以标签属性搜索

soup.find_all(id='nd2') #返回所有标签中属性id等于nd2的标签

soup.find_all(href=re.compile("elsie"), id='link1')  #多个条件同时筛选，可用正则表达式

soup.find_all("a", class_="sister") #属性中如果有python关键字，比如class属性，不可以直接class='sister',应加个下划线与python关键字区分class_='sister'

soup.find_all(attrs={"data-foo": "value"})

#类似于html5中的data-foo属性不可直接写为soup.find_all(data-foo='value')，因为python命名规则中不允许有中划线（即横杠），应以字典形式传入attrs参数中，所有的属性搜索都可以使用这种方法

#（3）text参数

soup.find_all(text="Tillie") #搜索文档中的字符串内容为tillie，与name参数一样，可用列表、正则表达式等

#（4）limit参数

soup.find_all('a', limit=2) #返回搜索文档中前两个a标签，文档较大时可节约资源

#（5）recursive参数

soup.head.find_all("title", recursive=False)

#在head的直接子节点中搜索，默认为recursive=True，表示在所有子孙节点中搜索

find( name , attrs , recursive , text , **kwargs )

#与find_all用法完全一致，区别在于find只返回第一个满足条件的结果，而find_all返回的是一个列表，需遍历操作

#以下方法参数用法与 find_all() 完全相同，下面只列出区别

find_parents()  find_parent()

#find_all() 和 find() 只搜索当前节点的所有子节点,孙子节点等. find_parents() 和 find_parent() 用来搜索当前节点的父辈节点,搜索方法与普通tag的搜索方法相同,搜索文档搜索文档包含的内容

find_next_siblings()  find_next_sibling()

#这2个方法通过 .next_siblings 属性对当 tag 的所有后面解析的兄弟 tag 节点进行迭代, find_next_siblings() 方法返回所有符合条件的后面的兄弟节点,find_next_sibling() 只返回符合条件的后面的第一个tag节点

find_previous_siblings()  find_previous_sibling()

#这2个方法通过 .previous_siblings 属性对当前 tag 的前面解析的兄弟 tag 节点进行迭代, find_previous_siblings() 方法返回所有符合条件的前面的兄弟节点, find_previous_sibling() 方法返回第一个符合条件的前面的兄弟节点

find_all_next()  find_next()

#这2个方法通过 .next_elements 属性对当前 tag 的之后的 tag 和字符串进行迭代, find_all_next() 方法返回所有符合条件的节点, find_next() 方法返回第一个符合条件的节点

find_all_previous() 和 find_previous()

#这2个方法通过 .previous_elements 属性对当前节点前面的 tag 和字符串进行迭代, find_all_previous() 方法返回所有符合条件的节点, find_previous()方法返回第一个符合条件的节点

python中的BeautifulSoup使用小结的更多相关文章

第14.12节 Python中使用BeautifulSoup解析http报文：使用select方法快速定位内容
一. 引言在<第14.10节 Python中使用BeautifulSoup解析http报文:html标签相关属性的访问>和<第14.11节 Python中使用BeautifulSo ...
第14.11节 Python中使用BeautifulSoup解析http报文：使用查找方法快速定位内容
一. 引言在<第14.10节 Python中使用BeautifulSoup解析http报文:html标签相关属性的访问>介绍了BeautifulSoup对象的主要属性,通过这些属性可以访 ...
第14.10节 Python中使用BeautifulSoup解析http报文：html标签相关属性的访问
一. 引言在<第14.8节 Python中使用BeautifulSoup加载HTML报文>中介绍使用BeautifulSoup的安装.导入和创建对象的过程,本节介绍导入后利用Beauti ...
第14.8节 Python中使用BeautifulSoup加载HTML报文
一. 引言 BeautifulSoup是一个三方模块bs4中提供的进行HTML解析的类,可以认为是一个HTML解析工具箱,对HTML报文中的标签具有比较好的容错识别功能.阅读本节需要了解html相关的 ...
在Python中使用BeautifulSoup进行网页爬取
目录什么是网页抓取? 为什么我们要从互联网上抓取数据? 网站采集合法吗? HTTP请求/响应模型创建网络爬虫步骤1:浏览并检查网站/网页步骤2:创建用户代理步骤3:导入请求库检查状态码步 ...
关于python中lambda 函数使用小结
例子: 如果定义普通函数,一般都是这样写: def:ds(x): return 2*x+1 调用即: ds(5) 如果用lambda函数就是这么写,就是一句话: g =lambda x:2*x+1 调 ...
python中的变量引用小结
python的变量都可以看成是内存中某个对象的引用.(变量指向该内存地址存储的值) 1.python中的可更改对象和不可更改对象 python中的对象可以分为可更改(mutable)对象与不可更改(i ...
python中的requests使用小结
现接触到的很少,详细的官方教程地址: requests官方指南文档:http://docs.python-requests.org/zh_CN/latest/user/quickstart.html ...
Python中的BeautifulSoup库简要总结
一.基本元素 BeautifulSoup库是解析.遍历.维护“标签树”的功能库. 引用 from bs4 import BeautifulSoup import bs4 html文档-标签树-Beau ...

随机推荐

Bluedroid协议栈HCI线程分析
蓝牙进程中有多个线程,其中HCI 线程是负责处理蓝牙主机端和控制器的数据处理和收发的工作. 本篇文章就是分析一下该线程的数据处理流程. 1.跟HCI相关的接口首先看看hci的相关的接口:在hci_l ...
linux下的yum命令详细介绍
yum(全称为 Yellow dog Updater, Modified)是一个在Fedora和RedHat以及SUSE中的Shell前端软件包管理器.基於RPM包管理,能够从指定的服务器自动下载RP ...
SQL 追踪
SQL追踪(SQL Trace)是一个轻量级的追踪工具,按照事件(Events)记录数据库发生的消息,几乎对数据库性能没有什么影响.SQL Server内置一个Trace,称作默认追踪(Default ...
Security6：查看授予的权限
在SQL Server的安全体系中,权限分为服务器级别(Server-Level)和数据库级别(Database-Level),用户的权限分为两种形式,分别是直接授予的权限,以及由于加入角色而获得的权 ...
Js_实现3D球体旋转
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/ ...
获取【酷我音乐】歌曲URL地址
非原创酷我中的歌曲的页面地址通常是:www.kuwo.cn/yinyue/6181801,末尾的一串数字是这首歌曲的编号id. 我们只须在 http://player.kuwo.cn/webmusi ...
Salesforce随笔: 将Visualforce Page渲染为PDF文件(Render a Visualforce Page as a PDF File)
参照 : Visualforce Developer Guide 第60页 <Render a Visualforce Page as a PDF File> 你可以用PDF渲染服务生成一 ...
GitHub 新手教程二，Windows 版 GitHub 安装
1,下载地址: https://git-scm.com/download/ 2,信息: 3,选择安装位置: 例如:d:\soft\git 4,选择组件: 5,创建开始菜单: 6,选择Git使用的默认编 ...
PAT-1003 Emergency（Dijkstra）
1003 Emergency (25 分) As an emergency rescue team leader of a city, you are given a special map of y ...
Grin v0.5在Ubuntu下的安装和启动
Grin和bitcoin一样也是一种点对点的现金交易系统,但它通过零和验证算法,使得双方的交易金额不会被第三方知晓,让它在隐私保护方面更强.其官方的介绍是: 所有人的电子交易,没有审查或限制.并提出它 ...

python中的BeautifulSoup使用小结

python中的BeautifulSoup使用小结的更多相关文章

随机推荐

热门专题