【转载】Beautiful Soup库（bs4）入门

该库能够解析HTML和XML

使用Beautiful Soup库:

from bs4 import BeautifulSoup

import requests

r = requests.get('http://www.23us.so/')

html = r.text

soup = BeautifulSoup(html,'html.parser')

print soup.prettify()

1、Beautiful Soup库的理解：

HTML文件其实就是由一组尖括号构成的标签组织起来的，每一对尖括号形式一个标签，标签之间存在上下关系，形成标签树；因此可以说Beautiful Soup库是解析、遍历、维护“标签树”的功能库。

p标签：：标签Tag ——一般，标签名都是成对出现的（位于起始和末尾），例如P；在第一个标签名之后可以有0到多个属性，表示标签的特点

...——中间的class属性，其值为“title ”（属性是由键和值，键值对构成的）

通常，Beautiful Soup库的使用：

from bs4 import BeautifulSoup #主要使用BeautifulSoup类

事实上可以认为：HTML文档和标签树，BeautifulSoup类是等价的

Beautiful Soup库解析器：

bs4的HTML解析器：BeautifulSoup(mk,'html.parser')——条件：安装bs4库

lxml的HTML解析器：BeautifulSoup(mk,'lxml')——pip install lxml

lxml的XML解析器：BeautifulSoup(mk,'xml')——pip install lxml

html5lib的解析器：BeautifulSoup(mk,'html5lib')——pip install html5lib

Beautiful Soup类的基本元素：

1、Tag——标签，最基本的信息组织单元，分别用<>和</>表明开头和结尾

2、Name——标签的名字，...的名字是'p',格式：<tag>.name

3、Attributes——标签的属性，字典形式组织，格式：<tag>.attrs

4、NavigableString——标签内非属性字符串，<>...</>中的字符串，格式：<tag>.string

5、Comment——标签内字符串的注释部分，一种特殊的Comment类型（尖括号叹号表示注释开始：）

获取标签的方法：

from bs4 import BeautifulSoup

soup = BeautifulSoup(demo,'html.parser')

soup.a.name #a标签的名字

soup.a.parent.name #a标签的父标签的名字

soup.a.parent.parent.name #a标签的父标签的父标签名字

tag = soup.a

tag.attrs #a标签的属性

soup.a.string #获得a标签内非属性字符串（NavigableString ）注意：soup.b.string也可能是获得Comment标签；可都过类型进行判断

2、基于bs4库的HTML内容遍历方法：

形成了三种遍历：

标签树的下行遍历：

.contents属性：子节点的列表，将<tag>所有儿子节点存入列表
.children属性：子节点的迭代类型，与.contents类似，用于循环遍历儿子节点
.descendants属性：子孙节点的迭代类型，包含所有子孙节点，用于循环遍历

也就是说：contents和children只获得当前节点的下一节点的信息；而descendants可以获得当前节点的所有后续节点信息

注意：字符串也属于一个节点，例如'\n'，'and'

遍历儿子节点：

for child in soup.body.children: #迭代类型，需要用循环方式

print(child)

遍历子孙节点：

for child in soup.body.descendants:

print(child)

from bs4 import BeautifulSoup       #beautifulsoup4库使用时是简写的bs4

import requests

r = requests.get('http://python123.io/ws/demo.html')

demo = r.text

soup = BeautifulSoup(demo,'html.parser')    #解析器：html.parser

child = soup.body.contents

print(child)

for child in soup.body.descendants:

    print(child)

标签树的上行遍历：

.parent属性：节点的父标签
parents属性：节点先辈标签的迭代类型，用于循环遍历先辈节点

注意：在遍历一个标签的所有先辈标签时，会遍历到soup本身，而soup的先辈不存在（也就是None），因此也就没有.name信息

标签树的平行遍历：

注意：平行遍历是有条件的，平行遍历必须发生在同一个父节点下的各节点间

soup.a.next_sibling

soup.a.previous_sibling

for sibling in soup.a.next_siblings:

print(sibling)

for sibling in soup.a.previous_siblings:

print(sibling)

3、基于bs4库的HTML格式输出：

如何能够让html内容更加“友好”的显示：

bs4库的prettify()方法：为html文本的标签以及内容增加换行符，也可以对标签做相关处理，例如soup.a.prettify()

该库能够解析HTML和XML

使用Beautiful Soup库:

from bs4 import BeautifulSoup

soup = BeautifulSoup('data', 'html.parser') #html解析器：html.parser ，前一个参数则是要解析的内容

小测：

from bs4 import BeautifulSoup       #beautifulsoup4库使用时是简写的bs4

import requests

r = requests.get('http://python123.io/ws/demo.html')

demo = r.text

soup = BeautifulSoup(demo,'html.parser')    #解析器：html.parser

print(soup.prettify())          #打印解析好的内容

1、Beautiful Soup库的理解：

p标签：：标签Tag ——一般，标签名都是成对出现的（位于起始和末尾），例如P；在第一个标签名之后可以有0到多个属性，表示标签的特点

...——中间的class属性，其值为“title ”（属性是由键和值，键值对构成的）

通常，Beautiful Soup库的使用：

from bs4 import BeautifulSoup #主要使用BeautifulSoup类

事实上可以认为：HTML文档和标签树，BeautifulSoup类是等价的

Beautiful Soup库解析器：

bs4的HTML解析器：BeautifulSoup(mk,'html.parser')——条件：安装bs4库

lxml的HTML解析器：BeautifulSoup(mk,'lxml')——pip install lxml

lxml的XML解析器：BeautifulSoup(mk,'xml')——pip install lxml

html5lib的解析器：BeautifulSoup(mk,'html5lib')——pip install html5lib

Beautiful Soup类的基本元素：

1、Tag——标签，最基本的信息组织单元，分别用<>和</>表明开头和结尾

2、Name——标签的名字，...的名字是'p',格式：<tag>.name

3、Attributes——标签的属性，字典形式组织，格式：<tag>.attrs

4、NavigableString——标签内非属性字符串，<>...</>中的字符串，格式：<tag>.string

5、Comment——标签内字符串的注释部分，一种特殊的Comment类型（尖括号叹号表示注释开始：）

获取标签的方法：

from bs4 import BeautifulSoup

soup = BeautifulSoup(demo,'html.parser')

soup.a.name #a标签的名字

soup.a.parent.name #a标签的父标签的名字

soup.a.parent.parent.name #a标签的父标签的父标签名字

tag = soup.a

tag.attrs #a标签的属性

soup.a.string #获得a标签内非属性字符串（NavigableString ）注意：soup.b.string也可能是获得Comment标签；可都过类型进行判断

2、基于bs4库的HTML内容遍历方法：

形成了三种遍历：

标签树的下行遍历：

.contents属性：子节点的列表，将<tag>所有儿子节点存入列表
.children属性：子节点的迭代类型，与.contents类似，用于循环遍历儿子节点
.descendants属性：子孙节点的迭代类型，包含所有子孙节点，用于循环遍历

也就是说：contents和children只获得当前节点的下一节点的信息；而descendants可以获得当前节点的所有后续节点信息

注意：字符串也属于一个节点，例如'\n'，'and'

遍历儿子节点：

for child in soup.body.children: #迭代类型，需要用循环方式

print(child)

遍历子孙节点：

for child in soup.body.descendants:

print(child)

from bs4 import BeautifulSoup #beautifulsoup4库使用时是简写的bs4
import requests
r = requests.get('http://python123.io/ws/demo.html')
demo = r.text
soup = BeautifulSoup(demo,'html.parser') #解析器：html.parser
child = soup.body.contents
print(child)
for child in soup.body.descendants:

print(child)

标签树的上行遍历：

.parent属性：节点的父标签
parents属性：节点先辈标签的迭代类型，用于循环遍历先辈节点

注意：在遍历一个标签的所有先辈标签时，会遍历到soup本身，而soup的先辈不存在（也就是None），因此也就没有.name信息

标签树的平行遍历：

注意：平行遍历是有条件的，平行遍历必须发生在同一个父节点下的各节点间

soup.a.next_sibling

soup.a.previous_sibling

for sibling in soup.a.next_siblings:

print(sibling)

for sibling in soup.a.previous_siblings:

print(sibling)

3、基于bs4库的HTML格式输出：

如何能够让html内容更加“友好”的显示：

bs4库的prettify()方法：为html文本的标签以及内容增加换行符，也可以对标签做相关处理，例如soup.a.prettify()

【转载】Beautiful Soup库（bs4）入门的更多相关文章

Beautiful Soup库入门
1.安装:pip install beautifulsoup4 Beautiful Soup库是解析.遍历.维护“标签树”的功能库 2.引用:(1)from bs4 import BeautifulS ...
Beautiful Soup库基础用法（爬虫）
初识Beautiful Soup 官方文档:https://www.crummy.com/software/BeautifulSoup/bs4/doc/# 中文文档:https://www.crumm ...
Python Beautiful Soup库
Beautiful Soup库 Beautiful Soup库:https://www.crummy.com/software/BeautifulSoup/ 安装Beautiful Soup: 使用B ...
crawler碎碎念4 关于python requests、Beautiful Soup库、SQLlite的基本操作
Requests import requests from PIL import Image from io improt BytesTO import jason url = "..... ...
【Python爬虫学习笔记（3）】Beautiful Soup库相关知识点总结
1. Beautiful Soup简介 Beautiful Soup是将数据从HTML和XML文件中解析出来的一个python库,它能够提供一种符合习惯的方法去遍历搜索和修改解析树,这将大大减 ...
python beautiful soup库的超详细用法
原文地址https://blog.csdn.net/love666666shen/article/details/77512353 参考文章https://cuiqingcai.com/1319.ht ...
python之Beautiful Soup库
1.简介简单来说,Beautiful Soup是python的一个库,最主要的功能是从网页抓取数据.官方解释如下: Beautiful Soup提供一些简单的.python式的函数用来处理导航.搜索 ...
Beautiful Soup库介绍
开始前需安装Beautiful Soup 和lxml. Beautiful Soup在解析时依赖解析器,下表列出bs4支持的解析器. 解析器使用方法 Python标准库 BeautifulSoup( ...
Beautiful Soup库
原文传送门:静觅 » Python爬虫利器二之Beautiful Soup的用法

随机推荐

Codeforces Round #409 (rated, Div. 2, based on VK Cup 2017 Round 2)
A 每次可以换一个或不换,暴力枚举位置即可 B 模拟 C 二分答案.. 边界可以优化r=totb/(tota-p),二分可以直接(r-l>=EPS,EPS不要太小,合适就好),也可以直接限定二分 ...
spark core （二）
一.Spark-Shell交互式工具 1.Spark-Shell交互式工具 Spark-Shell提供了一种学习API的简单方式, 以及一个能够交互式分析数据的强大工具. 在Scala语言环境下或Py ...
解题：ZJOI 2006 游戏排名系统
题面跟i207M学了学重载运算符后找前驱后继,然后就是练练无旋树堆 #include<map> #include<cstdio> #include<string> ...
python函数：字符串函数示例
优先掌握的操作 #作用:名字,性别,国籍,地址等描述信息 #定义:在单引号\双引号\三引号内,由一串字符组成 name='egon' #优先掌握的操作: #1.按索引取值(正向取+反向取) :只能取 ...
PID控制算法的C语言实现七梯形积分的PID控制算法C语言实现
在PID控制律中积分项的作用是消除余差,为了减小余差,应提高积分项的运算精度,为此,可将矩形积分改为梯形积分. 梯形积分的计算公式为: pid.voltage=pid.Kp*pid.err+index ...
Codeforces Round #410 (Div. 2)A B C D 暴力暴力思路姿势/随机
A. Mike and palindrome time limit per test 2 seconds memory limit per test 256 megabytes input stand ...
洛谷P2345 奶牛集会
题目背景 MooFest, 2004 Open 题目描述约翰的N 头奶牛每年都会参加“哞哞大会”.哞哞大会是奶牛界的盛事.集会上的活动很多,比如堆干草,跨栅栏,摸牛仔的屁股等等.它们参加活动时会聚 ...
uniqid()
uniqid() 函数基于以微秒计的当前时间,生成一个唯一的 ID.
js 30分钟倒计时
<html> <head> <meta charset="UTF-8"> <title></title> </he ...
前端PHP入门-030-文件函数API
bool file_exists ( $指定文件名或者文件路径) 功能:文件是否存在. bool is_readable ( $指定文件名或者文件路径) 功能:文件是否可读 bool is_write ...

【转载】Beautiful Soup库（bs4）入门

【转载】Beautiful Soup库（bs4）入门的更多相关文章

随机推荐

热门专题