BeautifulSoup库入门

BeautifulSoup库的理解

BeautifulSoup库是解析、遍历、维护”标签树”的功能库

示例代码:

from bs4 import BeautifulSoup

soup = BeautifulSoup("<html>data</html>","html.parser")#第一参数是html文档,第二个参数指定parser类型是html.parser

soup2 = BeautifulSoup(open("d://demo.html"),"html.parser")

BeautifulSoup解析器

解析器	使用方法	条件
bs4的html解析器:	BeautifulSoup(mk,’html.parser’)	安装bs4库
lxml的html解析器:	BeautifulSoup(mk,’lxml’)	pip install lxml
lxml的xml解析器:	BeautifulSoup(mk,’xml’)	pip install lxml
html5lib的解析器:	BeautifulSoup(mk,’html5lib’)	pip install html5lib

BeautifulSoup类的基本元素

基本元素	说明	使用方式
Tag	标签,最基本的信息组织单元,分别用<>和表明开头和结尾	soup.a soup.p soup.head soup.title
Name	标签的名字, \…\<\/p> 的名字是p，格式.name	soup.a.name soup.p.name soup.div.name
Attribute	标签的属性,字典形式组织,格式: .attrs	soup.a.attrs soup.div.attrs
NavigableString	标签内非属性字符串,<>中字符串,格式:.string	soup.a.string soup.p.string
Comment	标签内字符串的注释部分	soup.a.string(会去掉!–和–,只显示注释内容,但是用type(soup.a.string)会返回)

使用BeautifulSoup遍历HTML DOM树

属性	说明
.contents	子节点的列表,将说有儿子节点存入列表
.children	子节点的迭代类型,与.contents类似,用于遍历儿子节点
.descendants	子孙节点的迭代类型,包含所有子孙节点,用于循环遍历
.parent	节点的父亲标签
.parents	节点所有祖先标签,用于循环遍历祖先节点
.next_sibling	返回按照HTML文本顺序的下一个平行节点标签
.previous_sibling	返回按照HTML文本顺序的上一个平行节点标签
.next_siblings	迭代类型,返回按照HTML文本顺序的后续所有平行节点标签
.previous_siblings	迭代类型,返回按照HTML文本顺序的前续所有平行节点标签

实例代码:

from bs4 import BeautifulSoup

import requests

response = requests.get("http://www.icourse163.org/learn/BIT-1001870001")

html = response.text

soup = BeautifulSoup(html,"html.parser")

tag = soup.a

print(tag.contents)#打印子节点列表

for child in tag.children:#迭代所有子节点

    print(child)

for descendant in tag.descendants:#迭代所有子孙节点

    print(descendant

print(tag.parent)#打印父亲节点

for parent in tag.parents:#迭代所有父节点

    print(parent)

print(tag.next_sibling)#下一个兄弟节点

BeautifulSoup入门的更多相关文章

python 中BeautifulSoup入门
什么是BeautifulSoup? Beautiful Soup 是用Python写的一个HTML/XML的解析器,它可以很好的处理不规范标记并生成剖析树(parse tree). 它提供简单又常用的 ...
用python的BeautifulSoup分析html 【转】
原地址:http://www.cnblogs.com/twinsclover/archive/2012/04/26/2471704.html 序言之前用python爬取网页的时候,一直用的是rege ...
爬虫（四）：BeautifulSoup库的使用
一:beautifulsoup简介 beautifulsoup是一个非常强大的工具,爬虫利器. beautifulSoup “美味的汤,绿色的浓汤” 一个灵活又方便的网页解析库,处理高效,支持多种解析 ...
用python的BeautifulSoup分析html
序言之前用python爬取网页的时候,一直用的是regex或者自带的库sgmllib里的SGMLParser.但是遇到复杂一点的情况时,SGMLParser往往就不那么给力了!(哈,难道说我 too ...
Goldeneye.py网站压力测试工具2.1版源码
Goldeneye压力测试工具的源代码,粗略看了下,代码写的蛮规范和易读的,打算边读边加上了中文注释,但是想来也没太大必要,代码600多行,值得学习的地方还是蛮多的,喜欢Python的同学可以一读这 ...
【爬虫入门手记03】爬虫解析利器beautifulSoup模块的基本应用
[爬虫入门手记03]爬虫解析利器beautifulSoup模块的基本应用 1.引言网络爬虫最终的目的就是过滤选取网络信息,因此最重要的就是解析器了,其性能的优劣直接决定这网络爬虫的速度和效率.Bea ...
【网络爬虫入门04】彻底掌握BeautifulSoup的CSS选择器
[网络爬虫入门04]彻底掌握BeautifulSoup的CSS选择器广东职业技术学院欧浩源 2017-10-21 1.引言目前,除了官方文档之外,市面上及网络详细介绍BeautifulSoup ...
【网络爬虫入门03】爬虫解析利器beautifulSoup模块的基本应用
[网络爬虫入门03]爬虫解析利器beautifulSoup模块的基本应用 1.引言网络爬虫最终的目的就是过滤选取网络信息,因此最重要的就是解析器了,其性能的优劣直接决定这网络爬虫的速度和效率.B ...
【网络爬虫入门01】应用Requests和BeautifulSoup联手打造的第一条网络爬虫
[网络爬虫入门01]应用Requests和BeautifulSoup联手打造的第一条网络爬虫广东职业技术学院欧浩源 2017-10-14 1.引言在数据量爆发式增长的大数据时代,网络与用户的沟 ...

随机推荐

Openstack之七:实现基于桥接的内外网络
一.在控制端进行配置网络 #启动实例文档:https://docs.openstack.org/ocata/zh_CN/install-guide-rdo/launch-instance.html# ...
APICloud联合腾讯云推出“云主机解决方案“，各种福利等你拿
为了帮助开发者一站式打通云.开发.运维全流程服务,更全面提供基于自身业务情况的云服务器.数据库.存储等基础设施服务,APICloud联合腾讯云重磅推出“云主机解决方案“.开发者可通过控制台简单清晰的购 ...
Vue中的nextTick()浅析
引言在开发过程中,我们经常遇到这样的问题:我明明已经更新了数据,为什么当我获取某个节点的数据时,却还是更新前的数据? 一,浅析为什么会这样呢?带着这个疑问先往下看. 先看一个小的例子: <d ...
Docker + node(koa) + nginx + mysql 开发环境搭建
什么是Docker Docker 是一个开源的应用容器引擎,基于 Go 语言并遵从 Apache2.0 协议开源. Docker 可以让开发者打包他们的应用以及依赖包到一个轻量级.可移植的容器中,然 ...
Flask蓝图(Blueprint)
一.作用 1.目录结构划分 2.url添加前缀 url_prefix 3.应用特殊装饰器,在该蓝图定义的特殊装饰器,只在改蓝图的起效二.简单示例 1.创建一个项目文件 2.创建一个同名的python ...
2017-10-28 noip模拟赛by WISCO 信息组
第一次做模拟赛,自我感觉良好(大概是这套题比较简单) T1 名称为“数据结构”,这也太坑了点……233 要维护一个数列(初始为零),支持区间加与查询. 查询的是一个区间中有多少数满足min<=( ...
关于 C#和.net 的发展
591. C# 1 的委托语法看起来似乎并不太坏 [2016-04-27 09:00:56]592. C# 2 支持从方法组到一个兼容委托类型的隐式转换. [2016 ...
P2869 [USACO07DEC]美食的食草动物Gourmet Grazers
P2869 [USACO07DEC]美食的食草动物Gourmet Grazers 题目:约翰的奶牛对食物越来越挑剔了.现在,商店有M 份牧草可供出售,奶牛食量很大,每份牧草仅能供一头奶牛食用.第i 份 ...
使用LD_PRELOAD注入程序
LD_PRELOAD是Linux系统的一个环境变量,它可以影响程序的运行时的链接(Runtime linker),它允许你定义在程序运行前优先加载的动态链接库.这个功能主要就是用来有选择性的载入不同动 ...
用WORD批量制作工作证件
用WORD批量制作工作证件一.采集电子照片电子照片的采集要求以的名字作为照片的文件名,保存为“.jpg”格式,尺寸和大小需保持一致. 二.制作信息表制作Exice数据信息表,包含姓名.年龄.部门 ...

BeautifulSoup入门

BeautifulSoup库入门

BeautifulSoup库的理解

BeautifulSoup解析器

BeautifulSoup类的基本元素

使用BeautifulSoup遍历HTML DOM树

BeautifulSoup入门的更多相关文章

随机推荐

热门专题