Python 爬虫-BeautifulSoup

2017-07-26 10:10:11

Beautiful Soup可以解析html 和 xml 格式的文件。

Beautiful Soup库是解析、遍历、维护“标签树”的功能库。使用BeautifulSoup库非常简单，只需要两行代码，就可以完成BeautifulSoup类的创建，这里命名为soup,接下来就可以对soup进行相关处理了。一个BeautifulSoup类对应html或者xml的全部内容。

BeautifulSoup库将任意html文件转换成utf-8格式

一、解析器

BeautifulSoup类创建的时候第二个参数是解析器，上面的代码中用的解析器为‘html.parser’，BeautifulSoup支持的解析器有：

二、BeautifulSoup类的基本元素

使用soup.tag来访问一个标签的内容，如：soup.title;soup.a等，这里的返回值为访问标签的第一个出现的值
使用soup.tag.name可以得到当前标签的名字，返回值为字符串，如：soup.a.name 会返回字符串 ‘a’,也可以使用soup.a.parent.name来查看 a 标签父母的名字
使用soup.tag.attrs可以得到当前标签的属性，返回值为一个字典，如果没有属性会返回一个空字典，如：soup.a.attrs 会返回 a 标签的属性信息
使用soup.tag.string可以得到当前标签的字符串，如：soup.a.string 会返回 a 标签的内容字符串
内容字符串有两种类型一是NavigableString类型，一种是Comment类型，Comment类型的格式是<p> </p>,在调用soup.p.string是会返回This is an comment，但是其类型是Comment类型。

三、soup的内容遍历

标签树的遍历有三种方式，即下行遍历，上行遍历和平行遍历。

（1）下行遍历属性

举例：

#遍历儿子节点

for child in soup.body.children:

    print(child)

#遍历子孙节点

for child in soup.body.descendants:

print(child)

值得注意的是子孙节点不仅包含标签，还包含标签之间的字符串类型，这点需要注意与排除。

（2）上行遍历的属性

soup.parent为空，需要进行区分，可以使用for循环对parents进行遍历：

（3）平行遍历的属性

#遍历后续节点

for sibling in soup.a.next_sibling:

    print(sibling)

#遍历前续节点

for sibling in soup.a.previous_sibling:

    print(sibling)

四、信息提取

name : 对标签名称的检索字符串，返回标签name的所有内容，并生成列表，也以使用列表一次查找多个标签；如果标签名称为TRUE，将返回所有的标签信息；也可以使用正则对返回的标签信息做筛选

attrs: 对标签属性值的检索字符串，可标注属性检索，返回列表，属性值必须精确，如果不提供精确的值得话，会返回空列表，可以使用正则表达式进行非精确的匹配

recursive: 是否对子孙全部检索，默认True

string: <>…</>中字符串区域的检索字符串，需要加上string=‘’进行检索

简写方式：

扩展方法：

Python 爬虫-BeautifulSoup的更多相关文章

Python爬虫-- BeautifulSoup库
BeautifulSoup库 beautifulsoup就是一个非常强大的工具,爬虫利器.一个灵活又方便的网页解析库,处理高效,支持多种解析器.利用它就不用编写正则表达式也能方便的实现网页信息的抓取 ...
python爬虫---BeautifulSoup的用法
BeautifulSoup是一个灵活的网页解析库,不需要编写正则表达式即可提取有效信息. 推荐使用lxml作为解析器,因为效率更高. 在Python2.7.3之前的版本和Python3中3.2.2之前 ...
Python爬虫--beautifulsoup 4 用法
Beautiful Soup将复杂HTML文档转换成一个复杂的树形结构, 每个节点都是Python对象,所有对象可以归纳为4种: Tag , NavigableString , BeautifulSo ...
python爬虫BeautifulSoup库class_
因为class是python的关键字,所以在写过滤的时候,应该是这样写: r = requests.get(web_url, headers=headers) # 向目标url地址发送get请求,返回 ...
python爬虫 BeautifulSoup
简单来说,Beautiful Soup是python的一个库,最主要的功能是从网页抓取数据. Beautiful Soup自动将输入文档转换为Unicode编码,输出文档转换为utf-8编码. Bea ...
Python爬虫 | Beautifulsoup解析html页面
引入大多数情况下的需求,我们都会指定去使用聚焦爬虫,也就是爬取页面中指定部分的数据值,而不是整个页面的数据.因此,在聚焦爬虫中使用数据解析.所以,我们的数据爬取的流程为: 指定url 基于reque ...
Python 爬虫 —— BeautifulSoup
from bs4 import BeautifulSoup % 首字母大写,显然这是一个类 1. BeautifulSoup 类 HTML 解析类(parser) r = requests.get(. ...
python爬虫主要就是五个模块：爬虫启动入口模块，URL管理器存放已经爬虫的URL和待爬虫URL列表，html下载器，html解析器，html输出器同时可以掌握到urllib2的使用、bs4（BeautifulSoup）页面解析器、re正则表达式、urlparse、python基础知识回顾（set集合操作）等相关内容。
本次python爬虫百步百科,里面详细分析了爬虫的步骤,对每一步代码都有详细的注释说明,可通过本案例掌握python爬虫的特点: 1.爬虫调度入口(crawler_main.py) # coding: ...
Python爬虫：用BeautifulSoup进行NBA数据爬取
爬虫主要就是要过滤掉网页中没用的信息.抓取网页中实用的信息一般的爬虫架构为: 在python爬虫之前先要对网页的结构知识有一定的了解.如网页的标签,网页的语言等知识,推荐去W3School: W3s ...

随机推荐

linux lvs
Integer类之成员变量
一.一共11个成员变量. 二.详情介绍. 1.value值.这个是Integer类的唯一标志.最重要的实例属性. 2.最小值和最大值常量.注意,计算机里面是以补码形式保存的,因此用十六进制时,给的数据 ...
amaze ui实现下拉列表
对amaze ui ,只能说很好,很适合开发者使用,然后省略一万字. 今天记录下下拉列表的实现. 关于调用,这里不赘述了, 直接记录代码: <ul class="am-dropdown ...
原生 ajax
1.创建XMLHttpRequest对象 var xmlhttp; if (window.XMLHttpRequest) {// code for IE7+, Firefox, Chrome, Ope ...
Intro to Python for Data Science Learning 2 - List
List from:https://campus.datacamp.com/courses/intro-to-python-for-data-science/chapter-2-python-list ...
git提交时候出错
Please make sure you have the correct access rights and the repository exists. 解决方案: 主要原因是没有加载keygen ...
python3.4学习笔记(一) 基本语法 python3不向下兼容，有些语法跟python2.x不一样
python3.4学习笔记(一) 基本语法 python3不向下兼容,有些语法跟python2.x不一样,IDLE shell编辑器,快捷键:ALT+p,上一个历史输入内容,ALT+n 下一个历史输入 ...
php 写内容到文件,把日志写到log文件
php 写内容到文件,把日志写到log文件 <?php header("Content-type: text/html; charset=utf-8"); /******** ...
IT行业——Linux
现在是21世纪,是科学技术大力发展的一个时代,IT行业已经成为现在的一个非常热门的一个行业,许许多多的人都想要往IT方面发展,找IT方面相关的一个工作.因此,现在也出现了很多IT培训机构,比如培训Li ...
【前端开发】利用Fiddler抓包工具进行本地调试
解决什么问题: 解决前端在本地联调页面 || 样式 || 脚本时经常修改服务器代码,浪费太多时间. 避免多人同时修改代码产生冲突问题.可以在本地调完代码之后,再贴到服务器上. 其实这个问题老早就开始想 ...

Python 爬虫-BeautifulSoup

Python 爬虫-BeautifulSoup的更多相关文章

随机推荐

热门专题