python中BeautifulSoup库使用小结

转载请注明出处：

　　BeautifulSoup是一个用于解析HTML和XML文档的Python库，它提供了一些简单但强大的API，让你可以从文档中提取数据。以下是一些BeautifulSoup的主要特性和功能：

解析HTML和XML文档：BeautifulSoup可以解析HTML和XML文档，并创建一个BeautifulSoup对象，这个对象表示整个文档。可以使用这个对象来搜索和修改文档的元素。

导航文档树：BeautifulSoup提供了一些方法，让你可以在文档树中导航。例如，可以使用find方法来搜索文档树中的元素，使用find_all方法来搜索所有匹配的元素，使用parent，children，descendants等属性来访问元素的父元素，子元素和后代元素。

搜索文档树：BeautifulSoup提供了一些方法，可以搜索文档树中的元素。例如，可以使用find方法来搜索文档树中的第一个匹配的元素，使用find_all方法来搜索所有匹配的元素，使用select方法来使用CSS选择器来搜索元素。

修改文档树：BeautifulSoup提供了一些方法，可以修改文档树中的元素。例如，可以使用append，prepend，insert_before，insert_after方法来添加新的元素，使用replace_with方法来替换元素，使用extract方法来移除元素。

　　使用BeautifulSoup的示例：

from bs4 import BeautifulSoup

# 解析HTML文档

html_doc = """

<html><head><title>The Dormouse's story</title></head>

<body>

<p class="title"><b>The Dormouse's story</b></p>

<p class="story">Once upon a time there were three little sisters; and their names were

<a href="http://example.com/elsie" class="sister" id="link1">Elsie</a>,

<a href="http://example.com/lacie" class="sister" id="link2">Lacie</a> and

<a href="http://example.com/tillie" class="sister" id="link3">Tillie</a>;

and they lived at the bottom of a well.</p>

<p class="story">...</p>

"""

soup = BeautifulSoup(html_doc, 'html.parser')

# 导航文档树

p = soup.find('p', class_='title')

print(p.name)  # 输出: p

print(p.string)  # 输出: The Dormouse's story

# 搜索文档树

links = soup.find_all('a')

for link in links:

    print(link.get('href'))  # 输出: http://example.com/elsie, http://example.com/lacie, http://example.com/tillie

# 修改文档树

p.string.replace_with('A new title')

print(p.string)  # 输出: A new title

　　搜索相邻的元素标签值：

def job():

    soup = BeautifulSoup(html_doc, 'html.parser')

    target_a = soup.find('a', string='Elsie')

    print('target_a', target_a.text)

    if target_a is not None:

        target_a_next = target_a.find_next('a')

        print(target_a_next.text)

    else:

        print("No matching element found.")

job()

python中BeautifulSoup库使用小结的更多相关文章

python中BeautifulSoup库中find函数
http://www.crummy.com/software/BeautifulSoup/bs3/documentation.zh.html#contents 简单的用法: find(name, at ...
python中requests库使用方法详解
目录 python中requests库使用方法详解官方文档什么是Requests 安装Requests库基本的GET请求带参数的GET请求解析json 添加headers 基本POST请求 ...
Python中第三方库Requests库的高级用法详解
Python中第三方库Requests库的高级用法详解虽然Python的标准库中urllib2模块已经包含了平常我们使用的大多数功能,但是它的API使用起来让人实在感觉不好.它已经不适合现在的时代, ...
python之BeautifulSoup库
1. BeautifulSoup库简介和 lxml 一样,Beautiful Soup 也是一个HTML/XML的解析器,主要的功能也是如何解析和提取 HTML/XML 数据.lxml 只会局部遍历 ...
Python爬虫-- BeautifulSoup库
BeautifulSoup库 beautifulsoup就是一个非常强大的工具,爬虫利器.一个灵活又方便的网页解析库,处理高效,支持多种解析器.利用它就不用编写正则表达式也能方便的实现网页信息的抓取 ...
Python中cv2库和matplotlib库色彩空间排布不一致
今天在python中读如图片时发现以下问题: 1.在from matplotlib import pyplot as plt之后,再import cv2 cv2.imshow()不能正常使用,还不知道 ...
Python 中拼音库 PyPinyin 的用法【华为云技术分享】
[摘要] 最近碰到了一个问题,项目中很多文件都是接手过来的中文命名的一些素材,结果在部署的时候文件名全都乱码了,导致项目无法正常运行. 后来请教了一位大佬怎么解决文件名乱码的问题,他说这个需要正面解决 ...
python中pyperclip库的功能
python3中pyperclip库的功能作用就是复制.粘贴例子 import pyperclip pyperclip.copy('Hello world!') pyperclip.paste() ...
Python中msgpack库的使用
msgpack用起来像json,但是却比json快,并且序列化以后的数据长度更小,言外之意,使用msgpack不仅序列化和反序列化的速度快,数据传输量也比json格式小,msgpack同样支持多种语言 ...
关于python中lambda 函数使用小结
例子: 如果定义普通函数,一般都是这样写: def:ds(x): return 2*x+1 调用即: ds(5) 如果用lambda函数就是这么写,就是一句话: g =lambda x:2*x+1 调 ...

随机推荐

使用汇编和反汇编引擎写一个x86任意地址hook
最简单的Hook 刚开始学的时候,用的hook都是最基础的5字节hook,也不会使用hook框架,hook流程如下: 构建一个jmp指令跳转到你的函数(函数需定义为裸函数) 保存被hook地址的至少5 ...
Semantic Kernel 正式发布 v1.0.1 版本
微软在2023年12月19日在博客上(Say hello to Semantic Kernel V1.0.1)发布了Semantic kernel的.NET 正式1.0.1版本.新版本提供了新的文档, ...
DEDECMS 后台系统用户授权目录更改为无限级(默认为二级授权)
在做一个学校的项目,分类有四级分类,总共一百多个分类,因为每个分类对应不同的老师,用于上传资料作为考核,但是添加系统用户的时候发现DEDECMS只有两级分类,所以修改啦一些代码,目前不知道是否修改完全 ...
部署堡垒机3——编译安装redis-6.2.1以上版本
一.环境准备 Redis官网:https://redis.io/download/ 历史版本:http://download.redis.io/releases/ 1.安装依赖 yum -y in ...
SpringBoot整合JavaFx（十三）
SpringBoot整合JavaFx(十三) 在Java中,基本上万物可springboot- 整合了spring全家桶,你可以很方便整合它的生态框架. JavaFx也能整合springboot,下面 ...
BFS（三）单词接龙 ⅱ
对应 126. 单词接龙 II 问题描述按字典 wordList 完成从单词 beginWord 到单词 endWord 转化,一个表示此过程的转换序列是形式上像 beginWord -> ...
基于Llama2模型的开源模型
2023年7月18日Meta开源了Llama2,在2万亿个Token上训练,可用于商业和研究,包括从7B到70B模型权重.预训练和微调的代码.相比Llama1,Llama2有较多提升,评估结果如下 ...
数仓调优实践丨SQL改写消除相关子查询
本文分享自华为云社区<[调优实践]SQL改写消除相关子查询>,作者: 门前一棵葡萄树 . 一.子查询 GaussDB(DWS)根据子查询在SQL语句中的位置把子查询分成了子查询.子链接两种 ...
数仓性能调优：row_number() over(p)-rn=1性能瓶颈发现和改写套路
本文分享自华为云社区<GaussDB(DWS)性能调优:row_number() over(p)-rn=1性能瓶颈发现和改写套路>,作者:Zawami . 1.改写场景本套路应用于子查询 ...
带你认识数仓的监控系统TopSQL
本文分享自华为云社区<GaussDB(DWS)TopSQL总结>,作者:nullptr_ . TopSQL 背景 TopSQL为DWS的监控系统,记录DWS中各个作业.算子级别的资源使用数 ...

python中BeautifulSoup库使用小结

python中BeautifulSoup库使用小结的更多相关文章

随机推荐

热门专题