beautifulsoup之CSS选择器

BeautifulSoup支持大部分的CSS选择器，其语法为：向tag或soup对象的.select()方法中传入字符串参数，选择的结果以列表形式返回。

　　tag.select("string")

　　BeautifulSoup.select("string")

源代码示例：

html = """
<html>
    <head>
        <title>The Dormouse's story</title>
    </head>
    <body>
        <p class="title" name="dromouse">
            <b>The Dormouse's story</b>
        </p>
        <p class="story">
            Once upon a time there were three little sisters; and their names were
            <a class="mysis" href="http://example.com/elsie" id="link1">
                <b>the first b tag<b>
                Elsie
            </a>,
            <a class="mysis" href="http://example.com/lacie" id="link2" myname="kong">
                Lacie
            </a>and
            <a class="mysis" href="http://example.com/tillie" id="link3">
                Tillie
            </a>;and they lived at the bottom of a well.
        </p>
        <p class="story">
            myStory
            <a>the end a tag</a>
        </p>
        <a>the p tag sibling</a>
    </body>
</html>
"""

soup = BeautifulSoup(html,'lxml')

　　1、通过标签选择

# 选择所有title标签

soup.select("title")

# 选择所有p标签中的第三个标签

soup.select("p:nth-of-type(3)") 相当于soup.select(p)[2]

# 选择body标签下的所有a标签

soup.select("body a")

# 选择body标签下的直接a子标签

soup.select("body > a")

# 选择id=link1后的所有兄弟节点标签

soup.select("#link1 ~ .mysis")

# 选择id=link1后的下一个兄弟节点标签

soup.select("#link1 + .mysis")

　　2、通过类名查找

# 选择a标签，其类属性为mysis的标签

soup.select("a.mysis")

　　3、通过id查找

# 选择a标签，其id属性为link1的标签

soup.select("a#link1")

　　4、通过【属性】查找，当然也适用于class

# 选择a标签，其属性中存在myname的所有标签

soup.select("a[myname]")

# 选择a标签，其属性href=http://example.com/lacie的所有标签

soup.select("a[href='http://example.com/lacie']")

# 选择a标签，其href属性以http开头

soup.select('a[href^="http"]')

# 选择a标签，其href属性以lacie结尾

soup.select('a[href$="lacie"]')

# 选择a标签，其href属性包含.com

soup.select('a[href*=".com"]')

# 从html中排除某标签，此时soup中不再有script标签

[s.extract() for s in soup('script')]

# 如果想排除多个呢

[s.extract() for s in soup(['script','fram']

　　5、获取文本及属性

html_doc = """<html>

    <head>

        <title>The Dormouse's story</title>

    </head>

<body>

    <p class="title"><b>The Dormouse's story</b></p>

    <p class="story">Once upon a time there were three little sisters; and their names were

        <a href="http://example.com/elsie" class="sister" id="link1">Elsie</a>,

        <a href="http://example.com/lacie" class="sister" id="link2">Lacie</a> and

        <a href="http://example.com/tillie" class="sister" id="link3">Tillie</a>;

    </p>

        and they lived at the bottom of a well.

    <p class="story">...</p>

</body>

"""

from bs4 import BeautifulSoup

'''

以列表的形式返回

'''

soup = BeautifulSoup(html_doc, 'html.parser')

s = soup.select('p.story')

s[].get_text()  # p节点及子孙节点的文本内容

s[].get_text("|")  # 指定文本内容的分隔符

s[].get_text("|", strip=True)  # 去除文本内容前后的空白

print(s[].get("class"))  # p节点的class属性值列表（除class外都是返回字符串）

　　6、UnicodeDammit.detwingle() 方法只能解码包含在UTF-8编码中的Windows-1252编码内容,

new_doc = UnicodeDammit.detwingle(doc)

print(new_doc.decode("utf8"))

# ☃☃☃“I like snowmen!”

在创建 BeautifulSoup 或 UnicodeDammit 对象前一定要先对文档调用 UnicodeDammit.detwingle() 确保文档的编码方式正确.如果尝试去解析一段包含Windows-1252编码的UTF-8文档,就会得到一堆乱码,比如: â˜ƒâ˜ƒâ˜ƒ“I like snowmen!”.

　　7、其它：

html_doc = """<html>

    <head>

        <title>The Dormouse's story</title>

    </head>

<body>

    <p class="title"><b>The Dormouse's story</b></p>

    <p class="story">Once upon a time there were three little sisters; and their names were

        <a href="http://example.com/elsie" class="sister" id="link1">Elsie</a>,

        <a href="http://example.com/lacie" class="sister" id="link2">Lacie</a> and

        <a href="http://example.com/tillie" class="sister" id="link3">Tillie</a>;

    </p>

        and they lived at the bottom of a well.

    <p class="story">...</p>

</body>

"""

from bs4 import BeautifulSoup

'''

以列表的形式返回

'''

soup = BeautifulSoup(html_doc, 'html.parser')

soup.select('title')  # title标签

soup.select("p:nth-of-type(3)")  # 第三个p节点

soup.select('body a')  # body下的所有子孙a节点

soup.select('p > a')  # 所有p节点下的所有a直接节点

soup.select('p > #link1')  # 所有p节点下的id=link1的直接子节点

soup.select('#link1 ~ .sister')  # id为link1的节点后面class=sister的所有兄弟节点

soup.select('#link1 + .sister')  # id为link1的节点后面class=sister的第一个兄弟节点

soup.select('.sister')  # class=sister的所有节点

soup.select('[class="sister"]')  # class=sister的所有节点

soup.select("#link1")  # id=link1的节点

soup.select("a#link1")  # a节点，且id=link1的节点

soup.select('a[href]')  # 所有的a节点，有href属性

soup.select('a[href="http://example.com/elsie"]')  # 指定href属性值的所有a节点

soup.select('a[href^="http://example.com/"]')  # href属性以指定值开头的所有a节点

soup.select('a[href$="tillie"]')  # href属性以指定值结尾的所有a节点

soup.select('a[href*=".com/el"]')  # 支持正则匹配

beautifulsoup之CSS选择器的更多相关文章

【网络爬虫入门04】彻底掌握BeautifulSoup的CSS选择器
[网络爬虫入门04]彻底掌握BeautifulSoup的CSS选择器广东职业技术学院欧浩源 2017-10-21 1.引言目前,除了官方文档之外,市面上及网络详细介绍BeautifulSoup ...
bs4 CSS选择器
#https://www.crummy.com/software/BeautifulSoup/bs4/doc/index.zh.html#find-all #beautifulSoup可以解析HTML ...
爬虫之BeautifulSoup， CSS
1. Beautiful Soup的简介 2. Beautiful Soup 安装可以利用 pip 或者 easy_install 来安装,以下两种方法均可 easy_install beautif ...
六、CSS 选择器：BeautifulSoup4
和 lxml 一样,Beautiful Soup 也是一个HTML/XML的解析器,主要的功能也是如何解析和提取 HTML/XML 数据. lxml 只会局部遍历,而Beautiful Soup 是基 ...
如何利用CSS选择器抓取京东网商品信息
前几天小编分别利用Python正则表达式.BeautifulSoup.Xpath分别爬取了京东网商品信息,今天小编利用CSS选择器来为大家展示一下如何实现京东商品信息的精准匹配~~ CSS选择器目前 ...
使用requests爬取梨视频、bilibili视频、汽车之家，bs4遍历文档树、搜索文档树，css选择器
今日内容概要使用requests爬取梨视频 requests+bs4爬取汽车之家 bs4遍历文档树 bs4搜索文档树 css选择器内容详细 1.使用requests爬取梨视频 # 模拟发送http ...
前端极易被误导的css选择器权重计算及css内联样式的妙用技巧
记得大学时候,专业课的网页设计书籍里面讲过css选择器权重的计算:id是100,class是10,html标签是5等等,然后全部加起来的和进行比较... 我只想说:真是误人子弟,害人不浅! 最近,在前 ...
css选择器
常用css选择器,希望对大家有所帮助,不喜勿喷. 1.*:通用选择器 * { margin: 0; padding: 0; } 选择页面上的全部元素,通常用于清除浏览器默认样式,不推荐使用. 2.#i ...
dynamic-css 动态 CSS 库，使得你可以借助 MVVM 模式动态生成和更新 css，从 js 事件和 css 选择器的苦海中脱离出来
dynamic-css 使得你可以借助 MVVM 模式动态生成和更新 css,从而将本插件到来之前,打散.嵌套在 js 中的修改样式的代码剥离出来.比如你要做元素跟随鼠标移动,或者根据滚动条位置的变化 ...

随机推荐

Hive文件存储格式和hive数据压缩
一.存储格式行存储和列存储二.Hive文件存储格式三.创建语句和压缩一.存储格式行存储和列存储行存储可以理解为一条记录存储一行,通过条件能够查询一整行数据. 列存储,以字段聚集存储,可以理解为 ...
转载《浅析MVC框架中View层的优雅设计及实例》
在基于B/S的应用程序开发中,从基本的技术分工上来说就是两大块,一是软件显示界面,另一个是程序逻辑.在N年前的脚本语言时代,无论是asp.php还是jsp,我们基本是都是把这两者柔和在一起的.尽管我们 ...
redis实战笔记（4）-第4章数据安全与性能保障
本章主要内容 4.1 将数据持久化至硬盘 4.2 将数据复制至其他机器 4.3 处理系统故障 4.4 Redis事务 4.5 非事务型流水线( non-transactional pipeline) ...
es索引的RestHighLevelClient实现
java代码: import java.io.IOException; import org.apache.http.HttpHost; import org.elasticsearch.action ...
[codeup] 1126 看电视
题目描述暑假到了,小明终于可以开心的看电视了.但是小明喜欢的节目太多了,他希望尽量多的看到完整的节目. 现在他把他喜欢的电视节目的转播时间表给你,你能帮他合理安排吗? 输入输入包含多组测试数据.每 ...
自己实现一个双向绑定的Vue
我们知道双向绑定是Vue的核心之一,接下来我们自己仿照Vue实现一个基本的功能. 项目代码在GitHub上: https://github.com/zhangKunUserGit/zk-vue
使用 ahk 让普通键盘变为Dvorak键盘
本文告诉大家,如何使用软件做出Dvorak键盘. 在开始说如何做之前,需要告诉大家,什么是Dvorak键盘. Dvorak Simplified Keyboard /ˈdvɔːræk, dəˈvɔː- ...
通过set赋值，与select赋值的区别
---通过set赋值,与select赋值的区别.declare @a int--set @a=(select count(*) from TblStudent)select @a=count(*) f ...
vue常见知识点整理
什么是 mvvm? MVVM 是 Model-View-ViewModel 的缩写.mvvm 是一种设计思想.Model 层代表数据模型,也可以在 Model 中定义数据修改和操作的业务逻辑:View ...
Android全屏的两种方法
在开发中我们经常需要把我们的应用设置为全屏,这里我所知道的有俩中方法,一中是在代码中设置,另一种方法是在配置文件里改! 一.在代码中设置: [java] view plain copy package ...

beautifulsoup之CSS选择器

beautifulsoup之CSS选择器的更多相关文章

随机推荐

热门专题