beautifulsoup解析

`python独有`

优势：简单、便捷、高效

- 环境安装  需要将pip源设置为国内源

-需要安装：pip install bs4

    bs4在使用时需要一个第三方库

    pip install lxml

流程：
核心思想：可以将html文档转换成Beautiful对象，然后调用对象属性和方法进行html指定内容的定位和查找

1.导包
2.创建Beautiful对象：
- 如果html文档来源于本地：Beautiful('open('本地html文件)',lxml)
- 如果html文档来源于网络：Beautiful（'网络请求到的页面数据','lxml'）
3.使用方法和属性：
- 根据标签名查找
  - soup.a 只能找到第一个符合要求的标签
- 获取属性
  - soup.a.attrs 获取a所有的属性和属性值，返回一个字典
  - soup.a.attrs['href'] 获取href属性也可以简写为 soup.a['href']
- 获取内容
  - soup.a.string
  - soup.a.text
  - soup.a.get_text() 注意：如果标签还有标签，那么string获取的结果为None，而其他两个，可以获取文本内容 -find:找到第一个符合要求的标签
  - soup.find('a')
  - soup.find('a',title='xxx') 类似的
  - soup.find('a',id='xxx') -finAll 获取所有符合条件的标签
  - soup.findAll('a')
  - soup.findAll(['a','b']) 找到所有的a标签和b标签
  - soup.findAll('a',limit=2) 限制取前两个
- 根据选择器选择指定的内容 soup.select() -常见的选择器：标签选择器、类选择器（.）、id选择器(#)、层级选择器
```
  - 层级选择器：

      div .dudu #lala 空格表示下面好多级

      div > p > a > .lala   > 只能是下面一级
```
  注意：select返回的永远是列表，可以通过下标提取指定的对象

练习

需求：爬取古诗文网中三国小说里的标题和内容

import requests

from bs4 import BeautifulSoup

url = 'http://www.shicimingju.com/book/sanguoyanyi.html'

# 自定义请求头信息

headers={

    'User-Agent':'Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'

}

page_text = requests.get(url=url,headers=headers).text

# 数据解析

soup = BeautifulSoup(page_text,'lxml')

li_list=soup.select('.book-mulu > ul > li > a')

# type(li_list[0])  bs4.element.Tag Tag类型的数据可以继续调用属性方法进行解析

f = open('./三国演义.txt','w',encoding='utf-8')

for li in li_list:

    title = li.text

#     print(type(title))

    conten_url ='http://www.shicimingju.com' + li.attrs['href']

    content_page = requests.get(url=conten_url,headers=headers).text

    content_soup = BeautifulSoup(content_page,'lxml')

    content = content_soup.select('.chapter_content')[0]

#     print(content.text)

    f.write(title+content.text+'\n\n\n')

    print(title+'  已写入')

beautifulsoup解析的更多相关文章

BeautifulSoup解析器的选择
BeautifulSoup解析器在我们使用BeautifulSoup的时候,选择怎样的解析器是至关重要的.使用不同的解析器有可能会出现不同的结果! 今天遇到一个坑,在解析某html的时候.使用htm ...
Python3.x的BeautifulSoup解析html常用函数
Python3.x的BeautifulSoup解析html常用函数 1,初始化: soup = BeautifulSoup(html) # html为html源代码字符串,type(html) == ...
Python3.x：BeautifulSoup()解析网页内容出现乱码
Python3.x:BeautifulSoup()解析网页内容出现乱码问题: start_html = requests.get(all_url, headers=Hostreferer) Beau ...
python3+beautifulSoup4.6抓取某网站小说（三）网页分析，BeautifulSoup解析
本章学习内容:将网站上的小说都爬下来,存储到本地. 目标网站:www.cuiweijuxs.com 分析页面,发现一共4步:从主页进入分版打开分页列表.打开分页下所有链接.打开作品页面.打开单章内容. ...
Python爬虫 | Beautifulsoup解析html页面
引入大多数情况下的需求,我们都会指定去使用聚焦爬虫,也就是爬取页面中指定部分的数据值,而不是整个页面的数据.因此,在聚焦爬虫中使用数据解析.所以,我们的数据爬取的流程为: 指定url 基于reque ...
第14.12节 Python中使用BeautifulSoup解析http报文：使用select方法快速定位内容
一. 引言在<第14.10节 Python中使用BeautifulSoup解析http报文:html标签相关属性的访问>和<第14.11节 Python中使用BeautifulSo ...
第14.11节 Python中使用BeautifulSoup解析http报文：使用查找方法快速定位内容
一. 引言在<第14.10节 Python中使用BeautifulSoup解析http报文:html标签相关属性的访问>介绍了BeautifulSoup对象的主要属性,通过这些属性可以访 ...
BeautifulSoup解析库的介绍和使用
### BeautifulSoup解析库的介绍和使用 ### 三大选择器:节点选择器,方法选择器,CSS选择器 ### 使用建议:方法选择器 > CSS选择器 > 节点选择器 ## 测试文 ...
BeautifulSoup解析非标准HTML的问题
发现问题: BeautifulSoup版本:4.3.2 在用BeautifulSoup.find_all()搜索HTML时,遇到下面的代码: <a href="/shipin/dong ...

随机推荐

【计算机网络】ssl双向认证和单向认证原理
有朋友在搞一个项目,周末有聊到一些安全性的东西,很自然会想起https,但https究竟如何实施,其原理又是什么? 基于ssl,一般的应用都是单向认证,如果应用场景要求对客户来源做验证也可以实现成双向 ...
（六）Redis主从自动恢复-sentinel
原文地址,转载请注明出处: http://blog.csdn.net/qq_34021712/article/details/72026313 ©王赛超准备工作:(1个master,2个sl ...
web 单例多例
单例多例需要搞明白两个问题:1. 什么是单例多例:2. 如何产生单例多例:3. 为什么要用单例多例4. 什么时候用单例,什么时候用多例:1. 什么是单例多例:所谓单例就是所有的请求都用一个对象来处理, ...
C 碎片五数组
构造类型数据是有基本类型数据按照一定规则组成的.数组,结构体,共用体都属于构造类型的数据.数组是有序数据的集合,C语言数组中的每一个元素都属于同一个数据类型,用数组名和下标来唯一确定数组中的元素. 一 ...
Android数据库（1）、SQLite数据库介绍
一.关系性数据库关系型数据库主要有以下三个特征,尤为明显,如果没有这个三个特征约束,当多个客户端使用数据的时候就会出现各种各样的错误,所以关系型数据库定义这些约束,让客户端程序只要遵守这个规则便 ...
关于配置httpd2.4.18+php5.6
关于httpd2.4.18下载之前一直很烦php官网上的点半天看不到下载链接,直到看到这么几句话大意是Apache http server 不提供二进制版本,只提供源代码.....如果你不能自己编译 ...
yii：高级应用程序搭建数据库的详细流程
上一章已经把高级应用程序的环境搭配成功,那么下一步就是搭建数据库了. 首先,我们先去创建一个数据库,比如:demo 创建完之后,我们重要的就是将文件中的数据进行一个更新,在www/advancend/ ...
【强力卸载】使用Uninstall Tool卸载各类不易卸载的软件
Uninstall Tool 经测试卸载MySql5.7.18成功. 下载地址: http://files.cnblogs.com/files/xiaohi/%E3%80%90%E8%BD%AF%E4 ...
hihocoder 1109 堆优化的Prim算法
题目链接:http://hihocoder.com/problemset/problem/1109 , 最小生成树 + 堆优化(优先队列). 可以用优先队列,也可以自己手动模拟堆,为了练手,我两种都试 ...
IOS 模仿有storyboard的项目控制器的创建
● 先加载storyboard文件(Test是storyboard的文件名) UIStoryboard *storyboard = [UIStoryboard storyboardWithName:@ ...

beautifulsoup解析

beautifulsoup解析

python独有

练习

beautifulsoup解析的更多相关文章

随机推荐

热门专题

`python独有`