爬虫系列二(数据清洗--->bs4解析数据)

一 BeautifulSoup解析

1 环境安装

- 需要将pip源设置为国内源，阿里源、豆瓣源、网易源等

   - windows

    （1）打开文件资源管理器(文件夹地址栏中)

    （2）地址栏上面输入 %appdata%

    （3）在这里面新建一个文件夹  pip

    （4）在pip文件夹里面新建一个文件叫做  pip.ini ,内容写如下即可

        [global]

        timeout = 6000

        index-url = https://mirrors.aliyun.com/pypi/simple/

        trusted-host = mirrors.aliyun.com

   - linux

    （1）cd ~

    （2）mkdir ~/.pip

    （3）vi ~/.pip/pip.conf

    （4）编辑内容，和windows一模一样

- 需要安装：pip install bs4

     bs4在使用时候需要一个第三方库，把这个库也安装一下

     pip install lxml

2 基础解析

使用流程：

    - 导包：from bs4 import BeautifulSoup

    - 使用方式：可以将一个html文档，转化为BeautifulSoup对象，然后通过对象的方法或者属性去查找指定的节点内容

        （1）转化本地文件：

             - soup = BeautifulSoup(open('本地文件'), 'lxml')

        （2）转化网络文件：

             - soup = BeautifulSoup('字符串类型或者字节类型', 'lxml')

        （3）打印soup对象显示内容为html文件中的内容

基础巩固：

    （1）根据标签名查找

        - soup.a   只能找到第一个符合要求的标签

    （2）获取属性

        - soup.a.attrs  获取a所有的属性和属性值，返回一个字典

        - soup.a.attrs['href']   获取href属性

        - soup.a['href']   也可简写为这种形式

    （3）获取内容

        - soup.a.string

        - soup.a.text

        - soup.a.get_text()

       【注意】如果标签还有标签，那么string获取到的结果为None，而其它两个，可以获取文本内容

    （4）find：找到第一个符合要求的标签

        - soup.find('a')  找到第一个符合要求的

        - soup.find('a', title="xxx")

        - soup.find('a', alt="xxx")

        - soup.find('a', class_="xxx")

        - soup.find('a', id="xxx")

    （5）find_all：找到所有符合要求的标签

        - soup.find_all('a')

        - soup.find_all(['a','b']) 找到所有的a和b标签

        - soup.find_all('a', limit=2)  限制前两个

    （6）根据选择器选择指定的内容

               select:soup.select('#feng')

        - 常见的选择器：标签选择器(a)、类选择器(.)、id选择器(#)、层级选择器

            - 层级选择器：(使用比较多)

                div .dudu #lala .meme .xixi  下面好多级

                div > p > a > .lala          只能是下面一级

【注意】select选择器返回永远是列表，需要通过下标提取指定的对象

爬取三国演义书籍

# 下载三国演义书籍http://www.shicimingju.com/book/sanguoyanyi.html

import requests

from bs4 import BeautifulSoup

'''

    解析流程:

        1.pip install bs4

        2.导包:from bs4 import BeautifulSoup

        3.实例化一个BeautifulSoup对象(将页面源码数据加载到该对象中)

        4.调用BeautifulSoup对象中的相关属性和方法进行标签的定位

'''

url='http://www.shicimingju.com/book/sanguoyanyi.html'

headers={

    'user-agent': 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/73.0.3683.20 Safari/537.36'

}

page_data=requests.get(url=url,headers=headers).text

#实例化一个BeautifulSoup对象

soup=BeautifulSoup(page_data,'lxml')

li_list=soup.select('."book-mulu" > ul > li')

fp=open('三国演义.txt','w',encoding='utf8')

for li in li_list:

    url='http://www.shicimingju.com'+li.a['href']

    section_page_data=requests.get(url=url,headers=headers).text

    soup=BeautifulSoup(section_page_data,'lxml')

    section_title=soup.select('.www-main-container > h1')[0].string

    section_content=soup.find('div',class_="chapter_content").text

    fp.write(section_title+'\n'+section_content+'\n\n')

    print(section_title+'\t'+'下载完成')

fp.close()

爬虫系列二(数据清洗--->bs4解析数据)的更多相关文章

爬虫系列二(数据清洗--->xpath解析数据)
一 xpath介绍 XPath 是一门在 XML 文档中查找信息的语言.XPath 用于在 XML 文档中通过元素和属性进行导航. XPath 使用路径表达式在 XML 文档中进行导航 XPath 包 ...
爬虫系列二(数据清洗--->正则表达式)
一正则常识模式描述 \w 匹配字母数字及下划线 \W 匹配非字母数字及下划线 \s 匹配任意空白字符,等价于 [\t\n\r\f]. \S 匹配任意非空字符 \d 匹配任意数字,等价于 [0-9 ...
爬虫系列(二) Chrome抓包分析
在这篇文章中,我们将尝试使用直观的网页分析工具(Chrome 开发者工具)对网页进行抓包分析,更加深入的了解网络爬虫的本质与内涵 1.测试环境浏览器:Chrome 浏览器浏览器版本:67.0.33 ...
Java爬虫系列二：使用HttpClient抓取页面HTML
爬虫要想爬取需要的信息,首先第一步就要抓取到页面html内容,然后对html进行分析,获取想要的内容.上一篇随笔<Java爬虫系列一:写在开始前>中提到了HttpClient可以抓取页面内 ...
爬虫5_python2_使用 Beautiful Soup 解析数据
使用 Beautiful Soup 解析数据(感谢东哥) 有的小伙伴们对写正则表达式的写法用得不熟练,没关系,我们还有一个更强大的工具,叫Beautiful Soup,有了它我们可以很方便地提取出HT ...
面试系列二：精选大数据面试真题JVM专项-附答案详细解析
公众号(五分钟学大数据)已推出大数据面试系列文章-五分钟小面试,此系列文章将会深入研究各大厂笔面试真题,并根据笔面试题扩展相关的知识点,助力大家都能够成功入职大厂! 大数据笔面试系列文章分为两种类型: ...
【Java集合系列二】LinkedList解析
一.简介 1.LinkedList继承关系 2.LinkedList底层实现 LinkedList使用双向链表存储数据,所以没有默认的容量,也不会有扩容一说.只有两个指针,永远指向链表的两端:firs ...
爬虫系列：使用 MySQL 存储数据
上一篇文章我们讲解了爬虫如何存储 CSV 文件,这篇文章,我们讲解如何将采集到的数据保存到 MySQL 数据库中. MySQL 是目前最受欢迎的开源关系型数据库管理系统.一个开源项目具有如此之竞争力实 ...
python爬虫系列之爬京东手机数据
python抓京东手机数据作者:vpoet mail:vpoet_sir@163.com #coding=utf-8 import urllib2 from lxml import etree im ...

随机推荐

NPM 安装速度慢，镜像修改
今天安装gitbook的时候,竟然花了两个小时没有安装成功,大家在使用npm安装依赖的时候速度是不是经常慢的要死?最佳解决方案是手动更改镜像服务器地址, 强烈推荐阿里巴巴在国内的镜像服务器,执行下面命 ...
dotnet core使用IO合并技巧轻松实现千万级消息推送
之前讲述过多路复用实现单服百万级别RPS吞吐,但在文中有一点是没有说的就是消息IO合并,如果缺少了消息IO合并即使怎样多路复用也很难达到百万级别的请求响毕竟所有应用层面的网络IO读写都是非常损耗性能的 ...
云原生实践之 RSocket 从入门到落地：Servlet vs RSocket
技术实践的作用在于:除了用于构建业务,也是为了验证某项技术或框架是否值得大规模推广. 本期开始,我们推出<RSocket 从入门到落地>系列文章,通过实例和对比来介绍RSocket.主要围 ...
-1-2 java 面向对象基本概念封装继承多态变量 this super static 静态变量匿名对象值传递初始化过程代码块 final关键字抽象类接口区别多态包访问权限内部类匿名内部类 == 与 equal
java是纯粹的面向对象的语言也就是万事万物皆是对象程序是对象的集合,他们通过发送消息来相互通信每个对象都有自己的由其他的对象所构建的存储,也就是对象可以包含对象每个对象都有它的类型也就是 ...
python数据包之利器scapy用法!
scapy介绍: 在python中可以通过scapy这个库轻松实现构造数据包.发送数据包.分析数据包,为网络编程之利器! scapy安装: pip install scapy ======> ...
Linux基础命令第三天
1,vim编辑器命令模式下: pageup 往上翻页 pagedown 往下翻页 H 光标移动到屏幕首行 gg 光标动荡到文档的首行,如果前面加上n,表示移动到n行 G 移动文档最后一行 /name ...
[Redux] redux之combineReducers
combineReducers combineReducer 是将众多的 reducer 合成通过键值映射的对象,并且返回一个 combination 函数传入到 createStore 中合并后的 ...
Scrapy爬虫错误日志汇总
1.数组越界问题(list index out of range) 原因:第1种可能情况:list[index]index超出范围,也就是常说的数组越界. 第2种可能情况:list是一个空的, 没有一 ...
[日常] Go-逐行读取文本信息
go逐行读取文本信息:1.os包提供了操作系统函数的不依赖平台的接口,Open方法打开一个文件用于读取,func Open(name string) (file *File, err error)2. ...
【Linux】Linux上安装Nginx
本文介绍Linux环境安装Nginx,这里用的Linux系统是CentOS 7.2. 1. 从Nginx官网下载Nginx.这里用的版本为:1.13.6. 2. 将下载下来的Nginx上传到Linux ...

爬虫系列二(数据清洗--->bs4解析数据)

一 BeautifulSoup解析

爬虫系列二(数据清洗--->bs4解析数据)的更多相关文章

随机推荐

热门专题