简单又强大的pandas爬虫利用pandas库的read_html()方法爬取网页表格型数据

文章目录

- - 一、简介
  - 二、原理
  - 三、爬取实战
  - - 实例1
    - 实例2
    - 一、简介
      
      一般的爬虫套路无非是发送请求、获取响应、解析网页、提取数据、保存数据等步骤。构造请求主要用到requests库，定位提取数据用的比较多的有xpath和正则匹配。一个完整的爬虫，代码量少则几十行，多则百来行，对于新手来说学习成本还是比较高的。
      
      谈及pandas的read.xxx系列的函数，常用的读取数据方法为：pd.read_csv() 和 pd.read_excel()，而 pd.read_html() 这个方法虽然少用，但它的功能非常强大，特别是用于抓取Table表格型数据时，简直是个神器。无需掌握正则表达式或者xpath等工具，短短的几行代码就可以将网页数据快速抓取下来并保存到本地。
      
      二、原理
      
      pandas适合抓取Table表格型数据，先了解一下具有Table表格型数据结构的网页，举例如下：
      
      用Chrome浏览器查看网页HTML结构，会发现Table表格型数据有一些共同点，大致的网页结构如下表示。
```
<table class="..." id="..." ...>

	 ...

     <tbody>

        <tr>

            <td>...</td>

        </tr>

        <tr>...</tr>

        <tr>...</tr>

        <tr>...</tr>

        <tr>...</tr>

        ...

        <tr>...</tr>

        <tr>...</tr>

    </tbody>

</table>
```
      - 1
      - 2
      - 3
      - 4
      - 5
      - 6
      - 7
      - 8
      - 9
      - 10
      - 11
      - 12
      - 13
      - 14
      - 15
      网页具有以上结构，我们可以尝试用pandas的 pd.read_html() 方法来直接获取数据。
      
      pd.read_html() 的一些主要参数
      - io：接收网址、文件、字符串
      - header：指定列名所在的行
      - encoding：The encoding used to decode the web page
      - attrs：传递一个字典，用其中的属性筛选出特定的表格
      - parse_dates：解析日期
      三、爬取实战
      
      实例1
      
      爬取2019年成都空气质量数据(12页数据)，目标URL：http://www.tianqihoubao.com/aqi/chengdu-201901.html
```
import pandas as pd

dates = pd.date_range('20190101', '20191201', freq='MS').strftime('%Y%m')   # 构造出日期序列  便于之后构造url

for i in range(len(dates)):

    df = pd.read_html(f'http://www.tianqihoubao.com/aqi/chengdu-{dates[i]}.html', encoding='gbk', header=0)[0]

    if i == 0:

        df.to_csv('2019年成都空气质量数据.csv', mode='a+', index=False)     # 追加写入

        i += 1

    else:

        df.to_csv('2019年成都空气质量数据.csv', mode='a+', index=False, header=False)
```
      - 1
      - 2
      - 3
      - 4
      - 5
      - 6
      - 7
      - 8
      - 9
      - 10
      9行代码搞定，爬取速度也很快。
      
      查看保存下来的数据
      
      实例2
      
      抓取新浪财经基金重仓股数据(25页数据)，URL：http://vip.stock.finance.sina.com.cn/q/go.php/vComStockHold/kind/jjzc/index.phtml?p=25
```
import pandas as pd

df = pd.DataFrame()

for i in range(1, 26):

    url = f'http://vip.stock.finance.sina.com.cn/q/go.php/vComStockHold/kind/jjzc/index.phtml?p={i}'

    df = pd.concat([df, pd.read_html(url)[0].iloc[::,:-1]])    # 合并DataFrame  不要明细那一列

df.to_csv('新浪财经基金重仓股数据.csv', encoding='utf-8', index=False)
```
      - 1
      - 2
      - 3
      - 4
      - 5
      - 6
      - 7
      6行代码搞定，爬取速度也很快。
      
      查看保存下来的数据：
      
      之后在爬取一些小型数据时，只要遇到这种Table表格型数据，就可以先试试 pd.read_html() 大法。
    - 还有不懂的小伙伴可以加我的扣群86七06七945来请教我，有专门的老师为你解答。
    - 本文的文字及图片来源于网络加上自己的想法,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理。

简单又强大的pandas爬虫利用pandas库的read_html()方法爬取网页表格型数据的更多相关文章

针对源代码和检查元素不一致的网页爬虫——利用Selenium、PhantomJS、bs4爬取12306的列车途径站信息
整个程序的核心难点在于上次豆瓣爬虫针对的是静态网页,源代码和检查元素内容相同:而在12306的查找搜索过程中,其网页发生变化(出现了查找到的数据),这个过程是动态的,使得我们在审查元素中能一一对应看到 ...
python3下scrapy爬虫(第八卷:循环爬取网页多页数据）
之前我们做的数据爬取都是单页的现在我们来讲讲多页的一般方式有两种目标URL循环抓取另一种在主页连接上找规律,现在我用的案例网址就是通过点击下一页的方式获取多页资源话不多说全在代码里(因为刚才写 ...
爬虫概念与编程学习之如何爬取视频网站页面（用HttpClient）（二）
先看,前一期博客,理清好思路. 爬虫概念与编程学习之如何爬取网页源代码(一) 不多说,直接上代码. 编写代码运行 <!DOCTYPE html><html><head& ...
利用pandas库中的read_html方法快速抓取网页中常见的表格型数据
本文转载自:https://www.makcyun.top/web_scraping_withpython2.html 需要学习的地方: (1)read_html的用法作用:快速获取在html中页面 ...
java爬虫-简单爬取网页图片
刚刚接触到“爬虫”这个词的时候是在大一,那时候什么都不明白,但知道了百度.谷歌他们的搜索引擎就是个爬虫. 现在大二.再次燃起对爬虫的热爱,查阅资料,知道常用java.python语言编程,这次我选择了 ...
利用python爬取58同城简历数据
利用python爬取58同城简历数据利用python爬取58同城简历数据最近接到一个工作,需要获取58同城上面的简历信息(http://gz.58.com/qzyewu/).最开始想到是用pyth ...
爬虫系列(十一) 用requests和xpath爬取豆瓣电影评论
这篇文章,我们继续利用 requests 和 xpath 爬取豆瓣电影的短评,下面还是先贴上效果图: 1.网页分析 (1)翻页我们还是使用 Chrome 浏览器打开豆瓣电影中某一部电影的评论进行分析 ...
Java两种方式简单实现：爬取网页并且保存
注:如果代码中有冗余,错误或者不规范,欢迎指正. Java简单实现:爬取网页并且保存对于网络,我一直处于好奇的态度.以前一直想着写个爬虫,但是一拖再拖,懒得实现,感觉这是一个很麻烦的事情,出现个小错 ...
node：爬虫爬取网页图片
代码地址如下:http://www.demodashi.com/demo/13845.html 前言周末自己在家闲着没事,刷着微信,玩着手机,发现自己的微信头像该换了,就去网上找了一下头像,看着图片 ...

随机推荐

Docker Swarm 集群环境搭建及弹性服务部署
上一篇文章<Docker Swarm 集群管理利器核心概念扫盲>中我们把 Swarm 重要的概念性知识给大家讲解了一波,理论完事就该实战了,这篇文章带大家从零开始,搭建 Docker Sw ...
python的全局函数
1.Python的全局函数 import builtins dir(builtins) abs # 返回参数的绝对值可以写成函数:def absnum): if num >=0: retu ...
使用Commons FileUpload 1.3.3和Servlet 3.0上传文件
简介 Commons FileUpload可以轻松地为web应用程序添加强大,高性能的文件上传功能.Servlet3.0之前的web应用程序需要使用Commons FileUpload组件上传文件,但 ...
Python-对迭代器进行切片操作-itertools模块
案例: 对于某个文件,我只想读取到其中100~200行之间的内容,是否可以通过切片的方式进行读取? 我想: f = open() f[100:200] 可行? 如何解决这个问题? 方法1: 全部读取到 ...
JS进阶系列-JS执行期上下文(一)
❝ 点赞再看,年薪百万本文已收录至https://github.com/likekk/-Blog欢迎大家star,共同进步.如果文章有出现错误的地方,欢迎大家指出.后期将在将GitHub上规划前端学 ...
Python练习题 030：Project Euler 002：偶数斐波那契数之和
本题来自 Project Euler 第2题:https://projecteuler.net/problem=2 # Each new term in the Fibonacci sequence ...
Java学习day01
1.Java的种类: JavaSE(Java标准版) JavaEE(Java企业版) JavaME(Java微型版) 其中,JavaSE是基础,以后的方向是JavaEE(Java企业版) 2.什么是J ...
cdev_alloc与cdev_init区别
struct cdev *cdev_alloc(void) { struct cdev *p = kzalloc(sizeof(struct cdev), GFP_KERNEL); if (p) { ...
Java知识系统回顾整理01基础05控制流程03 while
while和do-while循环语句一.while:条件为true时重复执行只要while中的表达式成立,就会不断地循环执行 public class HelloWorld { public s ...
浅谈Exgcd（扩展欧几里得）
我们已知,求最大公约数的方法: 求A,B两数的最大公约数,递归求解,递归边界是B==0. gcd(a,b)=gcd(b,a%b) 我们进一步来求Ax+By=Gcd(A,B)的解. 尝试套用欧几里得求法 ...

简单又强大的pandas爬虫 利用pandas库的read_html()方法爬取网页表格型数据

文章目录

一、简介

二、原理

三、爬取实战

实例1

实例2

简单又强大的pandas爬虫 利用pandas库的read_html()方法爬取网页表格型数据的更多相关文章

随机推荐

热门专题

简单又强大的pandas爬虫利用pandas库的read_html()方法爬取网页表格型数据

简单又强大的pandas爬虫利用pandas库的read_html()方法爬取网页表格型数据的更多相关文章