[爬虫]用python的requests模块爬取糗事百科段子

　　虽然Python的标准库中 urllib2 模块已经包含了平常我们使用的大多数功能，但是它的 API 使用起来让人感觉不太好，而 Requests 自称 “HTTP for Humans”，说明使用更简洁方便。Requests 继承了urllib2的所有特性。Requests支持HTTP连接保持和连接池，支持使用cookie保持会话，支持文件上传，支持自动确定响应内容的编码，支持国际化的 URL 和 POST 数据自动编码。

　　爬取糗事百科网站https://www.qiushibaike.com/段子，需要分两步解析数据的过程。首先将html页面整体爬下来，然后再利用正则将不需要字符过滤。

　　第一步解析：

re.compile('<div class="content">.*?</div>', re.S) # 匹配出包含段子的标签

　　第二步解析：

re.compile(r'<.*?>|&(.*?);|\s|　　') # 将除了汉字以外的所有字符去掉

整体代码为：

 # -*- coding:utf-8 -*-

 #  2018/9/13  12:00

 import requests

 import re

 import time

 from requests.packages.urllib3.poolmanager import PoolManager

 from requests.packages.urllib3.exceptions import InsecureRequestWarning,InsecurePlatformWarning

 requests.packages.urllib3.disable_warnings(InsecureRequestWarning)

 requests.packages.urllib3.disable_warnings(InsecurePlatformWarning)

 class Qiubai_spider(object):

     """糗事百科段子爬虫"""

     def __init__(self):

         self.base_url = "https://www.qiushibaike.com/hot/"

         self.headers = {"User-Agent" : "Mozilla/5.0 (Windows NT 10.0; WOW64; Trident/7.0; rv:11.0) like Gecko"}

         self.analysis_pattern = re.compile('<div class="content">.*?</div>', re.S)

         self.analysis_pattern_t = re.compile(r'<.*?>|&(.*?);|\s|　　')

     # 第一次解析 <div class ="content" >(.*?)</div>

     def send_request(self, url):

         """发送请求"""

         time.sleep(2)

         try:

             response = requests.get(url, headers=self.headers)

             return response.content

         except Exception, err:

             print err

     def write_file(self, data, page):

         """写入数据"""

         with open('qiushiduanzi1.txt', 'a') as f:

             filename = "第" + str(page) + "页的段子\n"

             print  filename

             f.write(filename)

             for content in data:

                 second_data = self.analysis_pattern_t.sub('', content)

                 f.write(second_data)

                 f.write("\n\n\n")

     def analysis_data(self, data):

         """数据分析提取"""

         analysis_list = self.analysis_pattern.findall(data)

         return analysis_list

     def start_work(self):

         """启动爬虫流程"""

         for page in range(1, 10):

             # 拼接url

             url = self.base_url + "page/" + str(page) + '/' + '.html'

             # 发送请求

             data = self.send_request(url)

             # 解析数据

             analysis_db = self.analysis_data(data)

             # 写入数据

             self.write_file(analysis_db, page)

 if __name__ == '__main__':

     tool = Qiubai_spider()

     tool.start_work()

糗事爬虫代码

爬取后的效果：

[爬虫]用python的requests模块爬取糗事百科段子的更多相关文章

爬虫——URL模块爬取糗事百科段子
最简单的爬取网页找有用信息,难点应该是正则锁定有用信息部分,看了一些其他大神的正则,最后还是决定按照自己理解写一个,果然我头脑相对简单,写出来的粗糙而易理解,也完成了自己想要的需求,就这样了~ # - ...
Python爬虫实战一之爬取糗事百科段子
大家好,前面入门已经说了那么多基础知识了,下面我们做几个实战项目来挑战一下吧.那么这次为大家带来,Python爬取糗事百科的小段子的例子. 首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把 ...
转 Python爬虫实战一之爬取糗事百科段子
静觅 » Python爬虫实战一之爬取糗事百科段子首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 友情提示糗事百科在前一段时间进行了改版,导致 ...
python学习（十六）写爬虫爬取糗事百科段子
原文链接:爬取糗事百科段子利用前面学到的文件.正则表达式.urllib的知识,综合运用,爬取糗事百科的段子先用urllib库获取糗事百科热帖第一页的数据.并打开文件进行保存,正好可以熟悉一下之前学过 ...
8.Python爬虫实战一之爬取糗事百科段子
大家好,前面入门已经说了那么多基础知识了,下面我们做几个实战项目来挑战一下吧.那么这次为大家带来,Python爬取糗事百科的小段子的例子. 首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把 ...
Python爬虫爬取糗事百科段子内容
参照网上的教程再做修改,抓取糗事百科段子(去除图片),详情见下面源码: #coding=utf-8#!/usr/bin/pythonimport urllibimport urllib2import ...
python爬取糗事百科段子
初步爬取糗事百科第一页段子(发布人,发布内容,好笑数和评论数) #-*-coding:utf--*- import urllib import urllib2 import re page = url ...
芝麻HTTP：Python爬虫实战之爬取糗事百科段子
首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 友情提示糗事百科在前一段时间进行了改版,导致之前的代码没法用了,会导致无法输出和CPU占用过高的 ...
python 爬虫实战1 爬取糗事百科段子
首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 本篇目标抓取糗事百科热门段子过滤带有图片的段子实现每按一次回车显示一个段子的发布时间,发布人 ...

随机推荐

ES6入门之Promise对象
1. Promise 的含义 Promise 是异步编程的一种解决方案,比传统的解决方案--回调函数和事件更合理.更强大. 1.1 什么是Promise 简单来说就是一个容器,里面保存着某个未来才会结 ...
Flutter 错误捕获的正确姿势
背景我们知道,在软件开发过程中,错误和异常总是在所难免. 不管是客户端的逻辑错误导致的,还是服务器的数据问题导致的,只要出现了异常,我们都需要一个机制来通知我们去处理. 在 APP 的开发过程中,我 ...
Linux虚拟机中配置JDK环境变量（Ubuntu系统）
首先通过Xshell中文件传输想你的虚拟机上传你的jdk,如图所示:(需要本机安装Xftp:链接: https://pan.baidu.com/s/1sWHmywZ2C6V2n4aa1FqqFg 提取 ...
vue-cli脚手架项目本地阅览和在线阅览
一.需求开发环境:当然啦,前提是你要完整检测整个项目无错误的运行:npm run dev 后项目在本地预览问题没有问题二.服务器本地阅览生产环境:项目制作完成后需执行npm run build操 ...
深入了解opacity和rgba
1. rgba 首先它是一个属性值,语法为rgba(r,g,b,a) - r为红色值, 正整数 | 百分数 - g为绿色值,正整数 | 百分数 - b为蓝色值,正整数 | 百分数 - a为alpha( ...
The Troublesome Frog
In Korea, the naughtiness of the cheonggaeguri, a small frog, is legendary. This is a well-deserved ...
安卓控件仪表盘控件柱状图控件曲线控件 xamarin.android 分类器瓶子控件报警控件水箱控件进度条控件等
本篇博客主要介绍一个控件库,HslControls.dll 的界面,这个控件库支持winform,winform的参考另一篇文章:https://www.cnblogs.com/dathlin/p/1 ...
代码审计-YXcms1.4.7
题外: 今天是上班第一天,全都在做准备工作,明天开始正式实战做事. 看着周围稍年长的同事和老大做事,自己的感觉就是自己还是差的很多很多,自己只能算个废物. 学无止境,我这样的垃圾废物就该多练,保持战斗 ...
SDRAM
环境:STM32F769discovery板 SDRAM芯片:用的MT48LC4M32B2B5-6A 16Mbyte (sdram和flash一般标的容量都是bit) 硬件图: 第一步配置FM ...
利用Veeam保护SAP HANA数据库
利用Veeam保护SAP HANA数据库前言针对越来越多的SAP HANA备份需求,我们Team翻译.整理.借鉴了Veeam 的SAP HANA 大神 Clemens Zerbe 和 Ali Sa ...

[爬虫]用python的requests模块爬取糗事百科段子

[爬虫]用python的requests模块爬取糗事百科段子的更多相关文章

随机推荐

热门专题