初识python 之爬虫：使用正则表达式爬取“糗事百科

详细代码如下：

#!/user/bin env python

# author:Simple-Sir

# time:2019/8/1 14:50

# 爬取糗事百科(文字)网页数据

import requests,re

URLHead = 'https://www.qiushibaike.com'

def getHtml(url):

    headers = {

        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36'

    }

    respons = requests.get(url,headers=headers)

    html = respons.text

    return html

def getInfos(url):

    html = getHtml(url)

    authors = re.findall(r'<h2>\n(.*?)\n</h2>',html,re.DOTALL)  # 获取作者

    author_sex_lvl = re.findall(r'<div class="articleGender (.*?)Icon">(\d*?)</div>',html,re.DOTALL)  # 获取作者性别、等级

    author_sex = []  # 性别

    author_lvl = []  # 等级

    for i in author_sex_lvl:

        author_sex.append(i[0])

        author_lvl.append(i[1])

    contentHerf = re.findall(r'<a href="(/article.*?)".*?class="contentHerf"',html,re.DOTALL)[1:]  # 获取“详细页”href

    cont = []  # 内容

    for contentUrl in contentHerf:

        contentHerf_all = URLHead + contentUrl

        contentHtml = getHtml(contentHerf_all)  # 详细页html

        contents = re.findall(r'<div class="content">(.*?)</div>',contentHtml,re.DOTALL)

        content_br = re.sub(r'<br/>','',contents[0])  # 剔除</br>标签

        content = re.sub(r'\\xa0','',content_br)

        cont.append(content)

    infos = []

    for i in zip(authors,author_sex,author_lvl,cont):

        author,sex,lvl,text=i

        info ={

            '作者':author,

            '性别': sex,

            '等级': lvl,

            '内容': text

        }

        infos.append(info)

    return infos

def main():

    page = int(input('您想获取前几页的数据？\n'))

    for i in range(1,page+1):

        url = 'https://www.qiushibaike.com/text/page/{}'.format(i)

        print('正在爬取第{}页数据：'.format(i))

        for t in getInfos(url):

            print(t)

        print('第{}页数据已爬取完成。'.format(i))

    print('所有数据已爬取完成！')

if __name__ == '__main__':

    main()

爬取糗事百科(文字)网页数据

执行结果：

初识python 之爬虫：使用正则表达式爬取“糗事百科 - 文字版”网页数据的更多相关文章

python+正则提取+ip代理爬取糗事百科文字信息
很多网站都有反爬措施,最常见的就是封ip,请求次数过多服务器会拒绝连接,如图: 在程序中设置一个代理ip,可有效的解决这种问题,代码如下: # 需要的库 import requests import ...
python_爬虫一之爬取糗事百科上的段子
目标抓取糗事百科上的段子实现每按一次回车显示一个段子输入想要看的页数,按 'Q' 或者 'q' 退出实现思路目标网址:糗事百科使用requests抓取页面 requests官方教程使用 ...
爬取糗事百科热门段子的数据并保存到本地，xpath的使用
和之前的爬虫类博客的爬取思路基本一致: 构造url_list,因为糗事百科的热门栏目默认是13页,所以这个就简单了遍历发送请求获取响应提取数据,这里用的是xpath提取,用的是Python的第三方 ...
芝麻HTTP：Python爬虫实战之爬取糗事百科段子
首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 友情提示糗事百科在前一段时间进行了改版,导致之前的代码没法用了,会导致无法输出和CPU占用过高的 ...
python 爬虫实战1 爬取糗事百科段子
首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 本篇目标抓取糗事百科热门段子过滤带有图片的段子实现每按一次回车显示一个段子的发布时间,发布人 ...
Python爬虫实战之爬取糗事百科段子
首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 友情提示糗事百科在前一段时间进行了改版,导致之前的代码没法用了,会导致无法输出和CPU占用过高的 ...
Python爬虫实战之爬取糗事百科段子【华为云技术分享】
首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 友情提示糗事百科在前一段时间进行了改版,导致之前的代码没法用了,会导致无法输出和CPU占用过高的 ...
2019基于python的网络爬虫系列，爬取糗事百科
**因为糗事百科的URL改变,正则表达式也发生了改变,导致了网上许多的代码不能使用,所以写下了这一篇博客,希望对大家有所帮助,谢谢!** 废话不多说,直接上代码. 为了方便提取数据,我用的是beaut ...
21天打造分布式爬虫-Spider类爬取糗事百科（七）
7.1.糗事百科安装 pip install pypiwin32 pip install Twisted-18.7.0-cp36-cp36m-win_amd64.whl pip install sc ...

随机推荐

Vector Bin Packing 华为讲座笔记
Vector bin packing:first fit / best fit / grasp 成本:性价比 (先验) 设计评价函数: evaluation function:cosine simil ...
查看MySQL正在执行的线程
一.使用SQL语句查询正在执行的线程 SHOW PROCESSLIST; 二.使用kill 线程id就可以结束线程(引起数据变化的线程需特别小心) SHOW PROCESSLIST; +------+ ...
SQLserver 2014自定义备份数据库
一.管理-维护计划-维护计划向导-下一步二.点击更改设置任务执行时间-确定-下一步三.选择备份数据库完整-下一步四.选择需要备份的数据库-然后确定五.点目标自定义备份文件存储目录-下一步六. ...
TypeScript 数据类型---枚举 (Enum)
一.基础用法 1.默认值从0开始递增+1 enum Color {Red, Green, Blue} let c: Color = Color.Red; let d: Color = Color.G ...
Typora软件使用教程
Typora软件的使用教程 Typora软件简介 Typora是一款轻便简洁的Markdown编辑器,支持即时渲染技术,这也是与其他Markdown编辑器最显著的区别.当然重点是免费. Typora编 ...
转：Intent 操作常用URI代码示例
以下是常用到的Intent的URI及其示例,包含了大部分应用中用到的共用Intent 一.打开一个网页,类别是Intent.ACTION_VIEW 1 2 Uri uri = Uri.parse(&q ...
2020信息安全铁人三项 pwn复盘
第一赛区 hacknote 程序存在格式化字符串漏洞和uaf,不多说了,很简单. 1 from pwn import * 2 3 p = process('./hacknote') 4 elf = E ...
CF250A Paper Work 题解
Content 有 \(n\) 个数,要分成若干堆,要求每堆中的负数最多只能有两个.试求出分成的堆数最少是多少,并求出每一堆里面的数的个数. 数据范围:\(1\leqslant n\leqslant ...
atexit模块介绍
atexit 模块介绍 python atexit 模块定义了一个 register 函数,用于在 python 解释器中注册一个退出函数,这个函数在解释器正常终止时自动执行,一般用来做一些资源清理的 ...
thinkphp 5 在页面输出当前时间
我遇到的使用场景是<input>默认为当前时间,代码如下: <input name="starttime" id="starttime" ty ...

初识python 之 爬虫：使用正则表达式爬取“糗事百科 - 文字版”网页数据

初识python 之 爬虫：使用正则表达式爬取“糗事百科 - 文字版”网页数据的更多相关文章

随机推荐

热门专题

初识python 之爬虫：使用正则表达式爬取“糗事百科 - 文字版”网页数据

初识python 之爬虫：使用正则表达式爬取“糗事百科 - 文字版”网页数据的更多相关文章