爬取百度贴吧前1000页内容（requests库面向对象思想实现）

此程序以李毅吧为例子，以面向对象的设计思想实现爬取保存网页数据，暂时并未用到并发处理，以后有机会的话会加以改善

首先去百度贴吧分析贴吧地址栏中url后的参数，找到分页对应的参数pn，贴吧名字对应的参数kw
首先创建类，写好__init__方法，run方法，__init__方法里先可以直接写pass
run方法里大概整理一下整体的思路
- 构造 url 列表，因为要爬取1000页，每页需对应一个url
- 遍历发送请求，获取响应
- 保存　　
将可封装的步骤封装到单独的方法，所以这里又增加了三个方法
- get_url_list方法可以返回需要访问的所有url的一个列表
- parse_url方法用来发送请求获取响应，最终返回html页面内容
- save_html方法用来保存html字符串
- run方法为核心实现，将三个方法和用到的参数结合起来
每当有用到的参数，可以在__init__方法里添加对应的实例属性
最后，实例化类，测试，会不断的向当前目录保存html文件

 import requests

 class TiebaSpider(object):

     def __init__(self, tieba_name):  # tieba_name为要爬取贴吧的名称

         self.tieba_name = tieba_name

         self.url_temp = 'https://tieba.baidu.com/f?kw=' + tieba_name + '&ie=utf-8&pn={}'

         self.headers = {

             'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36',

         }

     def get_url_list(self):  # 构造url列表

         # url_list = []

         # for i in range(1000):

         #     url_list.append(self.url_temp.format(i * 50))

         # return url_list

         return [self.url_temp.format(i*50) for i in range(1000)]  # 列表推导式替换上面代码

     def parse_url(self, url):  # 发送请求，获取响应

         print(url)

         response = requests.get(url, headers=self.headers)

         return response.content.decode()

     def save_html(self, html_str, page_num):  # 保存html字符串

         file_path = '{}-第{}页.html'.format(self.tieba_name, page_num)

         with open(file_path, 'w', encoding='utf-8') as f:  # 样例： 李毅-第一页.html

             f.write(html_str)

     def run(self):  # 实现主要逻辑

         # 1.构造url列表

         url_list = self.get_url_list()

         # 2.遍历，发送请求，获取响应

         for url in url_list:

             html_str = self.parse_url(url)

             # 3.保存

             page_num = url_list.index(url) + 1  # 页码数

             self.save_html(html_str, page_num)

 if __name__ == '__main__':

     tieba_spider = TiebaSpider('李毅')

     tieba_spider.run()

爬取百度贴吧前1000页内容（requests库面向对象思想实现）的更多相关文章

Python爬虫 - 爬取百度html代码前200行
Python爬虫 - 爬取百度html代码前200行 - 改进版, 增加了对字符串的.strip()处理源代码如下: # 改进版, 增加了 .strip()方法的使用 # coding=utf-8 ...
正则爬取某段子网站前20页段子(request库)
首先还是谷歌浏览器抓包对该网站数据进行分析,结果如下: 该网站地址:http://www.budejie.com/text 该网站数据都是通过html页面进行展示,网站url默认为第一页,http:/ ...
go语言，爬取百度贴吧指定贴所有内容
初级爬虫,为了学习一下常用的goquery. goquery 配置 go get https://github.com/PuerkitoBio/goquery 会提示不支持https方式解决方案: ...
python request爬取百度贴吧
import requests import os import shutil import time class PostBarSpider(object): def __init__(self, ...
【学习笔记】Python 3.6模拟输入并爬取百度前10页密切相关链接
[学习笔记]Python 3.6模拟输入并爬取百度前10页密切相关链接问题描述通过模拟网页,实现百度搜索关键词,然后获得网页中链接的文本,与准备的文本进行比较,如果有相似之处则代表相关链接. me ...
Python——爬取百度百科关键词1000个相关网页
Python简单爬虫——爬取百度百科关键词1000个相关网页——标题和简介网站爬虫由浅入深:慢慢来分析: 链接的URL分析: 数据格式: 爬虫基本架构模型: 本爬虫架构: 源代码: # codin ...
利用python的爬虫技术爬取百度贴吧的帖子
在爬取糗事百科的段子后,我又在知乎上找了一个爬取百度贴吧帖子的实例,为了巩固提升已掌握的爬虫知识,于是我打算自己也做一个. 实现目标:1,爬取楼主所发的帖子 2,显示所爬去的楼层以及帖子题目 3,将爬 ...
Python开发简单爬虫（二）---爬取百度百科页面数据
一.开发爬虫的步骤 1.确定目标抓取策略: 打开目标页面,通过右键审查元素确定网页的url格式.数据格式.和网页编码形式. ①先看url的格式, F12观察一下链接的形式;② 再看目标文本信息的标签格 ...
写一个python 爬虫爬取百度电影并存入mysql中
目标是利用python爬取百度搜索的电影在类型地区年代各个标签下电影的名字评分和图片连接以及电影连接首先我们先在mysql中建表 create table liubo4( id in ...

随机推荐

[ML] Gradient Boost
参考链接: 1. https://medium.com/@cwchang/gradient-boosting-%E7%B0%A1%E4%BB%8B-f3a578ae7205 2. https://zh ...
Xpath中text()，string()，data()的区别
摘要: 在XPath中,经常使用text()和string(),而我一般都是想到哪个用哪个,究竟他们之间有什么不同,没有在意过. 本质区别 text()是一个node test,而string()是一 ...
From 7.22 To 7.28
From 7.22 To 7.28 大纲竞赛我们好像要跟队爷考试... 考试的时候做题吧学科还是跟之前一样吧, 完型和阅读几乎没做过... 运动踢足球!!!!!! 可惜bb他们去上海了... ...
Eureka 服务注册列表显示IP问题研究
在研究Spring Cloud的过程中,本地搭建好Eureka注册中心之后,发现Eureka服务页面显示的服务是机器名:端口的格式,并不是IP+端口的形式. 如下图: 具体搭建过程我就不再贴代码了,参 ...
scrapy_redis的使用
配置Scrapy-Redis 配置Scrapy-Redis非常简单,只需要修改一下settings.py配置文件即可. 1. 核心配置首先最主要的是,需要将调度器的类和去重的类替换为Scrapy-R ...
JS基础_toString()
当我们直接在页面中打印一个对象时,实际上是输出的对象的toString()方法的返回值如果我们希望在输出对象时不输出[ object Object ],可以为对象添加一个toString()方法或者 ...
vscode如何使用命令面板
vscode如何使用命令面板方法/步骤首先找到vscode. 进入,打开页面. 找到查看. 打开找到命令面板. 选择打开,可以看到命令. 下拉还有多个,以及快捷键. ...
HearthBuddy的plugin加载
// Hearthbuddy.Windows.MainWindow // Token: 0x060001FF RID: 511 RVA: 0x0008951C File Offset: 0x00087 ...
python正则表达式解析(re)
正则表达式的使用方法主要有4种: re.search(进行正则匹配), re.match(从头开始匹配) re.findall(找出所有符合条件的字符列表) re.split(根据条件进行切分) ...
HTML中meta=“viewport”的介绍
viewport就是浏览器上用来显示网页的那部分区域 layout viewport:整个网页所占据的区域(包括可视也包括不可视的区域) 默认的 visual viewport:网页在浏览器上的可视 ...

爬取百度贴吧前1000页内容（requests库面向对象思想实现）

此程序以李毅吧为例子，以面向对象的设计思想实现爬取保存网页数据，暂时并未用到并发处理，以后有机会的话会加以改善

爬取百度贴吧前1000页内容（requests库面向对象思想实现）的更多相关文章

随机推荐

热门专题