【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)

# 本程序亲测有效,用于理解爬虫相关的基础知识，不足之处希望大家批评指正

 import requests

 from lxml import etree

 from multiprocessing import JoinableQueue as Queue

 from multiprocessing import Process

 """爬取目标：http://www.qiushibaike.com/8hr/page/1

     利用多进程实现

 """

 class QiuShi:

     def __init__(self):

         # url和headers

         self.base_url = 'http://www.qiushibaike.com/8hr/page/{}'

         self.headers = 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.67 Safari/537.36'

         # 定义队列，用来传递数据

         self.url_queue = Queue()

         self.request_queue = Queue()

         self.html_queue = Queue()

     def get_url_list(self):

         """获取所有的url"""

         for i in range(1, 14):

             target_url = self.base_url.format(i)

             print(target_url)

             # 计数需要请求的url

             self.url_queue.put(target_url)

     def request_url(self):

         """向url发起请求"""

         while True:

             target_url = self.url_queue.get()

             response = requests.get(target_url, self.headers)

             print(response)

             self.request_queue.put(response)

             self.url_queue.task_done()

     def get_content(self):

         """获取数据"""

         while True:

             html_text = self.request_queue.get().content.decode()

             html = etree.HTML(html_text)

             div_list = html.xpath('//div[@id="content-left"]/div')

             content_list = []

             for div in div_list:

                 item = {}

                 item['author'] = div.xpath('.//h2/text()')[0].strip()

                 item['content'] = div.xpath('.//span/text()')[0].strip()

                 print(item)

                 content_list.append(item)

             self.html_queue.put(content_list)

             self.request_queue.task_done()

     def save_data(self):

         """保存入库"""

         while True:

             data_list = self.html_queue.get()

             for data in data_list:

                 with open('qiushi.text', 'a+') as f:

                     f.write(str(data))

                     f.write('\r\n')

             self.html_queue.task_done()

     def main(self):

         # 获取所有url

         self.get_url_list()

         # 创建一个进程盒子,用于收集进程

         process_list = []

         p_request = Process(target=self.request_url)

         process_list.append(p_request)

         p_content = Process(target=self.get_content)

         process_list.append(p_content)

         p_save_data = Process(target=self.save_data)

         process_list.append(p_save_data)

         # 让所有进程跑起来

         for process in process_list:

             process.daemon = True  # 设置为守护进程：主进程结束，子进程任务完不完成，都要随着主进程结束而结束

             process.start()

         # 等待进程任务完成,回收进程  director:主任：可以理解为普通员工都下班了，领导才能下班

         for director in [self.url_queue,self.request_queue,self.html_queue]:

             director.join()

 if __name__ == '__main__':

     qiushi = QiuShi()

     qiushi.main()

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)的更多相关文章

【爬虫小程序：爬取斗鱼所有房间信息】Xpath
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正from selenium import webdriver import time class Douyu: "&q ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(协程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from gevent import monkey monkey.patch_all() from gevent.pool i ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(线程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from queue import Queue import requests from lxml import etree ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from queue import Queue import requests from lxml import etree ...
基于webmagic的爬虫小应用--爬取知乎用户信息
听到“爬虫”,是不是第一时间想到Python/php ? 多少想玩爬虫的Java学习者就因为语言不通而止步.Java是真的不能做爬虫吗? 当然不是. 只不过python的3行代码能解决的问题,而Jav ...
[python爬虫] Selenium定向爬取PubMed生物医学摘要信息
本文主要是自己的在线代码笔记.在生物医学本体Ontology构建过程中,我使用Selenium定向爬取生物医学PubMed数据库的内容. PubMed是一个免费的搜寻引擎,提供生物医学方 ...
python爬虫实战之爬取智联职位信息和博客文章信息
1.python爬取招聘信息简单爬取智联招聘职位信息 # !/usr/bin/env python # -*-coding:utf-8-*- """ @Author ...
Python爬虫基础--分布式爬取贝壳网房屋信息(Client)
1. client_code01 2. client_code02 3. 这个时候运行多个client就可以分布式进行数据爬取.
selenium,webdriver爬取斗鱼主播信息实操
from selenium import webdriver import time from bs4 import BeautifulSoup class douyuSelenium(): #初始化 ...

随机推荐

Python 基础 2-3 列表的反转与排序
引言列表是按照特定格式排序而成的,有时候这种排序方式我们并不喜欢,我们希望它可以按照我们的方式来进行正序或者倒序排序,或其他的排序方式反转与排序比如说我这里有一组列表,里面存放的全部都是数值,但 ...
JSP学习笔记（3）——JSTL 标签库
JSP Standard Tag Lib,名为JSP标准标签库,设计的目的主要用来方便我们将数据输出,而不是使用JSP中的语法<% %> <%= %> <%! %> ...
Hadoop3.1.2 + Hbase2.2.0 设置lzo压缩算法
Hadoop3.1.2 + Hbase2.2.0 设置lzo压缩算法: 写在前面,在配置hbase使用lzo算法时,在网上搜了很多文章,一般都是比较老的文章,一是版本低,二是一般都是使用hadoop- ...
2019nc#9
题号标题已通过代码题解/讨论通过率团队的状态 A The power of Fibonacci 点击查看进入讨论 69/227 未通过 B Quadratic equation 点击查看 ...
HDU3068 最长回文 Manacher's Algorithm 马拉车算法模板
HDU3068 复习了一下这个算法, 注意数组大小要开两倍大. #include <algorithm> #include <iterator> #include <io ...
CodeForces - 697D - Puzzles DFS
传送门:D - Puzzles 题意:在一个图中,从1开始dfs,求每一个点到达的期望: 思路:(下面是队长写的) 首先求的是到每一个点的步数的期望. 记fa( u ) = v, son( v )表示 ...
洛谷P1352没有上司的舞会+树形二维DP
传送门题意:上司和直接下属,不能同时去一个聚会,问可邀请到的人的快乐值最大是多少: 参考:https://www.luogu.org/blog/mak2333/solution-p1352 思路: ...
牛客多校第六场 C Generation I 组合数学阶乘逆元模板
链接:https://www.nowcoder.com/acm/contest/144/C来源:牛客网 Oak is given N empty and non-repeatable sets whi ...
UVA - 315 Network（tarjan求割点的个数）
题目链接:https://vjudge.net/contest/67418#problem/B 题意:给一个无向连通图,求出割点的数量.首先输入一个N(多实例,0结束),下面有不超过N行的数,每行的第 ...
Allegro PCB导入DXF文件详解
一:导入方法 1.确认Allegro PCB的单位精度设置和DXF文件保持一致(一般情况下DXF文件用mm,Allegro文件用mil). 2. 在Allegro中点击File→Import→DXF… ...

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)的更多相关文章

随机推荐

热门专题