【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)

# 本程序亲测有效,用于理解爬虫相关的基础知识，不足之处希望大家批评指正

 import requests

 from lxml import etree

 from multiprocessing import JoinableQueue as Queue

 from multiprocessing import Process

 """爬取目标：http://www.qiushibaike.com/8hr/page/1

     利用多进程实现

 """

 class QiuShi:

     def __init__(self):

         # url和headers

         self.base_url = 'http://www.qiushibaike.com/8hr/page/{}'

         self.headers = 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.67 Safari/537.36'

         # 定义队列，用来传递数据

         self.url_queue = Queue()

         self.request_queue = Queue()

         self.html_queue = Queue()

     def get_url_list(self):

         """获取所有的url"""

         for i in range(1, 14):

             target_url = self.base_url.format(i)

             print(target_url)

             # 计数需要请求的url

             self.url_queue.put(target_url)

     def request_url(self):

         """向url发起请求"""

         while True:

             target_url = self.url_queue.get()

             response = requests.get(target_url, self.headers)

             print(response)

             self.request_queue.put(response)

             self.url_queue.task_done()

     def get_content(self):

         """获取数据"""

         while True:

             html_text = self.request_queue.get().content.decode()

             html = etree.HTML(html_text)

             div_list = html.xpath('//div[@id="content-left"]/div')

             content_list = []

             for div in div_list:

                 item = {}

                 item['author'] = div.xpath('.//h2/text()')[0].strip()

                 item['content'] = div.xpath('.//span/text()')[0].strip()

                 print(item)

                 content_list.append(item)

             self.html_queue.put(content_list)

             self.request_queue.task_done()

     def save_data(self):

         """保存入库"""

         while True:

             data_list = self.html_queue.get()

             for data in data_list:

                 with open('qiushi.text', 'a+') as f:

                     f.write(str(data))

                     f.write('\r\n')

             self.html_queue.task_done()

     def main(self):

         # 获取所有url

         self.get_url_list()

         # 创建一个进程盒子,用于收集进程

         process_list = []

         p_request = Process(target=self.request_url)

         process_list.append(p_request)

         p_content = Process(target=self.get_content)

         process_list.append(p_content)

         p_save_data = Process(target=self.save_data)

         process_list.append(p_save_data)

         # 让所有进程跑起来

         for process in process_list:

             process.daemon = True  # 设置为守护进程：主进程结束，子进程任务完不完成，都要随着主进程结束而结束

             process.start()

         # 等待进程任务完成,回收进程  director:主任：可以理解为普通员工都下班了，领导才能下班

         for director in [self.url_queue,self.request_queue,self.html_queue]:

             director.join()

 if __name__ == '__main__':

     qiushi = QiuShi()

     qiushi.main()

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)的更多相关文章

【爬虫小程序：爬取斗鱼所有房间信息】Xpath
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正from selenium import webdriver import time class Douyu: "&q ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(协程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from gevent import monkey monkey.patch_all() from gevent.pool i ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(线程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from queue import Queue import requests from lxml import etree ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from queue import Queue import requests from lxml import etree ...
基于webmagic的爬虫小应用--爬取知乎用户信息
听到“爬虫”,是不是第一时间想到Python/php ? 多少想玩爬虫的Java学习者就因为语言不通而止步.Java是真的不能做爬虫吗? 当然不是. 只不过python的3行代码能解决的问题,而Jav ...
[python爬虫] Selenium定向爬取PubMed生物医学摘要信息
本文主要是自己的在线代码笔记.在生物医学本体Ontology构建过程中,我使用Selenium定向爬取生物医学PubMed数据库的内容. PubMed是一个免费的搜寻引擎,提供生物医学方 ...
python爬虫实战之爬取智联职位信息和博客文章信息
1.python爬取招聘信息简单爬取智联招聘职位信息 # !/usr/bin/env python # -*-coding:utf-8-*- """ @Author ...
Python爬虫基础--分布式爬取贝壳网房屋信息(Client)
1. client_code01 2. client_code02 3. 这个时候运行多个client就可以分布式进行数据爬取.
selenium,webdriver爬取斗鱼主播信息实操
from selenium import webdriver import time from bs4 import BeautifulSoup class douyuSelenium(): #初始化 ...

随机推荐

深入剖析PHP7内核源码（二）- PHP变量容器
简介 PHP的变量使用起来非常方便,其基本结构是底层实现的zval,PHP7采用了全新的zval,由此带来了非常大的性能提升,本文重点分析PHP7的zval的改变. PHP5时代的ZVAL typed ...
LeetCode115不同的子序列
题目说明在这里就不贴出来了,相信打开这篇文章的小伙伴们肯定都是在刷LeetCode的. 一开始我的想法是dfs+回溯,结果运行超时,一开始我就觉得可能会超时,结果不出所料[手动笑哭]. 后来我想了下d ...
JavaScript 数据结构与算法之美 - 归并排序、快速排序、希尔排序、堆排序
1. 前言算法为王. 想学好前端,先练好内功,只有内功深厚者,前端之路才会走得更远. 笔者写的 JavaScript 数据结构与算法之美系列用的语言是 JavaScript ,旨在入门数据结构与算 ...
前端利器躬行记（3）——webpack基础
webpack是一个静态模块打包器,此处的模块可以是任意文件,包括Sass.TypeScript.模板和图像等.webpack可根据输入文件的依赖关系,打包输出浏览器可识别的JavaScript.CS ...
Servlet，过滤器和监听器的配置和使用
一.什么是Servlet Servlet使用Java语言实现的程序,运行于支持Java语言的Web服务器或者应用服务器中.Servlet先于JSP出现,提供和客户端动态交互的功能.Servlet可以处 ...
Linux中mysql5.7主从配置
MySQL主从配置(两台Linux之间) 简介 Linux下MySQL数据库的主从同步用来实现读写分离.主数据库进行数据的插入,删除与更新:从数据库专门用来查询操作,缓解数据库的压力.让运行海量数据的 ...
codeforces 456 E. Civilization（并查集+数的直径）
题目链接:http://codeforces.com/contest/456/problem/E 题意:给出N个点,M条边,组成无环图(树),给出Q个操作,操作有两种: 1 x,输出x所在的联通块的最 ...
MySql连接笔记
一.内连接查询 inner join 关键字:inner join on 语句:select * from a_table a inner join b_table b on a.a_id = ...
数据库常用SQL语句（三）：子查询
一.为什么会使用子查询虽然可以通过连接查询来实现多表查询数据记录,但不建议使用,因为连接查询的性能很差,为什么呢?我们来进行分析,例如我们要查询部门表t_dept 和雇员表t_employee中的 ...
git拉取分支
拉取仓库代码很简单,直接建立连接在pull下来就可以,如果想要拉取仓库中的某一个分支的话,则可能比较麻烦一点,下面简单介绍了一种拉取仓库分支的方法 1.先新建一个项目文件夹 2.git初始化git i ...

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)的更多相关文章

随机推荐

热门专题