【爬虫小程序：爬取斗鱼所有房间信息】Xpath(线程池版)

# 本程序亲测有效,用于理解爬虫相关的基础知识，不足之处希望大家批评指正

from queue import Queue

import requests

from lxml import etree

from multiprocessing.dummy import Pool

import time

"""爬取目标：http://www.qiushibaike.com/8hr/page/1

    利用线程池实现

"""

class QiuShi:

    def __init__(self):

        # url和headers

        self.base_url = 'http://www.qiushibaike.com/8hr/page/{}'

        self.headers = 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.67 Safari/537.36'

        # 定义队列，用来传递数据

        self.url_queue = Queue()

        self.request_queue = Queue()

        self.html_queue = Queue()

        # 初始化线程池

        self.pool = Pool()

        # 定义计数器

        self.request_num = 0

        self.response_num = 0

        self.is_running = True

    def get_url_list(self):

        """获取所有的url"""

        for i in range(1, 14):

            target_url = self.base_url.format(i)

            print(target_url)

            self.request_num += 1

            self.url_queue.put(target_url)

    def request_url(self):

        """向url发起请求"""

        target_url = self.url_queue.get()

        response = requests.get(target_url, self.headers)

        self.request_queue.put(response)

        self.url_queue.task_done()

    def get_content(self):

        """获取数据"""

        html_text = self.request_queue.get().content.decode()

        html = etree.HTML(html_text)

        div_list = html.xpath('//div[@id="content-left"]/div')

        content_list = []

        for div in div_list:

            item = {}

            item['author'] = div.xpath('.//h2/text()')[0].strip()

            item['content'] = div.xpath('.//span/text()')[0].strip()

            print(item)

            content_list.append(item)

        self.html_queue.put(content_list)

        self.request_queue.task_done()

    def save_data(self):

        """保存入库"""

        data_list = self.html_queue.get()

        for data in data_list:

            with open('qiushi.text', 'a+') as f:

                f.write(str(data))

                f.write('\r\n')

        self.html_queue.task_done()

    def execute_request_response_save(self):

        """线程池子,执行请求，回应，保存"""

        self.request_url()

        self.get_content()

        self.save_data()

        self.response_num += 1

    def _callback(self,temp):

        """线程池的回调函数："""

        if self.is_running:

            self.pool.apply_async(self.execute_request_response_save, callback=self._callback)

    def main(self):

        """主程序逻辑"""

        self.get_url_list()

        # 执行线程池

        for n in range(4):  # 用4个线程去执行线程池任务

            self.pool.apply_async(self.execute_request_response_save,callback=self._callback)

        # time.sleep(10)

        while True:

            if self.request_num == self.response_num:

                self.is_running = False

                break

if __name__ == '__main__':

    qiushi = QiuShi()

    qiushi.main()

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(线程池版)的更多相关文章

【爬虫小程序：爬取斗鱼所有房间信息】Xpath
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正from selenium import webdriver import time class Douyu: "&q ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(协程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from gevent import monkey monkey.patch_all() from gevent.pool i ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from queue import Queue import requests from lxml import etree ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 import requests from lxml import etree from multiprocessing imp ...
基于webmagic的爬虫小应用--爬取知乎用户信息
听到“爬虫”,是不是第一时间想到Python/php ? 多少想玩爬虫的Java学习者就因为语言不通而止步.Java是真的不能做爬虫吗? 当然不是. 只不过python的3行代码能解决的问题,而Jav ...
[python爬虫] Selenium定向爬取PubMed生物医学摘要信息
本文主要是自己的在线代码笔记.在生物医学本体Ontology构建过程中,我使用Selenium定向爬取生物医学PubMed数据库的内容. PubMed是一个免费的搜寻引擎,提供生物医学方 ...
python爬虫实战之爬取智联职位信息和博客文章信息
1.python爬取招聘信息简单爬取智联招聘职位信息 # !/usr/bin/env python # -*-coding:utf-8-*- """ @Author ...
Python爬虫基础--分布式爬取贝壳网房屋信息(Client)
1. client_code01 2. client_code02 3. 这个时候运行多个client就可以分布式进行数据爬取.
selenium,webdriver爬取斗鱼主播信息实操
from selenium import webdriver import time from bs4 import BeautifulSoup class douyuSelenium(): #初始化 ...

随机推荐

c3p0，dbcp与druid 三大连接池的区别[转]
说到druid,这个是在开源中国开源项目中看到的,说是比较好的数据连接池.于是乎就看看.扯淡就到这. 下面就讲讲用的比较多的数据库连接池.(其实我最先接触的是dbcp这个) 1)DBCP DBCP是一 ...
Python数据类型详解——列表
Python数据类型详解--列表在"Python之基本数据类型概览"一节中,大概介绍了列表的基本用法,本节我们详细学一下列表. 如何定义列表:在[]内以英文里输入法的逗号,,按照 ...
Codeforces 729C Road to Cinema（二分）
题目链接 http://codeforces.com/problemset/problem/729/C 题意:n个价格c[i],油量v[i]的汽车,求最便宜的一辆使得能在t时间内到达s,路途中有k个位 ...
Kafka中的ISR、AR又代表什么？ISR的伸缩又指什么？
相信大家已经对 kafka 的基本概念已经有一定的了解了,下面直接来分析一下 ISR 和 AR 的概念. ISR and AR 简单来说,分区中的所有副本统称为 AR (Assigned Replic ...
2018 Multi-University Training Contest 2(部分题解)
Game Time Limit: 2000/1000 MS (Java/Others) Memory Limit: 32768/32768 K (Java/Others) Total Submi ...
持续集成高级篇之Jenkins Pipeline 集成sonarqube
系列目录前面章节中我们讲到了Sonarqube的使用,其实Sonarqube获取msbuild结果主要是执行三个命令,开始标记,执行msbuild,结束标记,这些都是命令,是非常容易集成到我们ci流 ...
Linux 中 /proc/meminfo 的含义
做嵌入式开发对内存泄露很敏感,而对泄露的位置更加关注.本文记录一下从网上搜集的/proc/meminfo各参数的含义.还不完整,待补完. 本文地址:https://segmentfault.com/a ...
FreeSql （二十七）将已写好的 SQL 语句，与实体类映射进行二次查询
有时候,我们希望将写好的 sql 语句,甚至是存储过程进行查询,虽然效率不高(有时候并不是效率至上). 巧用AsTable var sql = fsql.Select<UserX>() . ...
android中的菜单Menu
Menu是一个接口, 他有2个子接口, SubMenu和ContextMenu; 前者菜单常见于按home键就会出现 ,后者是一个上下文菜单, 一般点击某个条目会在手机屏幕中出现一个类似悬浮窗口的菜单 ...
.Net基础篇_学习笔记_第六天_For循环语法
For循环:专门处理已知循环次数的循环. 小技巧:连续敲击两下TAB键循环体自动搭建完成. For循环语法: for(表达式1;表达式2;表达式3){ 循环体;}表达式1一般为声明循环变量,记录循环 ...

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(线程池版)

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(线程池版)的更多相关文章

随机推荐

热门专题