【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)

# 本程序亲测有效,用于理解爬虫相关的基础知识，不足之处希望大家批评指正

from queue import Queue

import requests

from lxml import etree

from threading import Thread

"""爬取目标：http://www.qiushibaike.com/8hr/page/1

    用多线程实现

"""

class QiuShi:

    def __init__(self):

        # url和headers

        self.base_url = 'http://www.qiushibaike.com/8hr/page/{}'

        self.headers = 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.67 Safari/537.36'

        # 定义队列，用来传递数据

        self.url_queue = Queue()

        self.request_queue = Queue()

        self.html_queue = Queue()

    def get_url_list(self):

        """获取所有的url"""

        for i in range(1, 14):

            target_url = self.base_url.format(i)

            print(target_url)

            self.url_queue.put(target_url)

    def request_url(self):

        """向url发起请求"""

        while True:

            target_url = self.url_queue.get()

            response = requests.get(target_url, self.headers)

            self.request_queue.put(response)

            self.url_queue.task_done()

    def get_content(self):

        """获取数据"""

        while True:

            html_text = self.request_queue.get().content.decode()

            html = etree.HTML(html_text)

            div_list = html.xpath('//div[@id="content-left"]/div')

            content_list = []

            for div in div_list:

                item = {}

                item['author'] = div.xpath('.//h2/text()')[0].strip()

                item['content'] = div.xpath('.//span/text()')[0].strip()

                print(item)

                content_list.append(item)

            self.html_queue.put(content_list)

            self.request_queue.task_done()

    def save_data(self):

        """保存入库"""

        while True:

            data_list = self.html_queue.get()

            for data in data_list:

                with open('qiushi.text', 'a+') as f:

                    f.write(str(data))

                    f.write('\r\n')

            self.html_queue.task_done()

    def main(self):

        """主程序逻辑"""

        # 定义一个线程收集器，用于收集线程

        thread_list = []

        # 1.获取url

        self.get_url_list()

        # 2.请求url

        t_request_url = Thread(target=self.request_url)

        thread_list.append(t_request_url)

        # 3.获取数据任务比较重，用四个线程去跑

        # for worker in range(4):

        t_get_content = Thread(target=self.get_content)

        thread_list.append(t_get_content)

        # 4.保存入库

        t_save_data = Thread(target=self.save_data)

        thread_list.append(t_save_data)

        # 将收集器中的线程全部跑起来

        for s in thread_list:

            s.start()  # 开启线程

        # 当所有队列中的任务完成了，回收线程

        for i in [self.url_queue,self.request_queue,self.html_queue]:

            i.join()

        print("主线程结束")

if __name__ == '__main__':

    qiushi = QiuShi()

    qiushi.main()

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)的更多相关文章

【爬虫小程序：爬取斗鱼所有房间信息】Xpath
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正from selenium import webdriver import time class Douyu: "&q ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(协程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from gevent import monkey monkey.patch_all() from gevent.pool i ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(线程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from queue import Queue import requests from lxml import etree ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 import requests from lxml import etree from multiprocessing imp ...
基于webmagic的爬虫小应用--爬取知乎用户信息
听到“爬虫”,是不是第一时间想到Python/php ? 多少想玩爬虫的Java学习者就因为语言不通而止步.Java是真的不能做爬虫吗? 当然不是. 只不过python的3行代码能解决的问题,而Jav ...
[python爬虫] Selenium定向爬取PubMed生物医学摘要信息
本文主要是自己的在线代码笔记.在生物医学本体Ontology构建过程中,我使用Selenium定向爬取生物医学PubMed数据库的内容. PubMed是一个免费的搜寻引擎,提供生物医学方 ...
python爬虫实战之爬取智联职位信息和博客文章信息
1.python爬取招聘信息简单爬取智联招聘职位信息 # !/usr/bin/env python # -*-coding:utf-8-*- """ @Author ...
Python爬虫基础--分布式爬取贝壳网房屋信息(Client)
1. client_code01 2. client_code02 3. 这个时候运行多个client就可以分布式进行数据爬取.
selenium,webdriver爬取斗鱼主播信息实操
from selenium import webdriver import time from bs4 import BeautifulSoup class douyuSelenium(): #初始化 ...

随机推荐

ubuntu 用户无法/循环登陆的问题
安装oracle数据库的时候需要新建用户oracle,使用的命令为:useradd oracle.这样做直接创建了用户oracle,但并没有在home目录下创建oracle用户的文件.在log out ...
Badboy - 导出脚本，用于JMeter并发测试
参考: http://leafwf.blog.51cto.com/872759/1141011 http://www.51testing.com/html/00/130600-1367743.html ...
yzoj1568: 数字组合题解
题意从n个数中选出和为m的组合个数(输入顺序不同的数是不同的) 输入样例: 4 4 1 1 2 2 输出样例 3 我们把每个数看作一件物品,它的重量就是它的值,价值就是1,而和m即为背包的容积,故背 ...
1 PY环境与变量
一环境与文件形式 1.环境搭建http://jingyan.baidu.com/article/eae07827f7f2d01fec5485f7.html 2. python 则进入交互模式 ex ...
"ANDROID" 支持的KEYCODE
例子: adb shell input text keyevent 4 0 --> "KEYCODE_UNKNOWN" 1 --> "KEYCODE_ ...
Spring Boot2 系列教程(二)创建 Spring Boot 项目的三种方式
我最早是 2016 年底开始写 Spring Boot 相关的博客,当时使用的版本还是 1.4.x ,文章发表在 CSDN 上,阅读量最大的一篇有 43W+,如下图: 2017 年由于种种原因,就没有 ...
Fire Balls 09——修正游戏的BUG
版权申明: 本文原创首发于以下网站: 博客园『优梦创客』的空间:https://www.cnblogs.com/raymondking123 优梦创客的官方博客:https://91make.top ...
MYSQL学习系列
1.myslq5.7安装以及root密码找回 2.mysql之innodb存储引擎介绍 3.mysql之innodb存储引擎---数据存储结构 4.mysql之innodb存储引擎---BTREE索引 ...
从零开始开发IM（即时通讯）服务端（二）
好消息:IM1.0.0版本已经上线啦,支持特性: 私聊发送文本/文件已发送/已送达/已读回执支持使用ldap登录支持接入外部的登录认证系统提供客户端jar包,方便客户端开发 github链接: ...
为什么Hashtable ConcurrentHashmap不支持key或者value为null
ConcurrentHashmap HashMap和Hashtable都是key-value存储结构,但他们有一个不同点是 ConcurrentHashmap.Hashtable不支持key或者val ...

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)的更多相关文章

随机推荐

热门专题