【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)

# 本程序亲测有效,用于理解爬虫相关的基础知识，不足之处希望大家批评指正

from queue import Queue

import requests

from lxml import etree

from threading import Thread

"""爬取目标：http://www.qiushibaike.com/8hr/page/1

    用多线程实现

"""

class QiuShi:

    def __init__(self):

        # url和headers

        self.base_url = 'http://www.qiushibaike.com/8hr/page/{}'

        self.headers = 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.67 Safari/537.36'

        # 定义队列，用来传递数据

        self.url_queue = Queue()

        self.request_queue = Queue()

        self.html_queue = Queue()

    def get_url_list(self):

        """获取所有的url"""

        for i in range(1, 14):

            target_url = self.base_url.format(i)

            print(target_url)

            self.url_queue.put(target_url)

    def request_url(self):

        """向url发起请求"""

        while True:

            target_url = self.url_queue.get()

            response = requests.get(target_url, self.headers)

            self.request_queue.put(response)

            self.url_queue.task_done()

    def get_content(self):

        """获取数据"""

        while True:

            html_text = self.request_queue.get().content.decode()

            html = etree.HTML(html_text)

            div_list = html.xpath('//div[@id="content-left"]/div')

            content_list = []

            for div in div_list:

                item = {}

                item['author'] = div.xpath('.//h2/text()')[0].strip()

                item['content'] = div.xpath('.//span/text()')[0].strip()

                print(item)

                content_list.append(item)

            self.html_queue.put(content_list)

            self.request_queue.task_done()

    def save_data(self):

        """保存入库"""

        while True:

            data_list = self.html_queue.get()

            for data in data_list:

                with open('qiushi.text', 'a+') as f:

                    f.write(str(data))

                    f.write('\r\n')

            self.html_queue.task_done()

    def main(self):

        """主程序逻辑"""

        # 定义一个线程收集器，用于收集线程

        thread_list = []

        # 1.获取url

        self.get_url_list()

        # 2.请求url

        t_request_url = Thread(target=self.request_url)

        thread_list.append(t_request_url)

        # 3.获取数据任务比较重，用四个线程去跑

        # for worker in range(4):

        t_get_content = Thread(target=self.get_content)

        thread_list.append(t_get_content)

        # 4.保存入库

        t_save_data = Thread(target=self.save_data)

        thread_list.append(t_save_data)

        # 将收集器中的线程全部跑起来

        for s in thread_list:

            s.start()  # 开启线程

        # 当所有队列中的任务完成了，回收线程

        for i in [self.url_queue,self.request_queue,self.html_queue]:

            i.join()

        print("主线程结束")

if __name__ == '__main__':

    qiushi = QiuShi()

    qiushi.main()

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)的更多相关文章

【爬虫小程序：爬取斗鱼所有房间信息】Xpath
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正from selenium import webdriver import time class Douyu: "&q ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(协程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from gevent import monkey monkey.patch_all() from gevent.pool i ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(线程池版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 from queue import Queue import requests from lxml import etree ...
【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多进程版)
# 本程序亲测有效,用于理解爬虫相关的基础知识,不足之处希望大家批评指正 import requests from lxml import etree from multiprocessing imp ...
基于webmagic的爬虫小应用--爬取知乎用户信息
听到“爬虫”,是不是第一时间想到Python/php ? 多少想玩爬虫的Java学习者就因为语言不通而止步.Java是真的不能做爬虫吗? 当然不是. 只不过python的3行代码能解决的问题,而Jav ...
[python爬虫] Selenium定向爬取PubMed生物医学摘要信息
本文主要是自己的在线代码笔记.在生物医学本体Ontology构建过程中,我使用Selenium定向爬取生物医学PubMed数据库的内容. PubMed是一个免费的搜寻引擎,提供生物医学方 ...
python爬虫实战之爬取智联职位信息和博客文章信息
1.python爬取招聘信息简单爬取智联招聘职位信息 # !/usr/bin/env python # -*-coding:utf-8-*- """ @Author ...
Python爬虫基础--分布式爬取贝壳网房屋信息(Client)
1. client_code01 2. client_code02 3. 这个时候运行多个client就可以分布式进行数据爬取.
selenium,webdriver爬取斗鱼主播信息实操
from selenium import webdriver import time from bs4 import BeautifulSoup class douyuSelenium(): #初始化 ...

随机推荐

Mac系统中idea配置git总结
系统配置git相关文章,网上有很多,这里只总结我所遇到的问题配置git相关信息命令: vim ~/.gitconfig 然后就可以配置相关信息,git配置文件详解请参考以下网址: https://b ...
噩梦（双向BFS）
给定一张N*M的地图,地图中有1个男孩,1个女孩和2个鬼. 字符“.”表示道路,字符“X”表示墙,字符“M”表示男孩的位置,字符“G”表示女孩的位置,字符“Z”表示鬼的位置. 男孩每秒可以移动3个单位 ...
前端通过Blob实现文件下载
最近遇到一个需求,需要将页面中的配置信息下载下来供用户方便使用,以前这个场景的需求有时候会放到后端处理,然后给返回一个下载链接.其实并不需要这么麻烦,这样既增大了服务器的负载,也让用户产生了没有必要的 ...
模板列传值到子窗体中，子窗体中多选gridview中checkbox保存数据多项到数据库中
<html xmlns="http://www.w3.org/1999/xhtml"> <head runat="server"> &l ...
【linux】【qt5】【信号槽示例】
什么叫信号槽: 信号槽是 Qt 框架引以为豪的机制之一.所谓信号槽,实际就是观察者模式.当某个事件发生之后,比如,按钮检测到自己被点击了一下,它就会发出一个信号(signal).这种发出是没有目的的, ...
动态数组& allocator
问题来源在编写程序的时候,对数组."二维数组"的分配的删除掌握的不是很清楚,不能正确的进行定义初始化. 以及在使用vector的时候,如何正确的定义及初始化注意!!! 尽量使用 ...
牛客多校第十场 A Rikka with Lowbit 线段树
链接:https://www.nowcoder.com/acm/contest/148/A来源:牛客网题目描述 Today, Rikka is going to learn how to use B ...
js中的循环方式及各种遍历的方法
for循环 1.for有三个表达式:①声明循环变量:②判断循环条件:③更新循环变量:三个表达式之间,用;分割, for循环三个表达式都可以省略,但是两个“;”缺一不可. 2.for循环的执行特点: ...
pt工具校验主从数据一致性之dsns方式
mysql主从数据一致性校验,常用的方法是Percona-Toolkit的组件pt-table-checksum,这东西怎么用网上一大堆,就不啰嗦了.主要说一下通过dsns方式发现从库的一种方式. p ...
致初学者（二）： HDU 2014~ 2032题解
下面继续给出HDU 2014~2032的AC程序,供大家参考.2014~2032这19道题就被归结为“C语言程序设计练习(三) ”~“C语言程序设计练习(五) ”. HDU 2014:青年歌手大奖赛_ ...

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)

【爬虫小程序：爬取斗鱼所有房间信息】Xpath(多线程版)的更多相关文章

随机推荐

热门专题