python 多线程抓取动态数据

利用多线程动态抓取数据，网上也有不少教程，但发现过于繁杂，就不能精简再精简？！

不多解释，直接上代码，基本上还是很好懂的。

#!/usr/bin/env python

# coding=utf-8

import urllib2

import re,sys

from bs4 import BeautifulSoup

from selenium import webdriver

import threading

import time

reload(sys)

sys.setdefaultencoding("utf-8")

queue = [

    "http://baike.baidu.com/view/8332.htm",

    "http://baike.baidu.com/view/145819.htm",

    "http://baike.baidu.com/view/643415.htm",

    "http://baike.baidu.com/view/157424.htm",

    "http://baike.baidu.com/view/149759.htm",]

crawled_url = set()

crawled_word = set()

cnt = 0

class BaikeSpider(threading.Thread):

    """

    模拟浏览器打开页面，多线程爬取数据

    """

    def __init__(self,name):

        threading.Thread.__init__(self)

        self.name = str(name)

        self.browser = webdriver.Chrome()

        # 将抓取数据写入各自的文件

        self.fw = open("baike_words_"+self.name+".txt","wb")

    def run(self):

        global queue

        global crawled_url

        global crawled_word

        global cnt

        while queue:

            url = queue.pop(0)

            try:

                self.browser.get(url)

                # 休眠0.5s，等待数据加载

                time.sleep(0.5)

                links = BeautifulSoup(urllib2.urlopen(url).read(),"lxml").find_all("a")

                vote = self.browser.find_element_by_class_name("vote-count").text

                view = self.browser.find_element_by_id("j-lemmaStatistics-pv").text

                word = self.browser.title.split(u"_")[0]

                if word in crawled_word or url in crawled_url:

                    continue

                else:

                    for link in links:

                        if 'href' not in dict(link.attrs) or re.search(u"javascript",link['href']) or len(link['href'])

<8:

                            continue

                        tmpurl = link["href"]

                        if re.search("baike.baidu.com/view/\d+|baike.baidu.com/subview/\d+(/\d+)?",tmpurl) and tmpurl n

ot in crawled_url:

                            queue.append(tmpurl)

                crawled_url.add(url)

                linedata = word+"\t"+view+"\t"+vote+"\t"+url+"\n"

                self.fw.write(linedata)

            except Exception,e:

                print 'error',e

                continue

            cnt += 1

            print cnt,self.name,'len',len(queue)

    def __exit__(self):

        self.fw.close()

if __name__=='__main__':

    """

    开５个线程

    """

    for i in range(5):

        t = BaikeSpider(i)

        t.start()

python 多线程抓取动态数据的更多相关文章

Python 逆向抓取 APP 数据
今天继续给大伙分享一下 Python 爬虫的教程,这次主要涉及到的是关于某 APP 的逆向分析并抓取数据,关于 APP 的反爬会麻烦一些,比如 Android 端的代码写完一般会进行打包并混淆加密加固 ...
scrapy-splash抓取动态数据例子一
目前,为了加速页面的加载速度,页面的很多部分都是用JS生成的,而对于用scrapy爬虫来说就是一个很大的问题,因为scrapy没有JS engine,所以爬取的都是静态页面,对于JS生成的动态页面都无 ...
pythonのscrapy抓取网站数据
(1)安装Scrapy环境步骤请参考:https://blog.csdn.net/c406495762/article/details/60156205 需要注意的是,安装的时候需要根据自己的pyt ...
php外挂python脚本抓取ajax数据
之前我写过一遍php外挂python脚本处理视频的文章.今天和大家分享下php外挂python实现输入关键字搜索的脚本首先我们先来分析一波网站: http://www.dzdpw.com/s.php ...
scrapy-splash抓取动态数据例子八
一.介绍本例子用scrapy-splash抓取界面网站给定关键字抓取咨询信息. 给定关键字:个性化:融合:电视抓取信息内如下: 1.资讯标题 2.资讯链接 3.资讯时间 4.资讯来源二.网站信息 ...
scrapy-splash抓取动态数据例子七
一.介绍本例子用scrapy-splash抓取36氪网站给定关键字抓取咨询信息. 给定关键字:个性化:融合:电视抓取信息内如下: 1.资讯标题 2.资讯链接 3.资讯时间 4.资讯来源二.网站信 ...
scrapy-splash抓取动态数据例子六
一.介绍本例子用scrapy-splash抓取中广互联网站给定关键字抓取咨询信息. 给定关键字:打通:融合:电视抓取信息内如下: 1.资讯标题 2.资讯链接 3.资讯时间 4.资讯来源二.网站信 ...
scrapy-splash抓取动态数据例子五
一.介绍本例子用scrapy-splash抓取智能电视网网站给定关键字抓取咨询信息. 给定关键字:打通:融合:电视抓取信息内如下: 1.资讯标题 2.资讯链接 3.资讯时间 4.资讯来源二.网站 ...
scrapy-splash抓取动态数据例子四
一.介绍本例子用scrapy-splash抓取微众圈网站给定关键字抓取咨询信息. 给定关键字:打通:融合:电视抓取信息内如下: 1.资讯标题 2.资讯链接 3.资讯时间 4.资讯来源二.网站信息 ...

随机推荐

Unity3D研究院编辑器之脚本设置ToolBar
Unity版本5.3.2 如下图所示,ToolBar就是Unity顶部的那一横条.这里的所有按钮一般情况下都得我们手动的用鼠标去点击.这篇文章我们说说如果自动操作它们 1.自动点击左边四个按钮 (拖动 ...
requests
>>>import requests>>> r = requests.get('http://www.zhidaow.com') # 发送请求>>&g ...
怎么用ABBYY将PDF转换为JPEG图像
FineReader Mac版,全称ABBYY FineReader Pro for Mac,是一款流行的OCR图文识别软件,可快速方便地将扫描纸质文档.PDF文件和数码相机的图像转换成可编辑.可搜索 ...
c#, 输出二进制
int x=-17; string str= Convert.ToString(x,2);Debug.Log(str); 输出结果: 11111111111111111111111111101111 ...
OpenJudge计算概论-整数奇偶排序
/*===================================== 整数奇偶排序总时间限制: 1000ms 内存限制: 65536kB 描述输入10个整数,彼此以空格分隔重新排序以后 ...
64位python安装MySQL-python 1.2.5
在64位的python直接安装MySQL-python 1.2.5有问题,参考http://www.linuxfly.org/windows_install_mysql_python_library/ ...
linux下的chmod,chown和chgrp
对于linux的权限掌握以下几个命令就可以非常熟练的操作系统中的各种权限了. 使用权限 : 所有使用者使用方式 : chmod [-cfvR] [--help] [--version] mode f ...
js 删除DropDownList的选项
function del_DropDownList_Option() { var ddlXZ= document.getElementById("name&quo ...
LINQ学习入门教程（一）
LINQ 查询简介 Linq 是一跨各种数据源和数据格式的数据模型:它在查询是,始终是把它作为一种对象来操作,可以使用基本相同的编码模型查询和数据的转换XML,SQL,ADO数据等: Li ...
IOS开发小项目—找色块游戏
1.项目代码: @interface NextViewController () { int r ;//色块层数的全局变量 int m;//后面用于tag值的变化 UIView *view;//色块 ...

python 多线程抓取动态数据

python 多线程抓取动态数据的更多相关文章

随机推荐

热门专题