scrapy使用PhantomJS爬取数据

环境：python2.7+scrapy+selenium+PhantomJS

内容：测试scrapy+PhantomJS

爬去内容：涉及到js加载更多的页面

原理：配置文件打开中间件+修改process_request函数（在里面增加PhantomJS操作）

第一步：

settings.py

DOWNLOADER_MIDDLEWARES = {

    'dbdm.middlewares.DbdmSpiderMiddleware': 543,

}

项目不一样名字会改变不影响。

第二步：

----------默认开启PhantomJS

middlewares.py

上面需要加载selenium 
from selenium import webdriver
#........省略部分代码 
@classmethod

    def process_request(cls, request, spider):

        #if request.meta.has_key('PhantomJS'):

        driver = webdriver.PhantomJS('E:\\p_python\\Scripts\\phantomjs\\bin\\phantomjs.exe')

        driver.get(request.url)

        if request.url=='https://movie.douban.com/tag':

            driver.find_element_by_xpath('//*[@id="app"]/div/div[1]/div[1]/ul[1]/li[5]/span').click()

            time.sleep(5)

            if driver.find_element_by_xpath('//*[@id="app"]/div/div[1]/a'):

                click_more(driver)

        content = driver.page_source.encode('utf-8')

        #print content

        #file = open(path.join(d, '1.txt'),'w')

        #file.write(content)

        #file.close()

        driver.quit()

        return HtmlResponse(request.url, encoding='utf-8', body=content, request=request)

def click_more(driver,i=1):

    driver.find_element_by_xpath('//*[@id="app"]/div/div[1]/a').click()

    print str(i)+'  click'

    time.sleep(5)

    i = i+1

    try:

        more_btn = driver.find_element_by_xpath('//*[@id="app"]/div/div[1]/a')

        if more_btn:

            click_more(driver,i)

    except:

        print 'click Over!!'

上面只是测试的代码，具体根据自己的项目更改，当前默认是打开PhantomJS访问url,可以通过判断。

-----------需要开启时再开启

判断key的值

上面需要加载selenium 
from selenium import webdriver

#........省略部分代码

@classmethod

    def process_request(cls, request, spider):

        if request.meta.has_key('PhantomJS'):

            driver = webdriver.PhantomJS('E:\\p_python\\Scripts\\phantomjs\\bin\\phantomjs.exe')

            driver.get(request.url)

            content = driver.page_source.encode('utf-8')

            driver.quit()

            return HtmlResponse(request.url, encoding='utf-8', body=content, request=request)

key的值设定在spider文件里面

import scrapy

from scrapy.linkextractors import LinkExtractor

from scrapy.spiders import CrawlSpider, Rule

from phantomjs_test.items import PhantomscrapyItem

class PhantomjsTestSpider(CrawlSpider):

    name = 'phantomjs_test'

    allowed_domains = ['book.com']

    start_urls = ['http://book.com/']

    #all_urls = []   去重似乎不需要

     rules = (

        ###获取所有的分页列表

        Rule(LinkExtractor(allow=r'/story/p/[2-9]*'), callback='parse', follow=True),

        ###获取里面所有的详情页

        #Rule(LinkExtractor(allow=r'/detail/p/[2-9]*'), callback = 'parse_item',follow=True),

    )

    ###从分页页面获取所有的文章url

    def parse(self, response):

        url_list = response.xpath('/a/@href').extract()

        for url in url_list:

            request = Request(url=url, callback=self.parse_item, dont_filter=True)

            request.meta['PhantomJS'] = True

            yield request

    def parse_item(self, response):

        item = PhantomscrapyItem()

        #i['domain_id'] = response.xpath('//input[@id="sid"]/@value').extract()

        #i['name'] = response.xpath('//div[@id="name"]').extract()

        #i['description'] = response.xpath('//div[@id="description"]').extract()

        item['bookName'] = response.xpath()

        items = []

        items.append(item)

        return items

以上便是默认打开与判断条件再打开的区别，根据页面不同可以设置，代码仍需要完善才能人性化。

scrapy使用PhantomJS爬取数据的更多相关文章

Scrapy持久化存储-爬取数据转义
Scrapy持久化存储爬虫爬取数据转义问题使用这种格式,会自动帮我们转义 'insert into wen values(%s,%s)',(item['title'],item['content' ...
Python使用Scrapy框架爬取数据存入CSV文件(Python爬虫实战4)
1. Scrapy框架 Scrapy是python下实现爬虫功能的框架,能够将数据解析.数据处理.数据存储合为一体功能的爬虫框架. 2. Scrapy安装 1. 安装依赖包 yum install g ...
安居客scrapy房产信息爬取到数据可视化(下)-可视化代码
接上篇:安居客scrapy房产信息爬取到数据可视化(下)-可视化代码,可视化的实现~ 先看看保存的数据吧~ 本人之前都是习惯把爬到的数据保存到本地json文件, 这次保存到数据库后发现使用mongod ...
安居客scrapy房产信息爬取到数据可视化(上)-scrapy爬虫
出发点想做一个地图热力图,发现安居客房产数据有我要的特性.emmm,那就尝试一次好了~ 老规矩,从爬虫,从拿到数据开始... scrapy的配置创建一个项目(在命令行下敲~): scrapy st ...
scrapy爬取数据的基本流程及url地址拼接
说明:初学者,整理后方便能及时完善,冗余之处请多提建议,感谢! 了解内容: Scrapy :抓取数据的爬虫框架异步与非阻塞的区别异步:指的是整个过程,中间如果是非阻塞的,那就是异步 ...
如何提升scrapy爬取数据的效率
在配置文件中修改相关参数: 增加并发默认的scrapy开启的并发线程为32个,可以适当的进行增加,再配置文件中修改CONCURRENT_REQUESTS = 100值为100,并发设置成了为100. ...
爬虫必知必会（6）_提升scrapy框架爬取数据的效率之配置篇
如何提升scrapy爬取数据的效率:只需要将如下五个步骤配置在配置文件中即可增加并发:默认scrapy开启的并发线程为32个,可以适当进行增加.在settings配置文件中修改CONCURRENT_ ...
selenium+BeautifulSoup+phantomjs爬取新浪新闻
一下载phantomjs,把phantomjs.exe的文件路径加到环境变量中,也可以phantomjs.exe拷贝到一个已存在的环境变量路径中,比如我用的anaconda,我把phantomjs. ...
借助Chrome和插件爬取数据
工具 Chrome浏览器 TamperMonkey ReRes Chrome浏览器 chrome浏览器是目前最受欢迎的浏览器,没有之一,它兼容大部分的w3c标准和ecma标准,对于前端工程师在开发过程 ...

随机推荐

tyvj4877 组合数
1．组合数 (zero.cpp/c/pas) 时间限制:1s 内存限制:256MB [问题描述] 从m个不同元素中,任取n(n≤m)个元素并成一组,叫做从m个不同元素中取出n个元素的一个组合:从m个不 ...
java傻瓜简单100%一定看的懂新手安装教程
1.java官网最新的不是很稳定 http://www.oracle.com/technetwork/java/javase/downloads/index.html 一直点下一步就可以,但别忘 ...
一行代码搞定ThoughtWorks面试题
今天在微博看到一道有趣的题目.作为python的脑残粉,自然手痒. 题目在这里. FizzBuzzWhizz 你是一名体育老师.在某次课距离下课还有五分钟时,你决定搞一个游戏.此时有100名学生在上课 ...
hibernate 映射组成关系
建立域模型和关系数据模型有着不同的出发点: 域模型: 由程序代码组成, 通过细化持久化类的的粒度可提高代码的可重用性, 简化编程在没有数据冗余的情况下, 应该尽可能降低表的数目, 简化表之间的參照关 ...
uva--10700
题意: 输入一串仅仅含有+和*号的表达式,能够通过加入括号来改变表达式的值,求表达式的最大最小值. 思路: 表达式中的数都是不大于20的正整数,由a*b+c<=a*(b+c)能够知道.先算乘法后 ...
flask框架-decorator装饰器
调用包: from functools import wraps 装饰器其实就是一个函数:参数是一个函数,返回值是一个函数 1.装饰器使用是通过@符号,在函数的上面 2.装饰器中定义的函数,要使用*a ...
基于Metronic的Bootstrap开发框架经验总结（18）-- 在代码生成工具Database2Sharp中集成对Bootstrap-table插件的分页及排序支持
在我们开发系统界面,包括Web和Winform的都一样,主要的界面就是列表展示主界面,编辑查看界面,以及一些辅助性的如导入界面,选择界面等,其中列表展示主界面是综合性的数据展示界面,一般往往需要对记录 ...
linux 虚拟机模拟配置网络路由环境-简版
前言:网络路由不管是平常在家里,还是在公司中,都是必需配置的,所以还是非常重要的,今天小编就给大家做个配置网络路由配置的小实验,仅供大家参考. 一.首先,来简单介绍一下网络路由. 1. 网络路由: ...
Java二维数组的概念和使用方法
二维数组数组的数组---二维数组的每一个元素是一个一维数组定义格式数据类型[][] 数组名 = new 数据类型[二维数组的长度/包含的一维数组的个数][每个一维数组的长度]; int[][] ...
spring cloud eureka高可用
记录下自己踩的坑 spring cloud eureka的高可用网上的教程大致分为两种,一种是两两互相注册,一种是三个互相注册. 1.两两互相注册普通服务的注册写法都是http://peer1/eu ...

scrapy使用PhantomJS爬取数据

scrapy使用PhantomJS爬取数据的更多相关文章

随机推荐

热门专题