selenium的使用技巧及集成到scrapy

为了爬取拉钩,今天学习了selenum的使用技巧.

from scrapy.http import HtmlResponse

class JSPageMiddleware(object):

def process_request(self, request, spider):

if spider.name == "zhihu":

browser = webdriver.Firefox(executable_path="C:/codeapp/seleniumDriver/firefox/geckodriver.exe")

browser.get(request.url)

time.sleep(3)

print("访问：{0}".format(request.url))

# 请求已完成，所以不用再发送到下载器。用HtmlResponse 之后就不会发送到downlaoder,而是直接返回给spider

return HtmlResponse(url=browser.current_url, body=browser.page_source, encoding="utf-8", request=request)

这样有个不好的地方就是每次来一个请求时都会启动一次浏览器,浏览器启动是很慢的,可以在类中初始化一个浏览器,

class JSPageMiddleware(object):

def __init__(self):

self.browser=webdriver.Firefox(executable_path="C:/codeapp/seleniumDriver/firefox/geckodriver.exe")

super(JSPageMiddleware,self).__init__()

def process_request(self, request, spider):

if spider.name == "zhihu":

self.browser.get(request.url)

time.sleep(3)

print("访问：{0}".format(request.url))

# 请求已完成，所以不用再发送到下载器。用HtmlResponse 之后就不会发送到downlaoder,而是直接返回给spider

return HtmlResponse(url=self.browser.current_url, body=self.browser.page_source, encoding="utf-8", request=request)

用上述方法,爬虫自动关闭时,浏览器不会关闭,并且每个spider会共用一个打开的浏览器,这样也不方便调试,可以把这个初始化的工作放在各个spider中

# -*- coding: utf-8 -*-

import scrapy

from selenium import webdriver

from scrapy import signals

from scrapy.xlib.pydispatch import dispatcher

from scrapy.http import HtmlResponse

class ZhihuSpider(scrapy.Spider):

name = 'zhihu'

allowed_domains = ['oschina.net/blog']

start_urls = ['https://www.oschina.net/blog']

def __init__(self):

self.browser = webdriver.Firefox(executable_path="C:/codeapp/seleniumDriver/firefox/geckodriver.exe")

super(ZhihuSpider, self).__init__()

#传递信息,也就是当爬虫关闭时scrapy会发出一个spider_closed的信息,当这个信号发出时就调用closeSpider函数关闭这个浏览器.

dispatcher.connect(self.closeSpider, signals.spider_closed)

def closeSpider(self, spider):

print("spider closed")

# 当爬虫退出的时关闭浏览器

self.browser.quit()

def parse(self, response):

# data=response.css(".SignFlow-accountInpu input[]").extract()

pass

Middleware 中的类

class JSPageMiddleware(object):

def process_request(self, request, spider):

if spider.name == "zhihu":

spider.browser.get(request.url)

time.sleep(3)

print("访问：{0}".format(request.url))

return HtmlResponse(url=spider.browser.current_url, body=spider.browser.page_source, encoding="utf-8",request=request)

注意上面三种方法都必须在settings中把JSPageMiddleware加入

DOWNLOADER_MIDDLEWARES = {

# 'outlook.middlewares.MyCustomDownloaderMiddleware': 543,

'outlook.middlewares.JSPageMiddleware': 1,

selenium的使用技巧及集成到scrapy的更多相关文章

第三百五十一节，Python分布式爬虫打造搜索引擎Scrapy精讲—将selenium操作谷歌浏览器集成到scrapy中
第三百五十一节,Python分布式爬虫打造搜索引擎Scrapy精讲—将selenium操作谷歌浏览器集成到scrapy中 1.爬虫文件 dispatcher.connect()信号分发器,第一个参数信 ...
三十 Python分布式爬虫打造搜索引擎Scrapy精讲—将selenium操作谷歌浏览器集成到scrapy中
1.爬虫文件 dispatcher.connect()信号分发器,第一个参数信号触发函数,第二个参数是触发信号,signals.spider_closed是爬虫结束信号 # -*- coding: u ...
Selenium Web 自动化 - 项目持续集成（进阶）
Selenium Web 自动化 - 项目持续集成(进阶) 2017-03-09 目录 1 背景及目标2 环境配置 2.1 SVN的安装及使用 2.2 新建Jenkins任务3 过程分析 1 背景 ...
Selenium Web 自动化 - 项目持续集成
Selenium Web 自动化 - 项目持续集成 2017-02-13 目录 1环境准备 1.1 安装git 1.2 安装jenkins 1.3 安装jenkins插件 1.4 jekins ...
将selenium集成到scrapy框架中
一首先想到的是将selenium 写在下载中间件的process_request中.如以下代码. middleware.py from selenium import webdriver from ...
phantomjs集成到scrapy中，并禁用图片，切换UA
phantomjs是一个没有界面的浏览器,支持各种web标准,提供DOM 处理, CSS 选择器, JSON, Canvas, 和 SVG,对于爬取一些经过js渲染的页面非常有用.但是phantomj ...
sublime使用技巧之集成VI
熟悉开发工具,减少多余的操作流程有助于提高开发效率,而Sublime Text 2是sublime产品的经典版本,因此本文基于Sublime Text 2讲解sublime的使用技巧. VI的主要作用 ...
selenium+testng+reportng+ant+jenkins集成日记
1.新建一个项目 2.编写测试脚本 3.配置ant的build.xml脚本 4.集成到jenkins,并运行 1.新建项目注意jdk的版本要一致 eclipse Window --Prefer ...
selenium模块使用详解、打码平台使用、xpath使用、使用selenium爬取京东商品信息、scrapy框架介绍与安装
今日内容概要 selenium的使用打码平台使用 xpath使用爬取京东商品信息 scrapy 介绍和安装内容详细 1.selenium模块的使用 # 之前咱们学requests,可以发送htt ...

随机推荐

CTF---Web入门第九题 FALSE
FALSE分值:10 来源: iFurySt 难度:易参与人数:4567人 Get Flag:2144人答题人数:2157人解题通过率:99% PHP代码审计 hint:sha1函数你有认真了解 ...
qt creator 中的"提升为..."功能简介
1.新建一个项目 2.打开文件:mainwindow.ui ->拖一个 tree widget 控件到画布->右击弹出对话框->单击"提升为..."选项 3.输入 ...
初窥React Native
这两天在学习react native,被虐得布耀布耀的,运行一个hello world花了一天时间(手动捂脸). 由于是跟着官网走,所以一开始便是开发环境的搭建.其他的就不说了(详情见 React N ...
PHPMailer发送邮件失败：SMTP connect failed
标签: PHPMailersmtp邮件服务器邮件发送失败 2015-05-22 19:29 1755人阅读评论(0) 收藏举报分类: Apache php+mysql(2) 版权声明:本文为博主 ...
Core Graphics 和Quartz 2D的区别
quartz是一个通用的术语,用于描述在IOS和MAC OS X中整个媒体层用到的多种技术包括图形.动画.音频.适配. Quart 2D 是一组二位绘图和渲染API,Core Graphic会使用 ...
J.U.C JMM. pipeline.指令重排序，happen-before
pipeline: 现在的CPU一般采用流水线方式来执行指令.一个指令执行周期被分成:取值,译码,执行,访存,写会,更新PC若干阶段.然后,多条指令可以同时存在于流水线中,同时被执行,来提高系统的吞吐 ...
关于Serializable的serialVersionUID
在实现了Serializable接口的class中,需要声明一个long serialVersionUID,用来标明当前class的版本号,但很多人在编程时,总是不原意去声明这个serialVersi ...
ASP.NET Core Razor页面禁用防伪令牌验证
在这篇短文中,我将向您介绍如何ASP.NET Core Razor页面中禁用防伪令牌验证. Razor页面是ASP.NET Core 2.0中增加的一个页面控制器框架,用于构建动态的.数据驱动的网站: ...
P1361 小M的作物
P1361 小M的作物题目描述小M在MC里开辟了两块巨大的耕地A和B(你可以认为容量是无穷),现在,小P有n中作物的种子,每种作物的种子有1个(就是可以种一棵作物)(用1...n编号). 现在,第 ...
使用“消息服务框架”（MSF）实现分布式事务的三阶段提交协议（电商创建订单的示例）
1,示例解决方案介绍在上一篇 <消息服务框架(MSF)应用实例之分布式事务三阶段提交协议的实现>中,我们分析了分布式事务的三阶段提交协议的原理,现在我们来看看如何使用消息服务框架(MSF ...

selenium的使用技巧及集成到scrapy

selenium的使用技巧及集成到scrapy的更多相关文章

随机推荐

热门专题