通过脚本同时运行几个spider

# 通过脚本同时运行几个spider
目录结构：

1.在命令行能通过的情况下创建两个spider如
TestSpider
Test2Spider

2.在items.py的同级目录创建run.py文件，有三种方式，任选其一，其代码如下：

方式一：通过CrawlerProcess同时运行几个spider

run_by_CrawlerProcess.py源代码：

 # 通过CrawlerProcess同时运行几个spider

 from scrapy.crawler import CrawlerProcess

 # 导入获取项目配置的模块

 from scrapy.utils.project import get_project_settings

 # 导入蜘蛛模块(即自己创建的spider)

 from spiders.test import TestSpider

 from spiders.test2 import Test2Spider

 # get_project_settings() 必须得有，不然"HTTP status code is not handled or not allowed"

 process = CrawlerProcess(get_project_settings())

 process.crawl(TestSpider) # 注意引入

 #process.crawl(Test2Spider) # 注意引入

 process.start()

方式二：通过CrawlerRunner同时运行几个spider

run_by_CrawlerRunner.py源代码：

 # 通过CrawlerRunner同时运行几个spider

 from twisted.internet import reactor

 from scrapy.crawler import CrawlerRunner

 from scrapy.utils.log import configure_logging

 # 导入获取项目配置的模块

 from scrapy.utils.project import get_project_settings

 # 导入蜘蛛模块(即自己创建的spider)

 from spiders.test import TestSpider

 from spiders.test2 import Test2Spider

 configure_logging()

 # get_project_settings() 必须得有，不然"HTTP status code is not handled or not allowed"

 runner = CrawlerRunner(get_project_settings())

 runner.crawl(TestSpider)

 #runner.crawl(Test2Spider)

 d = runner.join()

 d.addBoth(lambda _: reactor.stop())

 reactor.run() # the script will block here until all crawling jobs are finished

方式三：通过CrawlerRunner和链接(chaining) deferred来线性运行来同时运行几个spider

run_by_CrawlerRunner_and_Deferred.py源代码：

 # 通过CrawlerRunner和链接(chaining) deferred来线性运行来同时运行几个spider

 from twisted.internet import reactor, defer

 from scrapy.crawler import CrawlerRunner

 from scrapy.utils.log import configure_logging

 # 导入获取项目配置的模块

 from scrapy.utils.project import get_project_settings

 # 导入蜘蛛模块(即自己创建的spider)

 from spiders.test import TestSpider

 from spiders.test2 import Test2Spider

 configure_logging()

 # get_project_settings() 必须得有，不然"HTTP status code is not handled or not allowed"

 runner = CrawlerRunner(get_project_settings())

 @defer.inlineCallbacks

 def crawl():

     yield runner.crawl(TestSpider)

     #yield runner.crawl(Test2Spider)

     reactor.stop()

 crawl()

 reactor.run() # the script will block here until the last crawl call is finished

3.修改两个spider文件引入items,和外部类的如(HeadersHelper.py)的引入模式（以run.py所在目录为中心）
原导入模式：

from ..items import ScrapydoubanmovieItem

from .HeadersHelper import HeadersHelper

注释：这种导入能够在命令行scrapy crawl Test正常运行

修改为：

from items import ScrapydoubanmovieItem

from .HeadersHelper import HeadersHelper

注释：修改后这种导入在命令行scrapy crawl Test会报错，但通过运行run.py文件，能够同时运行两个spider

4.按照运行python文件的方式运行run.py,可以得到结果

通过脚本同时运行几个spider的更多相关文章

Chrome扩展开发之二——Chrome扩展中脚本的运行机制和通信方式
目录: 0.Chrome扩展开发(Gmail附件管理助手)系列之〇——概述 1.Chrome扩展开发之一——Chrome扩展的文件结构 2.Chrome扩展开发之二——Chrome扩展中脚本的运行机制 ...
Linux服务器Jboss运行环境搭建步骤和开机自动启动脚本编写运行
Jboss运行环境:Linux+Jdk+Jboss+jsp系统 Jboss软件说明:类似于Tomcat,就是一个跑Jsp系统的环境,他的站点路径跟Tomcat类似,Tomcat存放站点文件到webap ...
windows下perl的安装和脚本的运行
参考 1.windows下perl的安装和脚本的运行: 2.fddb测试fddb的评估方法: 3.gunplot5.2.4-download: 完
【Linux学习】python脚本直接运行与nohup运行结果不同
之前遇到问题,在云主机上运行python脚本直接运行与nohup运行结果不同,甚至nohup根本运行不出来. 后来参考下别人的博客,终于知道问题了. nohup 使用的python版本问题. 而且no ...
IDEA中编写脚本并运行shell脚本
IDEA中编写脚本并运行shell脚本来自 <https://blog.csdn.net/u012443641/article/details/81295999>
LoadRunner11脚本关联+运行负载+分析结果
一.脚本创建关联和插入检查点脚本录制完成后,首先需运行脚本回放,验证是否可回放成功,然后找出各事务请求中的关联点! 如本例子中,录制的场景为:打开综合窗口收件-->查询事项-->窗口登记 ...
python脚本后台运行
问题描述: 环境: CentOS6.4 一个用python写的监控脚本test1.py,用while True方式一直运行,在ssh远程(使用putty终端)时通过以下命令启动脚本: python t ...
由于Windows和Linux行尾标识引起脚本无法运行的解决
在所有的操作系统中,文本文件的结束或者换行都是有行尾符来标识的,C语言中经常使用\n作为换行,\r作为跳格TAB:实际上在计算机还没有真正出现之前,有种电传打字机的设备,每秒钟可以打印10个字符,但是 ...
linux脚本后台运行
一般情况下,linux运行脚本是随着终端的关闭而关闭的,那么怎么让脚本能够在后台运行并且不随终端关闭而关闭呢? 这时用到的是nohup命令格式: nohup 脚本路径 & 例: nohup ...

随机推荐

如何在mysql下实现事务的提交与回滚
最近要对数据库的数据进行一个定时迁移,为了防止在执行过程sql语句因为某些原因报错而导致数据转移混乱,因此要对我们的脚本加以事务进行控制. 首先我们建一张tran_test表 CREATE TABLE ...
[Yii Framework] Share the session with memcache in Yii
When developing distributed applications with Yii, naturally, we will face that we have to share the ...
springmvc配置AOP的两种方式
spingmvc配置AOP有两种方式,一种是利用注解的方式配置,另一种是XML配置实现. 应用注解的方式配置: 先在maven中引入AOP用到的依赖 <dependency> <gr ...
PHP文件包含
今天突然发现这个东西有好多奇怪的东西,特别写一下记一下测试用的1.txt及phpinfo.php内容都是phpinfo() 截断: 好多.和好多./截断:这里不测试了,摘自代码审计一书,5.2可用, ...
OpenERP report doesn't work
1. When you have used OpenOffice edited one of reports,it has stored the report's banary data is da ...
《Netty in action》目录修复版本分享
最近阅读了Netty in action一书.深感外国友人的书籍编写能力强大.作者由简入深.精简描述了Netty的相关知识,如何使用等等. 本来想翻译一下的.尝试着翻译了一点之后.发现非常痛苦啊.ps ...
TCP会话劫持_转
前言通常,大家所说的入侵,都是针对一台主机,在获得管理员权限后,就很是得意:其实,真正的入侵是占领整个内部网络.针对内部网络的攻击方法比较多,但比较有效的方法非ARP欺骗.DNS欺骗莫属了.但是,不管 ...
ActiveMQ 无法启动提示端口被占用解决方案
http://bob-zhangyong.blog.163.com/blog/static/17610982012729113326153/ ————————————————————————————— ...
要生成一个窗口，通常使用Window的子类Frame类进行实例化
要生成一个窗口,通常使用Window的子类Frame类进行实例化,而不是直接使用Window 类,框架的外观就像平常Windows系统下的窗口,有标题.边框. 菜单和大小等. setSize()方法 ...
SQL Server 2008 SP3简体中文版官方下载
微软日前公开发布了SQL Server 2008 SP3,用户可以从微软下载中心获取SP服务包和功能包升级.SP3主要包括自SQL Server 2008 SP2以来的累积更新,修复了用户反馈的一些问 ...

通过脚本同时运行几个spider

通过脚本同时运行几个spider的更多相关文章

随机推荐

热门专题