scrapy框架中多个spider,tiems,pipelines的使用及运行方法

用scrapy只创建一个项目，创建多个spider，每个spider指定items,pipelines.启动爬虫时只写一个启动脚本就可以全部同时启动。

本文代码已上传至github,链接在文未。

一，创建多个spider的scrapy项目

scrapy startproject mymultispider

cd mymultispider

scrapy genspider myspd1 sina.com.cn

scrapy genspider myspd2 sina.com.cn

scrapy genspider myspd3 sina.com.cn

二，运行方法

1.为了方便观察，在spider中分别打印相关信息

import scrapy

class Myspd1Spider(scrapy.Spider):

    name = 'myspd1'

    allowed_domains = ['sina.com.cn']

    start_urls = ['http://sina.com.cn/']

    def parse(self, response):

        print('myspd1')

其他如myspd2,myspd3分别打印相关内容。

2.多个spider运行方法有两种，第一种写法比较简单，在项目目录下创建crawl.py文件，内容如下

from scrapy.crawler import CrawlerProcess

from scrapy.utils.project import get_project_settings

process = CrawlerProcess(get_project_settings())

# myspd1是爬虫名

process.crawl('myspd1')

process.crawl('myspd2')

process.crawl('myspd3')

process.start()

为了观察方便，可在settings.py文件中限定日志输出

LOG_LEVEL = 'ERROR'

右键运行此文件即可，输出如下

3.第二种运行方法为修改crawl源码，可以从官方的github中找到：https://github.com/scrapy/scrapy/blob/master/scrapy/commands/crawl.py

在spiders目录的同级目录下创建一个mycmd目录，并在该目录中创建一个mycrawl.py,将crawl源码复制进来，修改其中的run方法，改为如下内容

def run(self, args, opts):

    # 获取爬虫列表

    spd_loader_list = self.crawler_process.spider_loader.list()

    # 遍历各爬虫

    for spname in spd_loader_list or args:

        self.crawler_process.crawl(spname, **opts.spargs)

        print("此时启动的爬虫：" + spname)

    self.crawler_process.start()

在该文件的目录下创建初始化文件__init__.py

完成后机构目录如下

使用命令启动爬虫

scrapy mycrawl --nolog

输出如下：

三，指定items

1,这个比较简单，在items.py文件内创建相应的类，在spider中引入即可

items.py

import scrapy

class MymultispiderItem(scrapy.Item):

    # define the fields for your item here like:

    # name = scrapy.Field()

    pass

class Myspd1spiderItem(scrapy.Item):

    name = scrapy.Field()

class Myspd2spiderItem(scrapy.Item):

    name = scrapy.Field()

class Myspd3spiderItem(scrapy.Item):

    name = scrapy.Field()

spider内，例myspd1

# -*- coding: utf-8 -*-

import scrapy

from mymultispider.items import Myspd1spiderItem

class Myspd1Spider(scrapy.Spider):

    name = 'myspd1'

    allowed_domains = ['sina.com.cn']

    start_urls = ['http://sina.com.cn/']

    def parse(self, response):

        print('myspd1')

        item = Myspd1spiderItem()

        item['name'] = 'myspd1的pipelines'

        yield item

四，指定pipelines

1,这个也有两种方法，方法一，定义多个pipeline类：

pipelines.py文件内：

class Myspd1spiderPipeline(object):

    def process_item(self,item,spider):

        print(item['name'])

        return item

class Myspd2spiderPipeline(object):

    def process_item(self,item,spider):

        print(item['name'])

        return item

class Myspd3spiderPipeline(object):

    def process_item(self,item,spider):

        print(item['name'])

        return item

1.1settings.py文件开启管道

ITEM_PIPELINES = {

   # 'mymultispider.pipelines.MymultispiderPipeline': 300,

   'mymultispider.pipelines.Myspd1spiderPipeline': 300,

   'mymultispider.pipelines.Myspd2spiderPipeline': 300,

   'mymultispider.pipelines.Myspd3spiderPipeline': 300,

}

1.2spider中设置管道，例myspd1

# -*- coding: utf-8 -*-

import scrapy

from mymultispider.items import Myspd1spiderItem

class Myspd1Spider(scrapy.Spider):

    name = 'myspd1'

    allowed_domains = ['sina.com.cn']

    start_urls = ['http://sina.com.cn/']

    custom_settings = {

        'ITEM_PIPELINES': {'mymultispider.pipelines.Myspd1spiderPipeline': 300},

    }

    def parse(self, response):

        print('myspd1')

        item = Myspd1spiderItem()

        item['name'] = 'myspd1的pipelines'

        yield item

指定管道的代码

custom_settings = {

        'ITEM_PIPELINES': {'mymultispider.pipelines.Myspd1spiderPipeline': 300},

    }

1.3运行crawl文件，运行结果如下

2，方法二，在pipelines.py文件内判断是哪个爬虫的结果

2.1 pipelines.py文件内

class MymultispiderPipeline(object):

    def process_item(self, item, spider):

        if spider.name == 'myspd1':

            print('myspd1的pipelines')

        elif spider.name == 'myspd2':

            print('myspd2的pipelines')

        elif spider.name == 'myspd3':

            print('myspd3的pipelines')

        return item

2.2 settings.py文件内只开启MymultispiderPipeline这个管道文件

ITEM_PIPELINES = {

   'mymultispider.pipelines.MymultispiderPipeline': 300,

   # 'mymultispider.pipelines.Myspd1spiderPipeline': 300,

   # 'mymultispider.pipelines.Myspd2spiderPipeline': 300,

   # 'mymultispider.pipelines.Myspd3spiderPipeline': 300,

}

2.3spider中屏蔽掉指定pipelines的相关代码

# -*- coding: utf-8 -*-

import scrapy

from mymultispider.items import Myspd1spiderItem

class Myspd1Spider(scrapy.Spider):

    name = 'myspd1'

    allowed_domains = ['sina.com.cn']

    start_urls = ['http://sina.com.cn/']

    # custom_settings = {

    #     'ITEM_PIPELINES': {'mymultispider.pipelines.Myspd1spiderPipeline': 300},

    # }

    def parse(self, response):

        print('myspd1')

        item = Myspd1spiderItem()

        item['name'] = 'myspd1的pipelines'

        yield item

2.4 运行crawl.py文件，结果如下

代码git地址：https://github.com/terroristhouse/crawler

python系列教程：

链接：https://pan.baidu.com/s/10eUCb1tD9GPuua5h_ERjHA

提取码：h0td

scrapy框架中多个spider,tiems,pipelines的使用及运行方法的更多相关文章

scrapy框架中Spiders用法
scrapy框架中Spiders用法 Spider类定义了如何爬去某个网站,包括爬取的动作以及如何从网页内容中提取结构化的数据总的来说spider就是定义爬取的动作以及分析某个网页工作流程分析以 ...
Scrapy框架中的CrawlSpider
小思考:如果想要通过爬虫程序去爬取”糗百“全站数据新闻数据的话,有几种实现方法? 方法一:基于Scrapy框架中的Spider的递归爬取进行实现(Request模块递归回调parse方法). 方法二: ...
scrapy框架中Item Pipeline用法
scrapy框架中item pipeline用法当Item 在Spider中被收集之后,就会被传递到Item Pipeline中进行处理每个item pipeline组件是实现了简单的方法的pyt ...
scrapy框架中Download Middleware用法
scrapy框架中Download Middleware用法 Downloader Middleware处理的过程主要在调度器发送requests请求的时候以及网页将response结果返回给sp ...
爬虫(十五)：Scrapy框架(二) Selector、Spider、Downloader Middleware
1. Scrapy框架 1.1 Selector的用法我们之前介绍了利用Beautiful Soup.正则表达式来提取网页数据,这确实非常方便.而Scrapy还提供了自己的数据提取方法,即Selec ...
Scrapy框架中选择器的用法【转】
Python爬虫从入门到放弃(十四)之 Scrapy框架中选择器的用法请给作者点赞 --> 原文链接 Scrapy提取数据有自己的一套机制,被称作选择器(selectors),通过特定的Xpa ...
scrapy框架中选择器的用法
scrapy框架中选择器的用法 Scrapy提取数据有自己的一套机制,被称作选择器(selectors),通过特定的Xpath或者CSS表达式来选择HTML文件的某个部分Xpath是专门在XML文件中 ...
python学习之-用scrapy框架来创建爬虫(spider)
scrapy简单说明 scrapy 为一个框架框架和第三方库的区别: 库可以直接拿来就用, 框架是用来运行,自动帮助开发人员做很多的事,我们只需要填写逻辑就好命令: 创建一个项目 : cd 到需 ...
Python爬虫从入门到放弃（十六）之 Scrapy框架中Item Pipeline用法
当Item 在Spider中被收集之后,就会被传递到Item Pipeline中进行处理每个item pipeline组件是实现了简单的方法的python类,负责接收到item并通过它执行一些行为, ...

随机推荐

.net core 3.1 DbFirst mysql
这是一套完全配置正确的方式创建项目此步骤省略打开nuget 搜索 Pomelo.EntityFrameworkCore.MySql 添加完毕该引用之后nuget 搜索 Microsoft.Enti ...
vijos 分梨子
点击打开题目很有(wei)趣(suo)的一道题暴力解法也不难,枚举大小下限与甜度下限,在一个一个地试显然 O(n^3) 炸掉但如何将其缩短,只好从那个式子来入手了: C1⋅(ai−a0)+C2 ...
SpringBoot项目的parent依赖和配置文件*.properties、*.yml详解
1.idea创建SpringBoot项目 idea创建SpringBoot项目应该对很多人来说已经是菜到不能到菜的操作了,但是对于初学者小白来说,还是要讲解一下的.打开idea,然后选择Spring ...
基于BIO的实时Socket读写操作
文章目录前言 Socket类2.1 Socket的通信过程2.2 控制Socket连接2.3 设置Socket的选项 ServerSocket类3.1 构造ServerSocket3.2 Serve ...
[校内训练20_01_20]ABC
1.问有多少个大小为N的无标号无根树,直径恰好为L.$N,L \leq 200$ 2.问一个竞赛图中有多少个长度为3.4.5的环.$N \leq 2000$ 3.给出一些直线和单个点A,问这些直线的交 ...
redis5.0 Cluster集群搭建
安装redis sudo apt update sudo apt install build-essential tcl cd ~ mkdir document/ cd document/ curl ...
c++中对象的构造和销毁
对象的初始化如下 ckasss Person { public: ]; char sex; int age; }; Person p={}; //对象初始化构造数组对象时,需要一个没有参数的构造函 ...
Docker 代理脱坑指南
Docker 代理配置由于公司 Lab 服务器无法正常访问公网,想要下载一些外部依赖包需要配置公司的内部代理.Docker 也是同理,想要访问公网需要配置一定的代理. Docker 代理分为两种,一 ...
uml图六种箭头的含义
转:https://blog.csdn.net/wglla/article/details/52225571 在看一些技术博客的时候,经常会见到博客里画上很多uml图.因为经常会被这几种表达关系的箭头 ...
Codeforces 1092 D2 Great Vova Wall (Version 2) (栈)
题意: 给一排砖,每列的高度$a_i$,问是否可以放1*2的砖,使得n列高度一样,砖只能横着放思路: 每两个相邻的高度相同的砖可以变成大于等于它的高度的任意高度所以像这样的 123321 是不满足 ...

scrapy框架中多个spider,tiems,pipelines的使用及运行方法

scrapy框架中多个spider,tiems,pipelines的使用及运行方法的更多相关文章

随机推荐

热门专题