关于scrapy中如何区分是接着发起请求还是开始保存文件

一.区分

根据yield迭代器生成的对象是request对象还是item对象

二.item

1.配置tem对象

在items.py文件中设置类

class MyscrapyItem(scrapy.Item):

    # define the fields for your item here like:

    # name = scrapy.Field()

    title = scrapy.Field()

    price = scrapy.Field()

    prostatus = scrapy.Field()

2.在爬虫程序中导入该类写相应的函数

from myscrapy.items import MyscrapyItem

def get_info(self,response):

    elements_list = response.css('.product')

    for element in elements_list:

        title = element.css('.productTitle a::attr(title)').extract_first() #这是css选择器

        price = element.css('.productPrice em::attr(title)').extract_first()

        prostatus = element.css('.productStatus em::text').extract_first()

        item = MyscrapyItem()  #实例话一个item对象

        item['title'] = title  #填写配置的参数

        item['price'] = price

        item['prostatus'] = prostatus

        yield item

三.再获得item参数后scrapy会自动执行pipelines.py文件中内容

1.settings文件进行注册

ITEM_PIPELINES = {

   'myscrapy.pipelines.MyscrapyPipeline': 300,   #小的优先级高

   # 'myscrapy.pipelines.MyscrapyPipeline1': 500,

}

#和中间件一个道理

2.配置MyscrapyPipeline方法

#其中两个方法非常常用

#def open_spider(self): 运行这个函数开始执行,一般都是连接数据库用

#def close_spider(self): 运行完这个函数执行,一般都是关闭数据库用

#简单拿MongoDB举例

from pymongo import MongoClient

class MyscrapyPipeline(object):

    def __init__(self,HOST,PORT,USER,PWD,DB,TABLE):

        self.HOST = HOST

        self.PORT = PORT

        self.USER = USER

        self.PWD = PWD

        self.DB = DB

        self.TABLE = TABLE

	#执行__init__之前执行

    @classmethod

    def from_crawler(cls,crawler):

        HOST = crawler.settings.get('HOST')  #crawler.settings可以直接获得setting文件中的所有名称

        PORT = crawler.settings.get('PORT')

        USER = crawler.settings.get('USER')

        PWD = crawler.settings.get('PWD')

        DB = crawler.settings.get('DB')

        TABLE = crawler.settings.get('TABLE')

        return cls(HOST,PORT,USER,PWD,DB,TABLE)

    def open_spider(self,spider):

        self.client = MongoClient(host=self.HOST,port=self.PORT,username=self.USER,password=self.PWD)

        print('连接数据库成功')

    def close_spider(self,spider):

        self.client.close()

        print('关闭数据库')

    def process_item(self, item, spider):

        self.client[self.DB][self.TABLE].insert_one(dict(item))

        return item

关于scrapy中如何区分是接着发起请求还是开始保存文件的更多相关文章

java中使用String的replace方法替换html模板保存文件
在我们的D盘下有这样一个html模板,现在我们要做的就是解析news.template文件,从数据库中提取数据将数据添加到指定的模板位置上 <head> <title>{tit ...
Shiro 权限校验不通过时，区分GET和POST请求正确响应对应的方式
引入:https://blog.csdn.net/catoop/article/details/69210140 本文基于Shiro权限注解方式来控制Controller方法是否能够访问. 例如使用到 ...
scrapy中的下载器中间件
scrapy中的下载器中间件下载中间件下载器中间件是介于Scrapy的request/response处理的钩子框架. 是用于全局修改Scrapy request和response的一个轻量.底层 ...
Scrapy中的POST请求发送和递归爬取
POST请求发送重写爬虫应用文件中继承Spider类的类的里面的start_requests(self)这个方法 def start_requests(self): #请求的url post_ur ...
Scrapy中的核心工作流程以及POST请求
五大核心组件工作流程 post请求发送递归爬取五大核心组件工作流程引擎(Scrapy)用来处理整个系统的数据流处理, 触发事务(框架核心) 调度器(Scheduler)用来接受引擎发过来的请求, ...
通过实例说明在scrapy中 yield的作用
源https://www.jianshu.com/p/7c1a084853d8 开始前的准备工作: 1.MySQL下载:点我2.python MySQL驱动下载:pymysql(pyMySql,直接用 ...
【Scrapy(二)】Scrapy 中的 Pipline,Item,Shell组件
Pipline: 1.爬虫项目与爬虫的区别与关联: 一个爬虫项目可以包含多个爬虫,如下图中爬虫项目firstspider 包含多个爬虫itcst 和爬虫itcast1 2.多个爬虫是公用一套Pipli ...
Scrapy中使用Django的Model访问数据库
Scrapy中使用Django的Model进行数据库访问当已存在Django项目的时候,直接引入Django的Model来使用比较简单 # 使用以下语句添加Django项目的目录到path impo ...
Scrapy中使用cookie免于验证登录和模拟登录
Scrapy中使用cookie免于验证登录和模拟登录引言 python爬虫我认为最困难的问题一个是ip代理,另外一个就是模拟登录了,更操蛋的就是模拟登录了之后还有验证码,真的是不让人省心,不过既然有 ...

随机推荐

sudo 1.2.27 - Security Bypass
EXP: https://www.exploit-db.com/exploits/47502?utm_source=dlvr.it&utm_medium=twitter 漏洞复现: 具体配置参 ...
管道及 I/O 重定向
I/O重定向 I/O Redirection 标准输入.标准输出.标准错误输出重定向及综合案例输入重定向及结合案例标准输入.标准输出.标准错误 file descriptors (FD,文件描述符 ...
基于Jenkins的开发测试全流程持续集成实践
今年一直在公司实践CI,本文将近半年来的一些实践总结一下,可能不太完善或优美,但的确初步解决了我目前所在项目组的一些痛点.当然这仅是一家之言也不够完整,后续还会深入实践和引入Kubernetes进行容 ...
css3 中的渐变
虽说css3 都已经使用多年了,但是关于css3的渐变用的很少.今天遇见了,就学习了一下. 首先我们打开ps,新建一个画布,选择渐变工具,这个时候我们能够看到顶栏上面的渐变类型如下第一个我们选中的是 ...
LINUX OS EXERCISE 08
1 配置crontab计划任务时,记录的格式是什么? 分钟小时日期月份星期可执行语句 2 配置crontab计划任务实例. 以root用户身份添加计划任务,每天早上7:30启动sshd服务, ...
TCPUDPDbg(TCP UDP 网络调试工具)
下载链接:https://pan.baidu.com/s/1oan44qop73X5VuBcE-rjeA 提取码:v0oa
使用VeeValidate的data-vv-scope指定验证范围
<div class="login" v-show="activeTab === 1"> <div class="panel-con ...
25.Zabbix入门必备
==Zabbix入门必备== 1.配置zabbix源 [root@zabbix ~]# cat /etc/yum.repos.d/zabbix.repo [zabbix] name=Zabbix Of ...
ES6中常用的小技巧，用了事半功倍哦
ES6中常用的小技巧,如果能在实际项目中能使用到,必定事半功倍: 1. 强制要求参数 ES6提供了默认参数值机制,允许你为参数设置默认值,防止在函数被调用时没有传入这些参数. 在下面的例子中,我们写了 ...
AWS SNS 创建订阅发布
AWS SNS 创建订阅发布 20180810 chenxin 为实现短信报警,添加以下SNS的短信(SMS)订阅选择主题,创建新主题,或修改原有主题进入对应主题后,选择创建订阅,选择SMS, ...

关于scrapy中如何区分是接着发起请求还是开始保存文件

一.区分

二.item

1.配置tem对象

2.在爬虫程序中导入该类写相应的函数

三.再获得item参数后scrapy会自动执行pipelines.py文件中内容

1.settings文件进行注册

2.配置MyscrapyPipeline方法

关于scrapy中如何区分是接着发起请求还是开始保存文件的更多相关文章

随机推荐

热门专题