Scrapy-02-item管道、shell、选择器

Scrapy-02

item管道：

scrapy提供了item对象来对爬取的数据进行保存，它的使用方法和字典类似，不过，相比字典，item多了额外的保护机制，可以避免拼写错误和定义字段错误。
创建的item需要继承scrapy.Item类，并且在里面定义Field字段。(我们爬取的是盗墓笔记，只有文章标题和内容两个字段)
定义item，在item.py中修改：

 # -*- coding: utf-8 -*-

 # Define here the models for your scraped items

 #

 # See documentation in:

 # https://doc.scrapy.org/en/latest/topics/items.html

 import scrapy

 class BooksItem(scrapy.Item):

     # define the fields for your item here like:

     # name = scrapy.Field()

     title = scrapy.Field()

     content = scrapy.Field()

解析response和对item的使用：

 # -*- coding: utf-8 -*-

 import scrapy

 from ..items import BooksItem

 class DmbjSpider(scrapy.Spider):

     name = 'dmbj'

     allowed_domains = ['www.cread.com']

     start_urls = ['http://www.cread.com/chapter/811400395/69162457.html/']

     def parse(self, response):

         item = BooksItem()

         item['title'] = response.xpath('//h1/text()').extract_first()

         item['content'] = response.xpath('//div[@class="chapter_con"]/text()').extract_first()

         yield item

 # -*- coding: utf-8 -*-

 # Define your item pipelines here

 #

 # Don't forget to add your pipeline to the ITEM_PIPELINES setting

 # See: https://doc.scrapy.org/en/latest/topics/item-pipeline.html

 class BooksPipeline(object):

     def process_item(self, item, spider):

         with open('files/{}.txt'.format(item['title']), 'w+') as f:

             f.write(item['content'])

         return item

     def open_spider(self, spider):

         # 爬虫启动时调用

         pass

     def close_spider(self, spider):

         # 爬虫关闭时调用

         pass

在parse方法中导入item中定义需要的类，将该类实例化，实例化的类对他进行字典的方式操作，直接对其赋值，字典的key值必须和类中对应的字段名字一直。

然后对其使用yield
在pipline.py里面定义三个方法:
- process_item:
  - 对parse返回的item进行处理，然后在返回出去
- open_spider：
  - 爬虫启动的时候自动调用
- close_spider：
  - 爬虫关闭的时候调用
pipline里面定义的pipline需要使用，就得到setting里面讲ITEM_PIPELINES的字典激活

ITEM_PIPELINES = {
   'books.pipelines.BooksPipeline': 300,
}

shell
- scrapy shell 是scrapy提供的一个交互式的调试工具，如果当前环境中安装了ipython，那么将默认调用ipython，也可以在scrapy.cfg的setting下设置: shell = ipython
- 使用scrapy shell：
  - 终端输入: scrapy shell [url] //url：想爬取的网址，可不添加（也可以是个本地的文件，以路径的方式写入）
- fetch：
  - fetch接受一个url，构成一个新的请求对象，对返回新的response

Scrapy-02-item管道、shell、选择器的更多相关文章

在Scrapy中如何利用Xpath选择器从HTML中提取目标信息（两种方式）
前一阵子我们介绍了如何启动Scrapy项目以及关于Scrapy爬虫的一些小技巧介绍,没来得及上车的小伙伴可以戳这些文章: 手把手教你如何新建scrapy爬虫框架的第一个项目(上) 手把手教你如何新建s ...
Scrapy 使用 Item 封装数据、使用 Item Pipline处理数据
1.Item 和 Field Scrapy 提供一下两个类,用户可以使用它们自定义数据类,封装爬取到的数据: (1)Item类自定义数据类(如 BookItem)的基类 (2)Field 用来描述自 ...
爬虫框架Scrapy 之(四) --- scrapy运行原理(管道）
解析后返回可迭代对象这个对象返回以后就会被爬虫重新接收,然后进行迭代通过scrapy crawl budejie -o xx.josn/xx.xml/xx.csv 将迭代数据输出到json.xml ...
python之scrapy的debug、shell、settings、pipelines
1.debug了解 2.scrapy shell了解 Scrapy shell是一个交互终端,我们可以在未启动spider的情况下尝试及调试代码,也可以用来测试XPath表达式使用方法: scrap ...
Scrapy 教程(十)-管道与数据库
Scrapy 框架将爬取的数据通过管道进行处理,即 pipelines.py 文件. 管道处理流程一.定义 item item 表示的是数据结构,定义了数据包括哪些字段 class TianqiIt ...
手把手教你进行Scrapy中item类的实例化操作
接下来我们将在爬虫主体文件中对Item的值进行填充. 1.首先在爬虫主体文件中将Item模块导入进来,如下图所示. 2.第一步的意思是说将items.py中的ArticleItem类导入到爬虫主体文件 ...
scrapy数据写入管道
1 setting里面启动管道 ITEM_PIPELINES = { 'ganji.pipelines.GanjiPipeline': 300,}2 拿到的数据通过yield返回给管道 # -*- c ...
scrapy框架基于管道的持久化存储
scrapy框架的使用基于管道的持久化存储的编码流程在爬虫文件中数据解析将解析到的数据封装到一个叫做Item类型的对象将item类型的对象提交给管道管道负责调用process_item的方法 ...
Scrapy框架-Item Pipeline
目录 1. Item Pipeline 3. 完善之前的案例: 3.1. item写入JSON文件 3.2. 启用一个Item Pipeline组件 3.3. 重新启动爬虫 1. Item Pipel ...
scrapy 代码调试用 shell
在虚拟机里CD到你的scrapy某个项目的目录,再 1. scrapy shell + '网址'(注意引号) 2. response.xpath(' ')来提取如: response.xpath(' ...

随机推荐

Spark入门（七）--Spark的intersection、subtract、union和distinc
Spark的intersection intersection顾名思义,他是指交叉的.当两个RDD进行intersection后,将保留两者共有的.因此对于RDD1.intersection(RDD2 ...
C 和 C++语言中的内存拷贝函数memcpy()
memcpy指的是C和C++使用的内存拷贝函数函数原型为void *memcpy(void *destin, void *source, unsigned n): 函数的功能是从源内存地址的起始位置 ...
CSS每日学习笔记（0）
7.29.2019 1. CSS 指层叠样式表 (Cascading Style Sheets) 样式定义如何显示 HTML 元素样式通常存储在样式表中把样式添加到 HTML 4.0 中,是为了解 ...
[Alg] 文本匹配-单模匹配-KMP
1. 暴力求解如下图所示.蓝色的小三角表示和sequence比较时的开始字符,绿色小三角表示失败后模式串比对的开始字符,红色框表示当前比较的字符对. 当和模式串发生不匹配时,蓝色小三角后移一位,绿色 ...
单片机的 HexToStr HexToBcd BcdToStr 几个转换函数
今天写单片机一个程序要检查一些数据,想发到串口调试的软件上在电脑上查看有些转换函数想网上找一个看看都是很多的垃圾文章很多的程序都不能用,那些发文章的人也不用心所以我还是自己动手写一下吧写 ...
spring官方demo及配置查看
1.http://spring.io/projects/spring-framework 2.https://github.com/spring-projects/spring-mvc-showcas ...
在vscode中配置LeetCode插件，从此愉快地刷题
大家好,今早在B站看到up主的vscode里藏了leetcode插件,这才知道原来还有这款神器.但是没想到在用的时候遇到了一些麻烦,花了一点时间才解决.所以写这篇文章除了给大家安利这个好用的插件之外, ...
爬虫&Selenium&ChromeDriver
一.Selenium selenium是什么 Selenium [1] 是一个用于Web应用程序测试的工具.Selenium测试直接运行在浏览器中,就像真正的用户在操作一样.支持的浏览器包括IE(7, ...
Activiti入门案例
一.流程定义 Activiti-Designer 使用 Palette(画板) 在eclipse 或 idea 中安装activiti-designer 插件即可使用,画板中包括以下结点: Conne ...
STM32CubeMx——串口收发
生成代码 1.配置串口1 2.选择模式 3.开中断 4.其他的RCC.调试都一样,弄完直接生成代码. 串口发送 1.定义一个用来测试的数组并初始化 /* USER CODE BEGIN 0 */ ui ...

Scrapy-02-item管道、shell、选择器

Scrapy-02-item管道、shell、选择器的更多相关文章

随机推荐

热门专题