scrapy CrawlSpider解析

CrawlSpider继承自Spider, CrawlSpider主要用于有规则的url进行爬取。

先来说说它们的设计区别：

SpiderSpider 类的设计原则是只爬取 start_urls 中的url，而 CrawlSpider 类定义了一些规则 rules 来提供跟进链接 link 的方便机制，从爬取的网页中获取link并继续跟进的工作。

先来看看刚创建一个crawlSpider的爬虫 -t 指定模板为crawlSpider

scrapy genspider -t crawl cf circ.gov.cn

LinkExtractor 的源码：

from scrapy.linkextractors import LinkExtractor

allow ：满足括号中”正则表达式”的值会被提取，如果为空，则全部匹配。

deny ：与这个正则表达式(或正则表达式列表)不匹配的url一定不提取

allow_domain：会被提取的连接的domains

deny_domains ：一定不会被提取链接的domains。

restrict_xpaths ：使用xpath表达式，和allow共同作用过滤链接。
restrict_css ：使用css选择器

在CrawlSpider源码中最先定义的是类Rule：Rule对象是一个爬取规则的类

link_extractor ：是一个Link Extractor对象。其定义了如何从爬取到的页面提取链接。

callback ：是一个callable或string（该Spider中同名的函数将会被调用）。从link_extractor中每获取到链接时将会调用该函数。该回调函数接收一个response作为其第一个参数，并返回一个包含Item以及Request对象(或者这两者的子类)的列表。

cb_kwargs ：包含传递给回调函数的参数（keyword argument）的字典。

follow ：是一个boolean值，指定了根据该规则从response提取的链接是否需要跟进。如果callback为None，follow默认设置True，否则默认False。

process_links ：是一个callable或string（该Spider中同名的函数将会被调用）。从link_extrator中获取到链接列表时将会调用该函数。该方法主要是用来过滤。

process_request ：是一个callable或string（该spider中同名的函数都将会被调用）。该规则提取到的每个request时都会调用该函数。该函数必须返回一个request或者None。用来过滤request

CrawlSpider类的源码：

rules ：

　　是一个列表，存储的元素是Rule类的实例，其中每一个实例都定义了一种采集站点的行为。如果有多个rule都匹配同一个链接，那么位置下标最小的一个rule将会被使用。

__init__ ：

　　它主要就是执行了_compile_rules方法

parse ：

　　默认回调方法。源码进行了重写，所以我们自定义的函数，不可以使用这个名，这里直接调用方法 _parse_response ，并把 parse_start_url 方法作为处理response的方法。

parse_start_url ：

　　它的主要作用就是处理parse返回的response，比如提取出需要的数据等，该方法也需要返回item、request或者他们的可迭代对象。它就是一个回调方法，和rule.callback用法一样。

_requests_to_follow ：

　　它的作用就是从response中解析出目标url，并将其包装成request请求。该请求的回调方法是_response_downloaded，这里为request的meta值添加了rule参数，该参数的值是这个url对应rule在rules中的下标。

_response_downloaded ：

　　该方法是方法 _requests_to_follow 的回调方法，作用就是调用 _parse_response 方法，处理下载器返回的 response ，设置 response 的处理方法为 rule.callback 方法。

_parse_response ：

　　该方法将 resposne 交给参数callback代表的方法去处理，然后处理callback方法的requests_or_item。再根据rule.follow and spider._follow_links来判断是否继续采集，如果继续那么就将response交给_requests_to_follow方法，根据规则提取相关的链接。spider._follow_links的值是从settings的CRAWLSPIDER_FOLLOW_LINKS值获取到的。

_compile_rules ：

　　作用就是将rule中的字符串表示的方法改成实际的方法，方便以后使用。

from_crawler ：

　　用于创建，在scrapy源码中这种创建方式比较多

整个数据的流向如下图所示：

示例：

1.创建项目

scrapy startproject circ

2. 创建crawl爬虫

cd circ

scrapy genspider -t crawl cf circ.gov.cn

3.编写cf.py

import scrapy

from scrapy.linkextractors import LinkExtractor

from scrapy.spiders import CrawlSpider, Rule

import re

class CfSpider(CrawlSpider):

    name = 'cf'

    allowed_domains = ['circ.gov.cn']

    start_urls = ['http://www.circ.gov.cn/web/site0/tab5240/module14430/page1.htm']

    #定义提取url地址规则

    rules = (

        #LinkExtractor 连接提取器，提取url地址

        #callback 提取出来的url地址的response会交给callback处理

        #follow 当前url地址的响应是够重新进过rules来提取url地址，

        Rule(LinkExtractor(allow=r'/web/site0/tab5240/info\d+\.htm'), callback='parse_item'),

        Rule(LinkExtractor(allow=r'/web/site0/tab5240/module14430/page\d+\.htm'),follow=True),

    )

    #parse函数有特殊功能，不能定义

    def parse_item(self, response):

        item = {}

        item["title"] = re.findall("<!--TitleStart-->(.*?)<!--TitleEnd-->",response.body.decode())[0]

        item["publish_date"] = re.findall("发布时间：(20\d{2}-\d{2}-\d{2})",response.body.decode())[0]

        print(item)

scrapy CrawlSpider解析的更多相关文章

scrapy -->CrawlSpider 介绍
scrapy -->CrawlSpider 介绍 1.首先,通过crawl 模板新建爬虫: scrapy genspider -t crawl lagou www.lagou.com 创建出来的 ...
scrapy初步解析源码即深度使用
scrapy深度爬虫 ——编辑:大牧莫邪本章内容深度爬虫概述 scrapy Spider实现的深度爬虫 scrapy CrawlSpdier实现的深度爬虫案例操作课程内容 1. 深度爬虫概述 ...
scrapy系列（四）——CrawlSpider解析
CrawlSpider也继承自Spider,所以具备它的所有特性,这些特性上章已经讲过了,就再在赘述了,这章就讲点它本身所独有的. 参与过网站后台开发的应该会知道,网站的url都是有一定规则的.像dj ...
Scrapy - CrawlSpider爬虫
crawlSpider 爬虫思路: 从response中提取满足某个条件的url地址,发送给引擎,同时能够指定callback函数. 1. 创建项目 scrapy startproject mysp ...
Python+Scrapy+Crawlspider 爬取数据且存入MySQL数据库
1.Scrapy使用流程 1-1.使用Terminal终端创建工程,输入指令:scrapy startproject ProName 1-2.进入工程目录:cd ProName 1-3.创建爬虫文件( ...
scrapy递归解析和post请求
递归解析递归爬取解析多页页面数据每一个页面对应一个url,则scrapy工程需要对每一个页码对应的url依次发起请求,然后通过对应的解析方法进行作者和段子内容的解析. 实现方案: 1.将每一个页码 ...
Scrapy CrawlSpider源码分析
crawl.py中主要包含两个类: 1. CrawlSpider 2. Rule link_extractor:传LinkExtractor实例对象 callback:传”func_name“ cb_ ...
别再滥用scrapy CrawlSpider中的follow=True
对于刚接触scrapy的同学来说, crawlspider中的rule是比较难理解的, 很可能驾驭不住. 而且笔者在YouTube中看到许多公开的演讲都都错用了follow这一选项, 所以今天就来仔细 ...
scrapy架构解析

随机推荐

SQL Server存储过程邮件发送以表格方式发送
一.收到邮件显示:示例二.存储过程代码部分: BEGIN SET NOCOUNT ON; --初始化 Declare @MailTo nvarchar(max) Declare @MailCc nv ...
centos7下报错： import requests ImportError: No module named requests
在网上扒了一个python脚本,在centos7上执行的时候报错: import requestsImportError: No module named requests 原因是:requests是 ...
快速构建SPA框架SalutJS--项目工程目录三
配置文件在开始我们的第一个界面之前,我们需要把初始的html和config文件配置好.html非常简单,只需要一个div作为最外部的容器包裹着所有界面即可: <!DOCTYPE html> ...
NuGet 手动清除缓存不起作用
问题有时更新了一些内网的程序库/包,但仅仅是一些小的更改,不想增加版本号再推送到内网服务器.手动删除了 .nuget 文件夹下的相关包文件,但是使用 Visual Studio 重新构建的时候,其使 ...
Spring Cloud微服务系列文，Hystrix与Eureka的整合
和Ribbon等组件一样,在项目中,Hystrix一般不会单独出现,而是会和Eureka等组件配套出现.在Hystrix和Eureka整合后的框架里,一般会用到Hystrix的断路器以及合并请求等特性 ...
C#版[击败99.69%的提交] - Leetcode 242. 有效的同构异形词 - 题解
C#版 - Leetcode 242. 有效的同构异形词 - 题解 Leetcode 242.Valid Anagram 在线提交: https://leetcode.com/problems/val ...
从零开始搭建一个规范的vue-cli 3.0项目
在这一集我们将讲到如何从安装vue-cli开始,到新建一个本地项目,再到vscode中关于eslint的配置,以及本地项目关联公司远程项目的基本操作. 一,初始化本地项目 1,首先,全局安装vue-c ...
SLAM+语音机器人DIY系列：（七）语音交互与自然语言处理——1.语音交互相关技术
摘要这一章将进入机器人语音交互的学习,让机器人能跟人进行语音对话交流.这是一件很酷的事情,本章将涉及到语音识别.语音合成.自然语言处理方面的知识.本章内容: 1.语音交互相关技术 2.机器人语音交互 ...
基于IdentityServer的系统对接微信公众号
业务需求公司有两个业务系统,A和B,AB用户之间属于多对一的关系,数据库里面也就是两张表,A表有个外键指向B.现在需要实现以下几个功能. A用户扫描B的二维码,填写相关的注册信息,注册完成之后自动属 ...
iOS weak底层实现原理
今年年底做了很多决定,离开工作三年的深圳,来到了上海,发现深圳和上海在苹果这方面还是差距有点大的,上海的市场8成使用swift编程,而深圳8成的使用OC,这点还是比较让准备来上海打拼的苹果工程师有点小 ...

scrapy CrawlSpider解析

scrapy CrawlSpider解析的更多相关文章

随机推荐

热门专题