scrapy架构图与执行流程

miaoning 2024-09-05 05:40:49 原文

概览

本文描述了Scrapy的架构图、数据流动、以及个组件的相互作用

架构图与数据流

上图中各个数字与箭头代表数据的流动方向和流动顺序，具体执行流程如下：

　　0. Scrapy将会实例化一个Crawler对象，在Crawler中：

　　　　创建spider对象----_create_spider

　　　　创建engine对象----_create_engine

　　　　通过engine对象打开spider并生成第一个request---- yield self.engine.open_spider(self.spider, start_requests)

　　　　　　实例化调度器对象----Scheduler

　　　　启动引擎---- yield defer.maybeDeferred(self.engine.start)

　　1. 引擎从Spider获取初始请求

　　　　----_next_request

　　　　----_next_request_from_scheduler

　　2. 引擎把初始请求给调度器，并向调度器询问下一次请求

　　　　----scheduler.next_request

　　3. 调度器会对url进行指纹去重，如果是未爬取过的url，就把它放到队列中等待，并把下一个request返回给引擎

　　　　把url放入到队列中----enqueue_request

　　　　返回下一个request----next_request

　　4. 引擎把从调度器返回的request途径下载中间件交给下载器

　　　　----download

　　5. 一旦页面完成下载，下载器将会生成一个响应，途径下载中间件，再把它交给引擎

　　　　----download

　　6. 引擎接收到响应，并把它途径爬虫中间件，再交给spider

　　　　----_handle_downloader_output

　　7. spdier接收到响应，并对它进行解析，解析出Items或者新的Request，再把它们途径爬虫中间件，提交给引擎

　　　　----parse

　　8. 引擎把接收到的items提交给Item Pipeline，把接收到的Request提交给调度器

　　9. 从步骤1开始重复该过程，直到不在有request

各组件介绍

ENGINE

引擎（engine）控制所有部件间的数据流，并在某些事件发生时触发事件

Scheduler

调度器（scheduler）接收来自引擎的request，并对它去重，放入到请队列中；并根据队列的取出规则，把请求按顺序返回给引擎

Downloader

下载器（Downloader）获取网页数据并返回给引擎

Spiders

爬虫（Spiders）用来解析response，提取出Items和新的Requests

Item Pipeline

对Items进行进一步的清洗，并持久化

Downloader middlewares

下载中间件可以勾住下载器和引擎之间的数据流，并对它们做一些处理，比如：

在request送到下载器之前对它做一些处理，可以添加User_Agent，修改IP等
对response做一些处理

Spider middlewares

爬虫中间件可以勾住爬虫和引擎之间的数据流，并对它们做一些处理

　　　　

scrapy架构图与执行流程的更多相关文章

步步深入：MySQL架构总览->查询执行流程->SQL解析顺序
前言: 一直是想知道一条SQL语句是怎么被执行的,它执行的顺序是怎样的,然后查看总结各方资料,就有了下面这一篇博文了. 本文将从MySQL总体架构--->查询执行流程--->语句执行顺序来 ...
MySQL架构总览->查询执行流程->SQL解析顺序
Reference: https://www.cnblogs.com/annsshadow/p/5037667.html 前言: 一直是想知道一条SQL语句是怎么被执行的,它执行的顺序是怎样的,然后 ...
Spark架构与作业执行流程简介(scala版)
在讲spark之前,不得不详细介绍一下RDD(Resilient Distributed Dataset),打开RDD的源码,一开始的介绍如此: 字面意思就是弹性分布式数据集,是spark中最基本的数 ...
MySQL架构与SQL执行流程
MySQL架构设计下面是一张MySQL的架构图: 上方各个组件的含义如下: Connectors 指的是不同语言中与SQL的交互 Management Serveices & Utiliti ...
【Scrapy(一)】 Scrapy爬虫的基础执行流程
安装scrapy模块 : pip install scrapy 创建scrapy项目 1.scrapy startprojecty 项目名称注意:如果创建失败,可以先卸载原有的scrapy模块, ...
步步深入：MySQL架构总览->查询执行流程->SQL解析顺序(转)
文章转自 http://www.cnblogs.com/annsshadow/p/5037667.html https://www.cnblogs.com/cuisi/p/7685893.html
Spark架构与作业执行流程简介
https://www.cnblogs.com/shenh062326/p/3658543.html
20181012关于mysql内部执行流程
转自:https://www.cnblogs.com/annsshadow/p/5037667.html 步步深入:MySQL架构总览->查询执行流程->SQL解析顺序前言: 一直是 ...
0807再整理SQL执行流程
转自http://www.cnblogs.com/annsshadow/p/5037667.html MySQL架构总览->查询执行流程->SQL解析顺序前言: 一直是想知道一条SQ ...

随机推荐

python 安装-ERROR---Unable to find vcvarsall.bat
系统配置:Windows10 x64, Visual Studio 2017, Python2.7.1 报错信息:error: Unable to find vcvarsall.bat 报错原因:在生 ...
ES6 变量的结构赋值用途（实用技巧）
1.交换变量的值 let x=1; let y=2; [x,y]=[y,x];//x=2,y=1 2.从函数返回多个值函数只能返回一个值,如果要返回多个值,只能将它们放在数组或者对象里返回,有了解构 ...
LeetCode 46. 全排列（Permutations）
题目描述给定一个没有重复数字的序列,返回其所有可能的全排列. 示例: 输入: [1,2,3] 输出: [ [1,2,3], [1,3,2], [2,1,3], [2,3,1], [3,1,2], [ ...
查询redis中没有设置过期时间的key
#!/bin/sh ## 该脚本用来查询redis集群中,哪些key是没有设置过期时间,对应只需要修改redis的其中一个实例的 host和port ## 脚本会自动识别出该集群的所有实例,并查出对应 ...
vue小故事之父子(上下级)通信之父传子props
vue小故事之父子(上下级)通信之父传子props vue 父子(上下级)通信 props 或许你对父子通信有点迷糊,为什么这样那样父子之间就可以通信了,以下通过一个小故事来进行解说,故事模型或许有 ...
elk5.0 版本遇到的安装问题
问题1:max_map_count不够大 max virtual memory areas vm.max_map_count [65536] likely too low, increase to a ...
P3956 棋盘
P3956 棋盘题解注释都在代码里了这道题可以用DFS做,记忆化搜索,维护一个money[ ][ ] 表示到达当前节点的最小花费不需要记录VIS,因为有一个最小值判断,如果走重复的话一定会得到 ...
java随机读取文件
package split; import java.io.FileOutputStream; import java.io.IOException; import java.io.OutputStr ...
浏览器端-W3School-JavaScript：Location 对象
ylbtech-浏览器端-W3School-JavaScript:Location 对象 1.返回顶部 1. Location 对象 Location 对象 Location 对象包含有关当前 URL ...
django-登录页面添加验证码
1,安装第三方库 pip install django-simple-captcha 2,注册应用 INSTALLED_APPS = [ 'django.contrib.admin', 'django ...