Scrapy学习(一)、Scrapy框架和数据流

Scrapy是用python写的爬虫框架，架构图如下：

它可以分为如下七个部分：

1、Scrapy Engine:引擎，负责控制数据流在系统的所有组件中流动，并在相应动作发生时触发时间。

2、Scheduler:调度器，从引擎接收Request并将它们入队，以便引擎再次请求Request时提供给引擎。

3、Downloader:下载器，负责获取页面数据并提供给引擎，而后提供给Spiders。

4、Spider：爬虫，定义爬虫逻辑和解析规则，主要负责解析Response并生成提取结果（item）和新的请求(Request)。

5、Item Pipeline:管道，负责处理右Spider提取出来的结果（item）。主要任务是清洗，验证和存储数据。

6、Downloader middlewares:下载器中间件，位于引擎和下载器之间的特定钩子，处理引擎传给下载器的Request以及下载器传给引擎的Response。

7、Spider middlewares:爬虫中间件，位于引擎和爬虫之间的特定钩子，主要处理爬虫的输入（Response）和输出（Item和Request）

具体数据流如下：

1、引擎（Scrapy Engine）打开一个网站，找到处理该网站的Spider，并向该Spider请求第一个要爬取的URL

2、引擎（Scrapy Engine）从Spider中获取到第一个要爬取的URL后，通过调度器（Scheduler）以Request的形式调度

3、引擎（Scrapy Engine）向调度器（Scheduler）请求下一个要爬取的URL

4、调度器（Scheduler）返回下一个要爬取的URL给引擎（Scrapy Engine），引擎将该URL通过下载中间件（Downloader middlewares）转发给下载器（Downloader）

5、下载器（Downloader）下载页面，一旦页面下载完毕，下载器生成一个该页面的Response，并将其通过下载中间件（Downloader middlewares）发送给引擎

6、引擎（Scrapy Engine）从下载中间件（Downloader middlewares）接收Response，并将其通过爬虫中间件（Spider middlewares）发送给爬虫（Spider）处理

7、爬虫（Spider）处理Response，并返回处理的Item及新的Request给引擎

8、引擎（Scrapy Engine）将爬虫（Spider）返回的Item给管道（Item Pipeline），将新的Request给调度器（Scheduler）

9、重复第2步到第8步，直到调度器（Scheduler）中没有更多的Request，引擎（Scrapy Engine）关闭该网站，爬虫结束

Scrapy学习(一)、Scrapy框架和数据流的更多相关文章

python爬虫学习之Scrapy框架的工作原理
一.Scrapy简介 Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架. 可以应用在包括数据挖掘,信息处理或存储历史数据等一系列的程序中. 其最初是为了页面抓取 (更确切来说, 网 ...
Python爬虫框架Scrapy学习笔记原创
字号 scrapy [TOC] 开始 scrapy安装首先手动安装windows版本的Twisted https://www.lfd.uci.edu/~gohlke/pythonlibs/#twi ...
python爬虫之Scrapy学习
在爬虫的路上,学习scrapy是一个必不可少的环节.也许有好多朋友此时此刻也正在接触并学习scrapy,那么很好,我们一起学习.开始接触scrapy的朋友可能会有些疑惑,毕竟是一个框架,上来不知从何学 ...
爬虫系列---scrapy post请求、框架组件和下载中间件+boss直聘爬取
一 Post 请求在爬虫文件中重写父类的start_requests(self)方法父类方法源码(Request): def start_requests(self): for url in se ...
Scrapy学习篇（十）之下载器中间件（Downloader Middleware）
下载器中间件是介于Scrapy的request/response处理的钩子框架,是用于全局修改Scrapy request和response的一个轻量.底层的系统. 激活Downloader Midd ...
scrapy 学习笔记1
最近一段时间开始研究爬虫,后续陆续更新学习笔记爬虫,说白了就是获取一个网页的html页面,然后从里面获取你想要的东西,复杂一点的还有: 反爬技术(人家网页不让你爬,爬虫对服务器负载很大) 爬虫框架( ...
scrapy学习（完全版）
scrapy1.6中文文档 scrapy1.6中文文档 scrapy中文文档 Scrapy框架下载页面解析页面并发深度安装 scrapy学习教程如果安装了anconda,可以在anacon ...
scrapy学习笔记（二）框架结构工作原理
scrapy结构图: scrapy组件: ENGINE:引擎,框架的核心,其它所有组件在其控制下协同工作. SCHEDULER:调度器,负责对SPIDER提交的下载请求进行调度. DOWNLOADER ...
Scrapy （网络爬虫框架）入门
一.Scrapy 简介: Scrapy是用纯Python实现一个为了爬取网站数据.提取结构性数据而编写的应用框架,Scrapy 使用了 Twisted['twɪstɪd](其主要对手是Tornado) ...

随机推荐

javase-整数变量的交换
public class Operator { public static void main(String[] args) { int a=10; int b=20; System.out.prin ...
双01字典树最小XOR（three arrays）--2019 Multi-University Training Contest 5（hdu杭电多校第5场）
题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=6625 题意: 给你两串数 a串,b串,让你一一配对XOR使得新的 C 串字典序最小. 思路: 首先这边 ...
[转载]static in Java
来源:https://www.cnblogs.com/chenssy/p/3386721.html 一. static代表着什么在Java中并不存在全局变量的概念,但是我们可以通过static来实现 ...
weex 通用样式以及需要注意的问题
一.说明 weex 对于 css 样式的支持是非常有限的,并且使用样式的时候,必须遵循 weex 定义的规则. 对于不遵循 weex 样式规则的代码,往往在 web 页面上有效,而在 native 环 ...
React前端有钱途吗？《React+Redux前端开发实战》学起来
再不学React就真的跟不上大前端的形式了,目前几乎所有前端的招聘条件都是精通React者优先,看看拉勾网的React薪资,都是15K-20K,这个暑假,必须动起来了. 如果你熟悉JavaScript ...
大型分布式爬虫准备 scrapy + request
那些高手爬虫好文而我避免这些问题的方式,控制台清除所有定时 var id = setInterval(function() {}, 0); while (id--) clearInterval(i ...
Halide安装指南release版本
Halide安装指南本版本针对Halide release版本 by jourluohua 使用的是Ubuntu 16.04 64位系统默认Gcc 4.6 由于halide中需要C++ 11中的特性 ...
python 安装时，为何pip install不是内部或者外部命令错误解决办法
新安装的python 环境,第一次pip install 却报不是内部或者外部命令错误首先检查一下环境变量,可能时你没有设置环境变量再说一遍,安装python环境时,记得出了python.exe ...
人脸识别之Python DLib库进行人脸关键点识别
一.首先安装DLib模块这里只介绍linux安装的过程,windows安装过程请自行百度 1.首先,安装dlib.skimage前:先安装libboost sudo apt-get install ...
pat(B)_1001
1001 害死人不偿命的(3n+1)猜想 (15 分) 卡拉兹(Callatz)猜想: 对任何一个正整数 n,如果它是偶数,那么把它砍掉一半:如果它是奇数,那么把 (3n+1) 砍掉一半.这样一直反复 ...

Scrapy学习(一)、Scrapy框架和数据流

Scrapy学习(一)、Scrapy框架和数据流的更多相关文章

随机推荐

热门专题