Scrapy框架(九)--分布式爬虫

分布式爬虫
- 概念：我们需要搭建一个分布式的机群，让其对一组资源进行分布联合爬取。
- 作用：提升爬取数据的效率

- 如何实现分布式？
　　- 安装一个scrapy-redis的组件
爬取到的数据自动存放在redis中
　　- 原生的scarapy是不可以实现分布式爬虫，必须要让scrapy结合着scrapy-redis组件一起实现分布式爬虫。
　　- 为什么原生的scrapy不可以实现分布式？
　　　　- 调度器不可以被分布式机群共享
　　　　- 管道不可以被分布式机群共享
- scrapy-redis组件作用：
　　- 可以给原生的scrapy框架提供可以被共享的管道和调度器
- 实现流程
　　- 创建一个工程
　　- 创建一个基于CrawlSpider的爬虫文件
　　- 修改当前的爬虫文件：
　　　　- 导包：from scrapy_redis.spiders import RedisCrawlSpider
　　　　- 将start_urls和allowed_domains进行注释
　　　　- 添加一个新属性：redis_key = 'sun' 可以被共享的调度器队列的名称
　　　　- 编写数据解析相关的操作
　　　　- 将当前爬虫类的父类修改成RedisCrawlSpider
　　- 修改配置文件settings
　　　　- 指定使用可以被共享的管道：
　　　　　　ITEM_PIPELINES = {
　　　　　　'scrapy_redis.pipelines.RedisPipeline': 400
　　　　　　}
　　- 指定调度器：
　　　　# 增加了一个去重容器类的配置, 作用使用Redis的set集合来存储请求的指纹数据, 从而实现请求去重的持久化
　　　　DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter"
　　　　# 使用scrapy-redis组件自己的调度器
　　　　SCHEDULER = "scrapy_redis.scheduler.Scheduler"
　　　　# 配置调度器是否要持久化, 也就是当爬虫结束了, 要不要清空Redis中请求队列和去重指纹的set。如果是True, 就表示要持久化存储, 就不清空数据, 否则清空数据
　　　　SCHEDULER_PERSIST = True
　　- 指定redis服务器：
　　　　REDIS_HOST = 'ip'
　　　　REDIS_PORT = 'port'

- redis相关操作配置：
　　- 配置redis的配置文件：
　　　　- linux或者mac：redis.conf
　　　　- windows:redis.windows.conf
　　　　- 代开配置文件修改：
　　　　　　- 将bind 127.0.0.1进行删除
　　　　　　- 关闭保护模式：protected-mode yes改为no
　　- 结合着配置文件开启redis服务
　　　　- redis-server 配置文件
　　- 启动客户端：
　　　　- redis-cli
- 执行工程：
　　- scrapy runspider xxx.py
- 向调度器的队列中放入一个起始的url：
　　- 调度器的队列在redis的客户端中
　　　　- lpush xxx(redis_key即共享的调度器) www.xxx.com
- 爬取到的数据存储在了redis的proName:items这个数据结构中

将同一份代码多台电脑同时执行，任意一个客户端将人物放入调度器的队列后，机群共同爬取。

Scrapy框架(九)--分布式爬虫的更多相关文章

基于scrapy框架的分布式爬虫
分布式概念:可以使用多台电脑组件一个分布式机群,让其执行同一组程序,对同一组网络资源进行联合爬取. 原生的scrapy是无法实现分布式调度器无法被共享管道无法被共享基于 scrapy+redi ...
基于Python,scrapy,redis的分布式爬虫实现框架
原文 http://www.xgezhang.com/python_scrapy_redis_crawler.html 爬虫技术,无论是在学术领域,还是在工程领域,都扮演者非常重要的角色.相比于其他 ...
爬虫开发14.scrapy框架之分布式操作
分布式爬虫一.redis简单回顾 1.启动redis: mac/linux: redis-server redis.conf windows: redis-server.exe redis-wi ...
scrapy框架之分布式操作
分布式概念分布式爬虫: 1.概念:多台机器上可以执行同一个爬虫程序,实现网站数据的分布爬取. 2.原生的scrapy是不可以实现分布式爬虫? a)调度器无法共享 b)管道无法共享 3.scrapy- ...
6 scrapy框架之分布式操作
分布式爬虫一.redis简单回顾 1.启动redis: mac/linux: redis-server redis.conf windows: redis-server.exe redis-wi ...
scrapy如何实现分布式爬虫
使用scrapy爬虫的时候,记录一下如何分布式爬虫问题: 关键在于多台主机协作的关键:共享爬虫队列主机:维护爬取队列从机:负责数据抓取,数据处理,数据存储队列如何维护:Redis队列Redis 非 ...
scrapy——7 scrapy-redis分布式爬虫，用药助手实战，Boss直聘实战，阿布云代理设置
scrapy——7 什么是scrapy-redis 怎么安装scrapy-redis scrapy-redis常用配置文件 scrapy-redis键名介绍实战-利用scrapy-redis分布式爬 ...
基于Python使用scrapy-redis框架实现分布式爬虫
1.首先介绍一下:scrapy-redis框架 scrapy-redis:一个三方的基于redis的分布式爬虫框架,配合scrapy使用,让爬虫具有了分布式爬取的功能.github地址: https: ...
python学习之-用scrapy框架来创建爬虫(spider)
scrapy简单说明 scrapy 为一个框架框架和第三方库的区别: 库可以直接拿来就用, 框架是用来运行,自动帮助开发人员做很多的事,我们只需要填写逻辑就好命令: 创建一个项目 : cd 到需 ...
Scrapy框架——CrawlSpider类爬虫案例
Scrapy--CrawlSpider Scrapy框架中分两类爬虫,Spider类和CrawlSpider类. 此案例采用的是CrawlSpider类实现爬虫. 它是Spider的派生类,Spide ...

随机推荐

【ModelScope】5分钟让你在大火的多模态领域权威榜单VQA上超越人类
简介: ModelScope上开源了达摩院众多业界最强多模态模型,其中就有首超人类的多模态视觉问答模型mPLUG,小编从页面体验(一探).开发体验(二探).开放测试(三探)来探究多模态预训练模型能力. ...
阿里巴巴云原生混部系统 Koordinator 正式开源
简介: 脱胎于阿里巴巴内部,经过多年双 11 打磨,每年为公司节省数十亿的混部系统 Koordinator 今天宣布正式开源.通过开源,我们希望将更好的混部能力.调度能力开放到整个行业,帮助企业客户 ...
评审恩仇录——IDE也能做代码评审？
简介: 云效Codeup推出了本地IDE插件端的评审,免除了黄药师来回华山的奔波之苦现代科技公司的同事们平日一起交流开发规约和产品需求,肩上共同扛着业务发展和同行竞争的压力,这份还书贻剑的情谊如何能 ...
项目版本管理的最佳实践：云效飞流Flow篇
简介: 飞流Flow的最佳实践(使用阿里云云效)为了更好地使用飞流Flow,接下来将结合阿里云云效来讲解飞流Flow的最佳实践目录一.分支规约二.版本号规约 2.1 主版本号(首位版本号) 2. ...
Serverless Kubernetes 落地实践
简介:如何通过原生 Kubernetes 提供 Serverless 能力?如何借力丰富的云原生社区生态?本文将给大家介绍一下我们在 Serverless Kubernetes 上的落地实践. 作者 ...
庖丁解牛｜图解 MySQL 8.0 优化器查询转换篇
简介: 本篇介绍子查询.分析表和JOIN的复杂转换过程一背景和架构在<庖丁解牛-图解MySQL 8.0优化器查询解析篇>一文中我们重点介绍了MySQL最新版本8.0.25关于SQ ...
HarmonyOS 实战开发-Worker子线程中解压文件
介绍本示例介绍在Worker子线程使用@ohos.zlib提供的zlib.decompressfile接口对沙箱目录中的压缩文件进行解压操作,解压成功后将解压路径返回主线程,获取解压文件列表. 效果 ...
SAP集成技术（五）集成风格
上一节介绍了各种集成架构,这一节将介绍各种集成风格(Style).我们在日常工作中使用这些集成风格来分类不同类型的集成场景.本文将遵循SAP的集成解决方案咨询方法(ISA - M)使用的方法,将集成风 ...
03 Xpath lxml库的安装和使用
Python lxml库的安装和使用 lxml 是 Python 的第三方解析库,完全使用 Python 语言编写,它对 Xpath 表达式提供了良好的支持,因此能够了高效地解析 HTML/XML 文 ...
ruby操作excel
操作xlsx axlsx插件操作xls spreadsheet插件

Scrapy框架(九)--分布式爬虫

Scrapy框架(九)--分布式爬虫的更多相关文章

随机推荐

热门专题