爬虫：Scrapy12 - Stats Collection

sufei 2024-10-26 17:06:46 原文

Scrapy 提供了方便的收集数据的机制。数据以 key/value 方式存储，值大多是计数值。该机制叫做数据收集器（Stats Collector），可以通过 Crawler API 的属性 stats来使用。

无论数据收集（stats collection）开启或者关闭，数据收集器永远都是可用的。因此可以 import 进自己的模块并使用其 API（增加值或者设置新的状态键（stats keys））。该做法是为了简化数据收集的方法：不应该使用超过一行代码来收集你的 spider，Scrapy 扩展或者任何你使用数据收集器代码里头的状态。

数据收集器的另一个特性是（在启用状态下）很高效，（在关闭情况下）非常高效（几乎察觉不到）。

数据收集器对每个 spider 保持一个状态。当 spider 启动时，该表自动打开，当 spider 关闭时，自动关闭。

常见数据收集器使用方法：

通过 stats 属性来使用数据收集器。下面是在扩展中使用的例子：

class ExtensionThatAccessStats(object):

    def __init__(self, stats):

        self.stats = stats

    @classmethod

    def from_crawler(cls, crawler):

        return cls(crawler.stats)

#设置数据:

stats.set_value('hostname', socket.gethostname())

#增加数据值:

stats.inc_value('pages_crawled')

#当新的值比原来的值大时设置数据:

stats.max_value('max_items_scraped', value)

#当新的值比原来的值小时设置数据:

stats.min_value('min_free_memory_percent', value)

#获取数据:

>>> stats.get_value('pages_crawled')

8

#获取所有数据:

>>> stats.get_stats()

{'pages_crawled': 1238, 'start_time': datetime.datetime(2009, 7, 14, 21, 47, 28, 977139)}

可用的数据收集器

除了基本的 StatsCollector ，Scrapy 也提供了基于 StatsCollector 的数据收集器。您可以通过 STATS_CLASS 设置来选择。默认使用的是 MemoryStatsCollector 。

MemoryStatsCollector

class scrapy.statscol.MemoryStatsCollector

一个简单的数据收集器。其在 spider 运行完毕后将其数据保存在内存中。数据可以通过 spider_stats 属性访问。该属性是一个以 spider 名字为键(key)的字典。

这是 Scrapy 的默认选择。

spider_stats

保存了每个 spider 最近一次爬取的状态的字典(dict)。该字典以 spider 名字为键，值也是字典。

DummyStatsCollector

class scrapy.statscol.DummyStatsCollector

该数据收集器并不做任何事情但非常高效。您可以通过设置 STATS_CLASS 启用这个收集器，来关闭数据收集，提高效率。不过，数据收集的性能负担相较于 Scrapy 其他的处理(例如分析页面)来说是非常小的。

爬虫：Scrapy12 - Stats Collection的更多相关文章

第三百五十四节，Python分布式爬虫打造搜索引擎Scrapy精讲—数据收集(Stats Collection)
第三百五十四节,Python分布式爬虫打造搜索引擎Scrapy精讲—数据收集(Stats Collection) Scrapy提供了方便的收集数据的机制.数据以key/value方式存储,值大多是计数 ...
三十三 Python分布式爬虫打造搜索引擎Scrapy精讲—数据收集(Stats Collection)
Scrapy提供了方便的收集数据的机制.数据以key/value方式存储,值大多是计数值. 该机制叫做数据收集器(Stats Collector),可以通过 Crawler API 的属性 stats ...
Python分布式爬虫打造搜索引擎完整版-基于Scrapy、Redis、elasticsearch和django打造一个完整的搜索引擎网站
Python分布式爬虫打造搜索引擎基于Scrapy.Redis.elasticsearch和django打造一个完整的搜索引擎网站 https://github.com/mtianyan/Artic ...
scrapy反反爬虫
反反爬虫相关机制 Some websites implement certain measures to prevent bots from crawling them, with varying d ...
scrapy反反爬虫策略和settings配置解析
反反爬虫相关机制 Some websites implement certain measures to prevent bots from crawling them, with varying d ...
FAQ: Automatic Statistics Collection (文档 ID 1233203.1)
In this Document Purpose Questions and Answers What kind of statistics do the Automated tasks ...
mongodb在插入数据环节避免数据重复的方法（爬虫中的使用update）
mongo 去重 import pymongo client = pymongo.MongoClient() collection=client.t.test # collection.insert( ...
scrapy笔记集合
细读http://scrapy-chs.readthedocs.io/zh_CN/latest/index.html 目录 Scrapy介绍安装基本命令项目结构以及爬虫应用介绍简单使用示例选 ...
Scrapy学习-22-扩展开发
开发scrapy扩展定义扩展框架提供一个机制,使得你能将自定义功能绑定到Scrapy. 扩展只是正常的类,它们在Scrapy启动时被实例化.初始化注意实际上自定义扩展和spider中间件. ...

随机推荐

iOS 数据安全、数据加密传输
近期接到一个新需求:APP企业版需要接入热更新功能. 热更新需要下发补丁脚本, 脚本下发过程中需要保证脚本传输安全,且需要避免中间人攻击. 需要用到数据加密传输方面的知识,以下是我设计的加密解密流程: ...
JS基础——事件操作总结
通用事件绑定 function bindEvent(elem,type,fn) { elem.addEventListener(type,fn); } let a =document.getEle ...
mininet+floodlight使用(一)
目录一 .安装Floodlight 1.下载源和相关工具 2.安装(注意,需要java1.8,否则报错) 3.尝试游览器访问管理界面 4.修复查看不了floodlight 二.Mininet自定义拓 ...
Windows环境下写Linux sh脚本的一次挖坑和填坑
最近在研究Docker集群和安装的时候,需要准备若干台机器.所以我为节约时间,打算批量复制VM机器,然后用sh脚本命令执行机器名称和IP等基础配置信息的修改. 具体操作:我在windows环境下,用N ...
helloworld模块
环境: HelperA64开发板 Linux3.10内核时间:2019.01.11 目标:编译helloword模块 1.当出先下面错误时候,查找问题问题为Make的时候默认为PC-X86 ...
rails + MySQL 存储emoji表情 😯
database.yml 加入 charset: utf8mb4 encoding: utf8mb4 collation: utf8mb4_unicode_ci 创建migration ,更改要存放表 ...
spark 例子倒排索引
spark 例子倒排索引例子描述: [倒排索引(InvertedIndex)] 这个例子是在一本讲spark书中看到的,但是样例代码写的太java化,没有函数式编程风格,于是问了些高手,教我写了份函 ...
线段树模板（施工ing）
声明题目: 洛谷 P3372 优化之处:复杂度 O(n log n)级,可快速维护区间的各种操作(如:区间和.)
20155230 《Java程序设计》实验一（Java开发环境的熟悉）实验报告
练习题: 凯撒密码: import java.util.Scanner; import java.io.*; public class exp1 { public static void main(S ...
ConfigurationManager 读写AppSettings键值对
using System; using System.Configuration; namespace ConsoleApplication1 { class Program { static voi ...