Scrapy框架: 异常错误处理

import scrapy

from scrapy.spidermiddlewares.httperror import HttpError

from twisted.internet.error import DNSLookupError

from twisted.internet.error import TimeoutError, TCPTimedOutError

class ErrbackSpider(scrapy.Spider):

    name = "errback_example"

    start_urls = [

        "http://www.httpbin.org/",              	# 正常HTTP 200返回

        "http://www.httpbin.org/status/404",    	# 404 Not found error

        "http://www.httpbin.org/status/500",    	# 500服务器错误

        "http://www.httpbin.org:12345/",        	# 超时无响应错误

        "http://www.httphttpbinbin.org/",       	# DNS 错误

    ]

    def start_requests(self):

        for u in self.start_urls:

            yield scrapy.Request(u, callback=self.parse_httpbin,

                                    errback=self.errback_httpbin,

                                    dont_filter=True)

    def parse_httpbin(self, response):

        self.logger.info('Got successful response from {}'.format(response.url))

        # 其他处理.

    def errback_httpbin(self, failure):

        # 日志记录所有的异常信息

        self.logger.error(repr(failure))

        # 假设我们需要对指定的异常类型做处理，

        # 我们需要判断异常的类型

        if failure.check(HttpError):

            # HttpError由HttpErrorMiddleware中间件抛出

            # 可以接收到非200 状态码的Response

            response = failure.value.response

            self.logger.error('HttpError on %s', response.url)

        elif failure.check(DNSLookupError):

            # 此异常由请求Request抛出

            request = failure.request

            self.logger.error('DNSLookupError on %s', request.url)

        elif failure.check(TimeoutError, TCPTimedOutError):

            request = failure.request

            self.logger.error('TimeoutError on %s', request.url)

Scrapy框架: 异常错误处理的更多相关文章

怎么安装Scrapy框架以及安装时出现的一系列错误（win7 64位 python3 pycharm）
因为要学习爬虫,就打算安装Scrapy框架,以下是我安装该模块的步骤,适合于刚入门的小白: 一.打开pycharm,依次点击File---->setting---->Project---- ...
用于未处理异常错误的.NET框架清理工具
当你启动某些程序时,会收到与此错误类似的未处理异常错误:Unhandled e0434f4dh exception at 7c81eb33h.此问题是由于.NET框架未正确安装或.NET框架系统中的另 ...
一个scrapy框架的爬虫(爬取京东图书)
我们的这个爬虫设计来爬取京东图书(jd.com). scrapy框架相信大家比较了解了.里面有很多复杂的机制,超出本文的范围. 1.爬虫spider tips: 1.xpath的语法比较坑,但是你可以 ...
爬虫基础(五)-----scrapy框架简介
---------------------------------------------------摆脱穷人思维 <五> :拓展自己的视野,适当做一些眼前''无用''的事情,防止进入只关 ...
解读Scrapy框架
Scrapy框架基础:Twsited Scrapy内部基于事件循环的机制实现爬虫的并发.原来: url_list = ['http://www.baidu.com','http://www.baidu ...
scrapy框架使用教程
scrapy框架真的是很强大.非常值得学习一下.本身py就追求简洁,所以本身代码量很少却能写出很强大的功能.对比java来说.不过py的语法有些操蛋,比如没有智能提示.动态语言的通病.我也刚学习不到1 ...
5、爬虫系列之scrapy框架
一 scrapy框架简介 1 介绍 (1) 什么是Scrapy? Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架,非常出名,非常强悍.所谓的框架就是一个已经被集成了各种功能(高性能 ...
python 全栈开发，Day137(爬虫系列之第4章-scrapy框架)
一.scrapy框架简介 1. 介绍 Scrapy一个开源和协作的框架,其最初是为了页面抓取 (更确切来说, 网络抓取 )所设计的,使用它可以以快速.简单.可扩展的方式从网站中提取所需的数据.但目前S ...
爬虫之 scrapy框架
浏览目录介绍安装项目结构及爬虫应用简介常用命令行工具 Spiders爬虫 Selectors选择器 Item Pipeline 项目管道 Downloader Middleware下载中间件 ...

随机推荐

攻防世界--dmd-50
测试文件:https://adworld.xctf.org.cn/media/task/attachments/7ef7678559ea46cbb535c0b6835f2f4d 1.准备获取信息 6 ...
windos忘记密码登陆如何修复
一.简单的方法: 开机启动windows,进入欢迎界面后,会出现输入用户名密码提示框,这时候,同时按住Ctrl+Alt+Delete,会跳出一个账号窗口,输入用户名:administer,按回车即可. ...
20191114PHP文件操作
<meta charset="utf-8"><?php// $fn=fopen("c:\\abc.txt","w"); / ...
jquery+ajax获取本地json对应数据
首先,记得导入jquery.js文件. json内容: var obj123=[ {"option":"2,3,9,14,19,24,32",&q ...
JS中去除字符串空白符
海纳百川,有容乃大 1.通过原型创建字符串的trim() //去除字符串两边的空白 String.prototype.trim=function(){ return this.replace(/(^\ ...
利用delegate来解决类之间相互引用问题（引用死锁）
类之间相互引用--类A中需要调用类B中的方法,同时,类B中又要调用类A中的方法.(也被称为引用死锁,通常会出现编译错误). 解决方法是,在类A中引用类B,并使类A成为类B的delegate,这样在类A ...
idea 查看类图
快捷键CTRL+H查看利用idea快捷键查看hierarchy,效果如下好处:可以看向上和向下的继承关系缺点:只能看继承关系,不能看实现了哪些接口在指定类右键查看diagram 也可以使用快捷 ...
gps位置坐标转百度坐标
<!DOCTYPE html><html><head><meta http-equiv="Content-Type" content=&q ...
python爬虫：2.每天爬取数据量是多少？
带宽网站阈值单机分布式几百万
【leetcode】331. Verify Preorder Serialization of a Binary Tree
题目如下: One way to serialize a binary tree is to use pre-order traversal. When we encounter a non-null ...

Scrapy框架: 异常错误处理

Scrapy框架: 异常错误处理的更多相关文章

随机推荐

热门专题