【Download error：TOO MANY REQUESTS】&【TypeError：excepted string or buffer】

《用python写网络爬虫》，1.4.4链接爬虫，运行时，遇到错误：

Download error：TOO MANY REQUESTS

Traceback（most recent call last）:

　　File "1.py"，line 52，in(module)

　　　　link_crawler('http://example.webscraping.com'，'/index')

　　File "1.py"，line 34，in link_crawler

　　　　for link in get_links(html):

　　File "1.py"，line 50,in get_links

　　　　return webpage_regex.findall(html)

TypeError：excepted string or buffer

分析：首先定位到异常位置，再设置每次请求发送后的等待时间，可解决一次性向服务器发太多请求！

下图是原代码（即出错的代码）

 # encoding: UTF-8

 import re

 import urlparse

 import urllib2

 def download(url,user_agent='wswp',num_retries=2):

     print 'Downloading:',url

     headers = {'User-agent':user_agent}

     request = urllib2.Request(url,headers=headers)

     try:

         html = urllib2.urlopen(url).read()

     except urllib2.URLError as e:

         print 'Download error:',e.reason    # 输出错误原因

         html = None

         if num_retries > 0:

             if hasattr(e,'code')and 500 <= e.code <600:

             # 当错误提示中包含错误代码而且代码是500~600之间的数字时，执行下列代码

                 return download(url,num_retries-1)

     return html

 def link_crawler(seed_url,link_regex):

     crawl_queue = [seed_url]

     # set函数用于输出不带重复内容的列表（列表中的重复内容会被删掉）

     seen = set(crawl_queue)                             # 访问过得链接

     while crawl_queue:

             url = crawl_queue.pop()

             html = download(url)

             for link in get_links(html):

                 if re.search(link_regex,link):                # 判断link是否符合给定的正则表达式

                     link = urlparse.urljoin(seed_url,link)

                                         if link not in seen:                    # 判断此链接是否在已访问链接列表中

                         seen.add(link)

                         crawl_queue.append(link)

 def get_links(html):

     webpage_regex = re.compile(r'<a[^>]+href=["\'](.*?)["\']',re.IGNORECASE)     #匹配<a href="xxx"> 这样的字符串

     return webpage_regex.findall(html)

 link_crawler('http://example.webscraping.com','/index')

在出错位置加上等待时间（红色标明），如下：

def link_crawler(seed_url,link_regex):

    crawl_queue = [seed_url]

    # set函数用于输出不带重复内容的列表（列表中的重复内容会被删掉）

    seen = set(crawl_queue)                             # 访问过得链接

    while crawl_queue:

        url = crawl_queue.pop()

        html = download(url)

        for link in get_links(html):

            time.sleep(0.01)　　　　　　　　　　　　　　　　　　　　#防止同时请求过多，造成服务器报错if re.search(link_regex,link):                # 判断link是否符合给定的正则表达式

                    link = urlparse.urljoin(seed_url,link)    # 将相对url地址改为绝对url地址

                    if link not in seen:                    # 判断此链接是否在已访问链接列表中

                        seen.add(link)

                        crawl_queue.append(link)

测试：

可正常下载

若提示报错中断，则加入try…exception抛出异常进行调试。

【Download error：TOO MANY REQUESTS】&【TypeError：excepted string or buffer】的更多相关文章

a=re.findall('b',c)报错提示：TypeError:expected string or buffer
目的:想通过findall选取某个unicode编码的字符串列表(列表里面有元组) 问题:报错[TypeError:expected string or buffer] 现在测试下: 定义一个有元组的 ...
【Mac系统】之Mysql数据库遇到修改数字密码的问题（SQL语法错误：ERROR 1064 (42000)，密码策略等问题：ERROR 1819 (HY000)）
安装完Mysql也进行了第一次初始化密码以及修改密码规则(请参考文章),但是我想后续再改密码,出现了下面几个问题: #SQL语句错误问题 ERROR 1064 (42000): You have an ...
【译】微型ORM：PetaPoco【不完整的翻译】
PetaPoco是一款适用于.Net 和Mono的微小.快速.单文件的微型ORM. PetaPoco有以下特色: 微小,没有依赖项……单个的C#文件可以方便的添加到任何项目中. 工作于严格的没有装饰的 ...
【OpenCV入门教程之一】安装OpenCV：OpenCV 3.0 +VS 2013 开发环境配置
图片太多,具体过程参照: [OpenCV入门教程之一] 安装OpenCV:OpenCV 3.0.OpenCV 2.4.8.OpenCV 2.4.9 +VS 开发环境配置说下我这边的设置: 选择deb ...
python_day7【模块configparser、XML、requests、shutil、系统命令-面向对象】之篇
python内置模块补充一.configparser configparser:用户处理特定格式的文件,其本质是利用open打开文件 # 节点 [section1] #键值对k1 = v1 k2:v ...
【OpenCV入门教程之一】安装OpenCV：OpenCV 3.0、OpenCV 2.4.8、OpenCV 2.4.9 +VS 开发环境配置
本系列文章由@浅墨_毛星云出品,转载请注明出处. 文章链接:http://blog.csdn.net/poem_qianmo/article/details/19809337 作者:毛星云(浅墨 ...
Python开发【第二十二篇】：Web框架之Django【进阶】
Python开发[第二十二篇]:Web框架之Django[进阶] 猛击这里:http://www.cnblogs.com/wupeiqi/articles/5246483.html 博客园首页 ...
Python开发【第二十一篇】：Web框架之Django【基础】
Python开发[第二十一篇]:Web框架之Django[基础] 猛击这里:http://www.cnblogs.com/wupeiqi/articles/5237704.html Python之 ...
Scrapy爬虫框架第五讲（linux环境)【download middleware用法】
DOWNLOAD MIDDLEWRE用法详解通过上面的Scrapy工作架构我们对其功能进行下总结: (1).在Scheduler调度出队列时的Request送给downloader下载前对其进行修改 ...

随机推荐

Resources.resx 未将对象引用设置到对象的实例
原文:解决使用DevExpress开发错误:未将对象引用设置到对象的实例在使用DevExpress是总是会出现一些状况.这次同事在他的机器上调试完毕的代码发过来,却出现“未将对象引用设置到对象的实例 ...
Android零基础入门第20节：CheckBox和RadioButton使用大全
原文:Android零基础入门第20节:CheckBox和RadioButton使用大全本期先来学习Button的两个子控件,无论是单选还是复选,在实际开发中都是使用的较多的控件,相信通过本期的学习 ...
基于svg.js实现可编辑的图像
svg.js的git地址https://github.com/svgdotjs/svg.js 实现可以拖动,可双击编辑,可拖动改变长短,线条可旋转以及一个可点击改变大小,可更改内容的二维码. 首先引入 ...
Delphi检测用户是否具有administrator权限（OpenThreadToken，OpenProcessToken，GetTokenInformation，AllocateAndInitializeSid和EqualSid）
检测用户是否具有administrator权限const SECURITY_NT_AUTHORITY: TSIDIdentifierAuthority = (Value: (0, 0, 0, 0, 0 ...
nginx 配置https并自签名证书
2016-10-28 转载请注明出处:http://daodaoliang.com/ 作者: daodaoliang 版本: V1.0.1 邮箱: daodaoliang@yeah.net 参考链接: ...
QT使用MySql的配置（使用addLibraryPath载入插件），编译QT的MySql驱动问题及解决方案（自己使用libmysql.lib进行编译mysql.pro，万不得已可以查看Makefile.Debug以解决问题）
2010/04/23:Fixes : 更新批处理,以兼容WIN7. 第一次系统地玩QT,于是诞生了此预备式: [QT版本4.6.0(VS2008编译版),开发平台推荐使用Qt Creator(最新1. ...
Windows10 下运行Linux子系统
关于Windows10 下运行Linux子系统: Windows10内置Linux子系统初体验:http://www.jianshu.com/p/bc38ed12da1d Win10运行Ubuntu版 ...
Hadoop集群（第1期）CentOS安装配置
1.准备安装 1.1 系统简介 CentOS 是什么? CentOS是一个基于Red Hat 企业级 Linux 提供的可自由使用的源代码企业级的 Linux 发行版本.每个版本的 CentOS 都会 ...
在前后端分离项目中使用SpringBoot集成Shiro
前言这次在处理一个小项目时用到了前后端分离,服务端使用springboot2.x.权限验证使用了Shiro.前后端分离首先需要解决的是跨域问题,POST接口跨域时会预发送一个OPTIONS请求,浏览 ...
SLAM方向公众号、知乎、博客上有哪些大V可以关注？
一.公众号泡泡机器人:泡泡机器人由一帮热爱探索并立志推广机器人同时定位与地图构建(SLAM)技术的极客创办而成,通过原创文章.公开课等方式分享SLAM领域的数学理论.编程实践和学术前沿. 经典文 ...

【Download error：TOO MANY REQUESTS】&【TypeError：excepted string or buffer】

【Download error：TOO MANY REQUESTS】&【TypeError：excepted string or buffer】的更多相关文章

随机推荐

热门专题