python抓取不得姐动图（报错 urllib.error.HTTPError: HTTP Error 403: Forbidden）

抓取不得姐动图（报错）

# -*- coding:utf-8 -*-

#__author__ :kusy

#__content__:文件说明

#__date__:2018/7/23 17:01

import urllib.request

import re

def getHtml(url):

    page = urllib.request.urlopen(url)

    html = page.read()

    # print(html)

    return html

def getImg(reg,savePath):

    iCnt = 0

    def giveImg(html):

        imgre = re.compile(reg)

        imglist = re.findall(imgre, html.decode('utf-8'))

        nonlocal iCnt

        for imgurl in imglist:

            urllib.request.urlretrieve(imgurl, savePath + '%s.gif' % iCnt)

            iCnt += 1

    return giveImg

# html = getHtml("http://pic.sogou.com/")

# reg = r'"image":"(.+?)"'  #sougou

reg = r'data-original="(.+?\.gif)"'

savePath = 'image/gif/'

g = getImg(reg,savePath)

for i in range(10):

    if i >1:

        print("http://www.budejie.com/" + str(i))

        html = getHtml("http://www.budejie.com/" + str(i))

    else:

        html = getHtml("http://www.budejie.com/")

    g(html)

报错如下

E:\kusy\python\venv\Scripts\python.exe E:/kusy/python/getJpg.py

http://www.budejie.com/2

Traceback (most recent call last):

  File "E:/kusy/python/getJpg.py", line 35, in <module>

    html = getHtml("http://www.budejie.com/" + str(i))

  File "E:/kusy/python/getJpg.py", line 9, in getHtml

    page = urllib.request.urlopen(url)

  File "C:\Users\jingjing\AppData\Local\Programs\Python\Python36\lib\urllib\request.py", line 223, in urlopen

    return opener.open(url, data, timeout)

  File "C:\Users\jingjing\AppData\Local\Programs\Python\Python36\lib\urllib\request.py", line 532, in open

    response = meth(req, response)

  File "C:\Users\jingjing\AppData\Local\Programs\Python\Python36\lib\urllib\request.py", line 642, in http_response

    'http', request, response, code, msg, hdrs)

  File "C:\Users\jingjing\AppData\Local\Programs\Python\Python36\lib\urllib\request.py", line 570, in error

    return self._call_chain(*args)

  File "C:\Users\jingjing\AppData\Local\Programs\Python\Python36\lib\urllib\request.py", line 504, in _call_chain

    result = func(*args)

  File "C:\Users\jingjing\AppData\Local\Programs\Python\Python36\lib\urllib\request.py", line 650, in http_error_default

    raise HTTPError(req.full_url, code, msg, hdrs, fp)

urllib.error.HTTPError: HTTP Error 403: Forbidden

Process finished with exit code 1

百度了下已解决：

# -*- coding:utf-8 -*-

#__author__ :kusy

#__content__:文件说明

#__date__:2018/7/23 17:01

import urllib.request

import re

def getHtml(url):

    # 如果不加上下面的这行出现会出现urllib.error.HTTPError: HTTP Error 403: Forbidden错误

    # 主要是由于该网站禁止爬虫导致的，可以在请求加上头信息，伪装成浏览器访问User-Agent,具体的信息可以通过火狐的FireBug插件查询

    headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

    req = urllib.request.Request(url=url,headers=headers)

    page = urllib.request.urlopen(req)

    html = page.read()

    # print(html)

    return html

def getImg(reg,savePath):

    iCnt = 0

    def giveImg(html):

        imgre = re.compile(reg)

        imglist = re.findall(imgre, html.decode('utf-8'))

        nonlocal iCnt

        for imgurl in imglist:

            urllib.request.urlretrieve(imgurl, savePath + '%s.gif' % iCnt)

            iCnt += 1

    return giveImg

# html = getHtml("http://pic.sogou.com/")

# reg = r'"image":"(.+?)"'  #sougou

reg = r'data-original="(.+?\.gif)"'

savePath = 'image/gif/'

g = getImg(reg,savePath)

for i in range(10):

    if i >1:

        print("http://www.budejie.com/" + str(i))

        html = getHtml("http://www.budejie.com/" + str(i))

    else:

        html = getHtml("http://www.budejie.com/")

    g(html)

下载成功

python抓取不得姐动图（报错 urllib.error.HTTPError: HTTP Error 403: Forbidden）的更多相关文章

抓取https网页时，报错sun.security.validator.ValidatorException: PKIX path building failed 解决办法
抓取https网页时,报错sun.security.validator.ValidatorException: PKIX path building failed 解决办法原因是https证书问题, ...
Python抓取zabbix性能监控图
一.通过查询zabbix db的方式通过主机IP获取到所需要的graphid(比如CPU监控图.内存监控图等,每个图对应一个graphid),最后将图片保存到本地注:该graph必须要在 scree ...
nagios报错HTTP WARNING: HTTP/1.1 403 Forbidden解决方法
Nagios--localhost报警:"WARNING: HTTP/1.1 403 Forbidden "解决方法: In dashboard it shows alert on ...
myeclipse关于svn更新报错：OPTIONS of '/svn/Xxx': 403 Forbidden
这个问题出现原因是其他人修改了我原本写作的代码位置,把两个类转移到了别的文件夹,我更新之后只显示除了他增加的文件夹而没有里面的类,同时爆出错误: 问题原因:svn版本号不匹配,即跳版本. 解决如下:r ...
python抓取性感尤物美女图
由于是只用标准库,装了python3运行本代码就能下载到多多的美女图... 写出代码前面部分的时候,我意识到自己的函数设计错了,强忍继续把代码写完. 测试发现速度一般,200K左右的下载速度,也没有很 ...
使用Python抓取猫眼近10万条评论并分析
<一出好戏>讲述人性,使用Python抓取猫眼近10万条评论并分析,一起揭秘“这出好戏”到底如何? 黄渤首次导演的电影<一出好戏>自8月10日在全国上映,至今已有10天,其主演 ...
python抓取知乎热榜
知乎热榜讨论话题,https://www.zhihu.com/hot,本文用python抓取下来分析 #!/usr/bin/python # -*- coding: UTF-8 -*- from ur ...
Python 抓取网页并提取信息(程序详解)
最近因项目需要用到python处理网页,因此学习相关知识.下面程序使用python抓取网页并提取信息,具体内容如下: #---------------------------------------- ...
使用 Python 抓取欧洲足球联赛数据
Web Scraping在大数据时代,一切都要用数据来说话,大数据处理的过程一般需要经过以下的几个步骤数据的采集和获取数据的清洗,抽取,变形和装载数据的分析,探索和预测 ...

随机推荐

学习：简单使用MFC创建对话框窗口
MFC介绍:微软基础类库(英语:Microsoft Foundation Classes,简称MFC)是微软公司提供的一个类库(class libraries),以C++类的形式封装了Windows ...
Manjaro Linux使用1月滚粗记
每个OIer都有对Linux的向往(雾) 这不,一个月前我便看上了Manjaro,主要原因是因为Manjaro软件包全,安装简便,下面就来说说我退回windows的原因: 1.桌面卡顿,我用的gnom ...
send 和recv小结
不论是客户还是服务器应用程序都用send函数来向TCP连接的另一端发送数据. 不论是客户还是服务器应用程序都用recv函数从TCP连接的另一端接收数据. #include <sys/socket ...
[SDOI2010]捉迷藏 K-Dtree
[SDOI2010]捉迷藏链接 luogu 思路 k-dtree模板题代码 #include <bits/stdc++.h> #define ls (t[u].ch[0]) #defi ...
《Java虚拟机JVM故障诊断与性能优化》读书笔记（未完待续）
前言: 对于JVM学习用处的理解:我们程序员写的代码,虽说是放在服务器(linux)系统上的.但是很多时候,受JVM的影响,其实程序并没有发挥出服务器的最大性能.这时候,JVM就成为了瓶颈了.有瓶颈就 ...
Kubeasz部署K8s基础测试环境简介
下面介绍使用Kubeasz部署K8s集群环境. https://github.com/easzlab/kubeasz在需要使用kubeeasz项目安装的k8s时,需要将所有需要它来部署的节点上,都安装 ...
HDU图论题单
=============================以下是最小生成树+并查集====================================== [HDU] 1213 How Many ...
2018ECNA Difference[时空复杂度]
目录题干代码和解释题干代码和解释本题给出一个数列的第一个数A(1),要求找出m第一次出现(直接出现在数列中或是数列中某两项的差的绝对值)在这个数列的第几步中.数列递推公式:A(n+1)=A( ...
后台启动es head，关闭shell后es head自动关闭
后台启动head命令:grunt server & 注意:加上&虽然执行了后台启动,但还是有日志打印出来,使用ctrl+c可以退出.这时如果直接关闭shell, head进程就会终止 ...
ThinkPHP 5.1 跨域中间件
<?php namespace app\http\middleware; class CrossDomain { public function handle($request, \Closur ...

python抓取不得姐动图（报错 urllib.error.HTTPError: HTTP Error 403: Forbidden）

python抓取不得姐动图（报错 urllib.error.HTTPError: HTTP Error 403: Forbidden）的更多相关文章

随机推荐

热门专题