urllib2爬取图片成功之后不能打开

经过8个小时的摸索，终于决定写下此随笔！

初学爬虫，准备爬取百度美女吧的图片，爬取图片之后发现打不开，上代码：

import urllib

import urllib2

from lxml import etree

def loadPage(url):

    """

        作用:根据url发送请求，获取响应文件

        url:需要爬取的url地址

    """

    print('正在下载' )

    ua_headers = {

        "User-Agent": "Mozilla/5.0 (compatible; MSIE 10.0; Windows NT 6.1; Trident/6.0)"

    }

    request = urllib2.Request(url, headers= ua_headers)

    html = urllib2.urlopen(request).read()

    # print html

    content = etree.HTML(html)

    link_list = content.xpath('//div[@class="t_con cleafix"]/div[2]/div[1]/div[1]/a/@href')

    for link in link_list:

        fulurl = 'http://tieba.baidu.com' + link

        loadImage(fulurl)

def loadImage(url):

    print '正在下载图片'

    ua_headers = {

        "User-Agent": "Mozilla/5.0 (compatible; MSIE 10.0; Windows NT 6.1; Trident/6.0)"

    }

    request = urllib2.Request(url, headers=ua_headers)

    html = urllib2.urlopen(request).read()

    content = etree.HTML(html)

    link_list = content.xpath('//img[@class="BDE_Image"]/@src')

    for link in link_list:

        print(link)

        writeImage(link)

def writeImage(url):

    """

        作用：将HTML内容写入到本地

        html：服务器响应文件内容

    """

    ua_headers = {

        'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) \

    AppleWebKit/537.36 (KHTML, like Gecko) \

        Chrome/35.0.1916.114 Safari/537.36',

    'Cookie': 'AspxAutoDetectCookieSupport=1'

    }

    request = urllib2.Request(url,headers = ua_headers)

    response =urllib2.urlopen(request)

    image = response.read()

    filename = url[-10:]

    print('正在保存' + filename)

    # print image

    with open(filename, "wb") as f:

        f.write(image)

    print(filename + '已保存')

def tiebaSpider(url, beginPage, endPage):

    """

        作用：贴吧爬虫调度器。负责组合处理每个页面的url

        url：贴吧url的前部分

        beginPage：起始页

        endPage：结束页

    """

    for page in range(beginPage, endPage + 1):

        pn = (page - 1) * 50

        fulurl = url + "&pn=" + str(pn)

        loadPage(fulurl)

        print('谢谢使用！')

if __name__ == '__main__':

    kw = raw_input('请输入需要爬取的贴吧名：')

    beginPage = int(raw_input('请输入起始页：'))

    endPage = int(raw_input('请输入结束页：'))

    url = 'http://tieba.baidu.com/f?'

    key = urllib.urlencode({"kw": kw})

    fulurl = url + key

    tiebaSpider(fulurl,beginPage,endPage)

后来发现是writeImage()的参数跟函数体中调用的参数不一致导致的，

 def writeImage(link):

     """

         作用：将HTML内容写入到本地

         html：服务器响应文件内容

     """

     ua_headers = {

         'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) \

     AppleWebKit/537.36 (KHTML, like Gecko) \

         Chrome/35.0.1916.114 Safari/537.36',

     'Cookie': 'AspxAutoDetectCookieSupport=1'

     }

     request = urllib2.Request(url,headers = ua_headers)

     response =urllib2.urlopen(request)

     image = response.read()

     filename = url[-10:]

     print('正在保存' + filename)

     # print image

     with open(filename, "wb") as f:

         f.write(image)

     print(filename + '已保存')

将参数改成跟函数体内一致后，爬取的图片总算可以正常查看了！下面看看成果吧：

urllib2爬取图片成功之后不能打开的更多相关文章

[python爬虫] 爬取图片无法打开或已损坏的简单探讨
本文主要针对python使用urlretrieve或urlopen下载百度.搜狗.googto(谷歌镜像)等图片时,出现"无法打开图片或已损坏"的问题,作者对它进行简单的探讨.同时 ...
Python 爬虫爬取图片入门
爬虫网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动的抓取万维网信息的程序或者脚本. 用户看到的网页实质是由 HTML 代码构成的,爬 ...
C# 爬取图片
网络收集整理爬取图片引用AngleSharp NuGet 包 using AngleSharp; using System; using System.Collections.Generic; ...
Java jsoup爬取图片
jsoup爬取百度瀑布流图片是的,Java也可以做网络爬虫,不仅可以爬静态网页的图片,也可以爬动态网页的图片,比如采用Ajax技术进行异步加载的百度瀑布流. 以前有写过用Java进行百度图片的抓取, ...
scrapy爬虫，爬取图片
一.scrapy的安装: 本文基于Anacoda3, Anacoda2和3如何同时安装? 将Anacoda3安装在C:\ProgramData\Anaconda2\envs文件夹中即可. 如何用con ...
孤荷凌寒自学python第八十二天学习爬取图片2
孤荷凌寒自学python第八十二天学习爬取图片2 (完整学习过程屏幕记录视频地址在文末) 今天在昨天基本尝试成功的基础上,继续完善了文字和图片的同时爬取并存放在word文档中. 一.我准备爬取一个有文 ...
python网络爬虫之使用scrapy爬取图片
在前面的章节中都介绍了scrapy如何爬取网页数据,今天介绍下如何爬取图片. 下载图片需要用到ImagesPipeline这个类,首先介绍下工作流程: 1 首先需要在一个爬虫中,获取到图片的url并存 ...
使用Scrapy爬取图片入库,并保存在本地
使用Scrapy爬取图片入库,并保存在本地上篇博客已经简单的介绍了爬取数据流程,现在让我们继续学习scrapy 目标: 爬取爱卡汽车标题,价格以及图片存入数据库,并存图到本地好了不多说,让我们实 ...
scrapy 爬取图片
scrapy 爬取图片 1.scrapy 有下载图片的自带接口,不用我们在去实现 setting.py设置 # 保存log信息的文件名 LOG_LEVEL = "INFO" # L ...

随机推荐

python第一课--基础知识
python简介 Python是一种计算机程序设计语言.是一种面向对象的动态类型语言,最初被设计用于编写自动化脚本(shell),随着版本的不断更新和语言新功能的添加,越来越多被用于独立的.大型项目的 ...
帝国CMS(EmpireCMS) v7.5后台任意代码执行
帝国CMS(EmpireCMS) v7.5后台任意代码执行一.漏洞描述 EmpireCMS 7.5版本及之前版本在后台备份数据库时,未对数据库表名做验证,通过修改数据库表名可以实现任意代码执行. 二 ...
循环与分支语句和字符函数库cctype 文件简单处理
循环 for循环 while循环 do while循环通常,入口条件循环比出口条件循环好,因为循环开始前对条件进行检查 c++11基于范围的for循环对数组(或容器类,如:vector和a ...
合并多个jar包，并通过私服依赖
背景:许多jar包在maven仓库中没有,项目如果添加了许多的本地jar包,别人拿到代码也无法编译需求:将本地jar包上传至私服并设置依赖,如果jar包较多,但都从属于同一功能,需要合并为一个jar ...
Python之变量、常量以及注释
Python之变量.常量以及注释一.什么是变量变量,是用于在内存中存放程序数据的容器,怎么理解呢? 计算机的最核心的功能j就是"计算",计算需要数据源,数据源存在在内存里,比如 ...
矩阵微分与向量函数Taylor展开
参考博客:https://blog.csdn.net/a_big_pig/article/details/78994033
Linux Capabilities 简介
为了执行权限检查,Linux 区分两类进程:特权进程(其有效用户标识为 0,也就是超级用户 root)和非特权进程(其有效用户标识为非零). 特权进程绕过所有内核权限检查,而非特权进程则根据进程凭证( ...
Redis学习总结(四)--Redis主从配置
在分布式系统架构设计中高可用是必须考虑的因素之一.高可用通常是指,通过设计减少系统不能提供服务的时间.而单点是系统高可用的最大的败笔,如果单点出现问题的话,那么整个服务就不能使用了,所以应该尽量在系统 ...
JS函数提升和变量提升
1.1什么是函数提升和变量的提升? JS引擎在运行整个JS代码的过程中,分为俩步. 第一步是读取和解析JS代码,第二部是执行. 在引擎解析JS代码的时候,当解析器遇见变量声明(var 变量名)和函数声 ...
spss分析存在共性线后，接下来是怎么分析？
在进行线性回归分析时,容易出现自变量(解释变量)之间彼此相关,这种情况被称作多重共线性问题. 适度的多重共线性不成问题,但当出现严重共线性问题时,可能导致分析结果不稳定,出现回归系数的符号与实际情况完 ...

urllib2爬取图片成功之后不能打开

urllib2爬取图片成功之后不能打开的更多相关文章

随机推荐

热门专题