python 爬虫之requests爬取页面图片的url，并将图片下载到本地

大家好我叫hardy

需求：爬取某个页面，并把该页面的图片下载到本地

思考：

　　img标签一个有多少种类型的src值？四种：1、以http开头的网络链接。2、以“//”开头网络地址。3、以“/”开头绝对路径。4、以“./”开头相对路径。当然还有其他类型，不过这个不做考虑，能力有限呀。

　　使用什么工具？我用requests、xpth

　　都有那些步骤：1、爬取网页

　　　　　　　　　　2、分析html并获取img中的src的值

　　　　　　　　　　3、获取图片

　　　　　　　　　　4、保存

具体实现

import requests

from lxml import etree

import time

import os

import re

requests = requests.session()

website_url = ''

website_name = ''

'''

爬取的页面

'''

def html_url(url):

    try:

        head = set_headers()

        text = requests.get(url,headers=head)

        # print(text)

        html = etree.HTML(text.text)

        img = html.xpath('//img/@src')

        # 保存图片

        for src in img:

            src = auto_completion(src)

            file_path = save_image(src)

            if file_path == False:

                print('请求的图片路径出错，url地址为：%s'%src)

            else :

                print('保存图片的地址为：%s'%file_path)

    except requests.exceptions.ConnectionError as e:

        print('网络地址无法访问，请检查')

        print(e)

    except requests.exceptions.RequestException as e:

        print('访问异常：')

        print(e)

'''

保存图片

'''

def save_image(image_url):

    if not image_url:

        return False

    size =

    number =

    while size == :

        try:

            img_file = requests.get(image_url)

        except requests.exceptions.RequestException as e:

            raise e

        # 不是图片跳过

        if check_image(img_file.headers['Content-Type']):

            return False

        file_path = image_path(img_file.headers)

        # 保存

        with open(file_path, 'wb') as f:

            f.write(img_file.content)

        # 判断是否正确保存图片

        size = os.path.getsize(file_path)

        if size == :

            os.remove(file_path)

        # 如果该图片获取超过十次则跳过

        number +=

        if number >= :

            break

    return (file_path if (size > ) else False)

'''

自动完成url的补充

'''

def auto_completion(url):

    global website_name,website_url

    #如果是http://或者https://开头直接返回

    if re.match('http://|https://',url):

        return url

    elif re.match('//',url):

        if 'https://' in website_name:

            return 'https:'+url

        elif 'http://' in website_name:

            return 'http:' + url

    elif re.match('/',url):

        return website_name+url

    elif re.match('./',url):

        return website_url+url[::]

'''

图片保存的路径

'''

def image_path(header):

    # 文件夹

    file_dir = './save_image/'

    if not os.path.exists(file_dir):

        os.makedirs(file_dir)

    # 文件名

    file_name = str(time.time())

    # 文件后缀

    suffix = img_type(header)

    return file_dir + file_name + suffix

'''

获取图片后缀名

'''

def img_type(header):

    # 获取文件属性

    image_attr = header['Content-Type']

    pattern = 'image/([a-zA-Z]+)'

    suffix = re.findall(pattern,image_attr,re.IGNORECASE)

    if not suffix:

        suffix = 'png'

    else :

        suffix = suffix[]

    # 获取后缀

    if re.search('jpeg',suffix,re.IGNORECASE):

        suffix = 'jpg'

    return '.' + suffix

# 检查是否为图片类型

def check_image(content_type):

    if 'image' in content_type:

        return False

    else:

        return True

#设置头部

def set_headers():

    global website_name, website_url

    head = {

        'Host':website_name.split('//')[],

        'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/73.0.3683.103 Safari/537.36',

    }

    return head

if __name__ == '__main__':

    #当前的url，不包含文件名的比如index.html，用来下载当前页的页面图片(./)

    website_url = 'https://blog.csdn.net/kindroid/article/details'

    #域名，用来下载"/"开头的图片地址

    #感兴趣的朋友请帮我完善一下这个自动完成图片url的补充

    website_name = 'https://blog.csdn.net'

    url = 'https://blog.csdn.net/kindroid/article/details/52095833'

    html_url(url)

python 爬虫之requests爬取页面图片的url，并将图片下载到本地的更多相关文章

Python 爬虫入门之爬取妹子图
Python 爬虫入门之爬取妹子图来源:李英杰链接: https://segmentfault.com/a/1190000015798452 听说你写代码没动力?本文就给你动力,爬取妹子图.如果 ...
【转载】教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神
原文:教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神本博文将带领你从入门到精通爬虫框架Scrapy,最终具备爬取任何网页的数据的能力.本文以校花网为例进行爬取,校花网:http:/ ...
Python爬虫实例：爬取B站《工作细胞》短评——异步加载信息的爬取
很多网页的信息都是通过异步加载的,本文就举例讨论下此类网页的抓取. <工作细胞>最近比较火,bilibili 上目前的短评已经有17000多条. 先看分析下页面右边 li 标签中的就是短 ...
Python爬虫实战之爬取百度贴吧帖子
大家好,上次我们实验了爬取了糗事百科的段子,那么这次我们来尝试一下爬取百度贴吧的帖子.与上一篇不同的是,这次我们需要用到文件的相关操作. 本篇目标对百度贴吧的任意帖子进行抓取指定是否只抓取楼主发帖 ...
Python爬虫实例：爬取猫眼电影——破解字体反爬
字体反爬字体反爬也就是自定义字体反爬,通过调用自定义的字体文件来渲染网页中的文字,而网页中的文字不再是文字,而是相应的字体编码,通过复制或者简单的采集是无法采集到编码后的文字内容的. 现在貌似不少网 ...
Python爬虫实例：爬取豆瓣Top250
入门第一个爬虫一般都是爬这个,实在是太简单.用了 requests 和 bs4 库. 1.检查网页元素,提取所需要的信息并保存.这个用 bs4 就可以,前面的文章中已经有详细的用法阐述. 2.找到下一 ...
python爬虫-基础入门-爬取整个网站《2》
python爬虫-基础入门-爬取整个网站<2> 描述: 开场白已在<python爬虫-基础入门-爬取整个网站<1>>中描述过了,这里不在描述,只附上 python3 ...
python爬虫-基础入门-爬取整个网站《1》
python爬虫-基础入门-爬取整个网站<1> 描述: 使用环境:python2.7.15 ,开发工具:pycharm,现爬取一个网站页面(http://www.baidu.com)所有数 ...
Python爬虫教程-17-ajax爬取实例（豆瓣电影）
Python爬虫教程-17-ajax爬取实例(豆瓣电影) ajax: 简单的说,就是一段js代码,通过这段代码,可以让页面发送异步的请求,或者向服务器发送一个东西,即和服务器进行交互对于ajax: ...

随机推荐

poj1011 Sticks （dfs剪枝）
[题目描述] George took sticks of the same length and cut them randomly until all parts became at most 50 ...
如何将datetimepicker默认设置为空？
在Load中,初始化 this.dateTimePicker1.Format=DateTimePickerFormat.Custom; his.dateTimePicker1.CustomFormat ...
CSS文字，文本，背景，盒模型等记录
文字: font-family:" "; /*设置字体*/ font-size:6px;/*设置文字字号*/ color:red;/*设置文字颜色*/ font-weight:bo ...
行人重识别(ReID) ——技术实现及应用场景
导读跨镜追踪(Person Re-Identification,简称 ReID)技术是现在计算机视觉研究的热门方向,主要解决跨摄像头跨场景下行人的识别与检索.该技术能够根据行人的穿着.体态.发型等信 ...
行人重识别(ReID) ——数据集描述 CUHK03
数据集简介 CUHK03是第一个足以进行深度学习的大规模行人重识别数据集,该数据集的图像采集于香港中文大学(CUHK)校园.数据以"cuhk-03.mat"的 MAT 文件格式存储 ...
[sqlmap源码阅读] 数据库识别
通过网页返回的数据库错误信息识别网站所有数据库类型,用到的正则表达式及支持识别的数据库类型,这些信息以xml文件的形式存在,使用 sax 解析xml.
【串线篇】spring boot全面接管springMvc
一.Spring MVC auto-conﬁguration Spring Boot 自动配置好了SpringMVC 以下是SpringBoot对SpringMVC的默认配置:(WebMvcAutoC ...
python 小工具重命名当前文件夹内所有的文件，升序命名
背景:一个朋友想升序重命名他的照片,但是太多了不想手动所以,emememem os这个模块,不用说,rename,filedir等 #conding=utf8 import os path = os. ...
【leetcode】1051. Height Checker
题目如下: Students are asked to stand in non-decreasing order of heights for an annual photo. Return the ...
项目部署到tomcat上
1:先讲解一下tomcat的各个目录的作用 2:将项目打包成war的格式,然后放到webapps chengtai 是启动项目的时候自动解压的,不需要我们手动解压. 3:启动tomcat 进入到b ...

python 爬虫之requests爬取页面图片的url，并将图片下载到本地

python 爬虫之requests爬取页面图片的url，并将图片下载到本地的更多相关文章

随机推荐

热门专题