大家好我叫hardy

需求:爬取某个页面,并把该页面的图片下载到本地

思考:

  img标签一个有多少种类型的src值?四种:1、以http开头的网络链接。2、以“//”开头网络地址。3、以“/”开头绝对路径。4、以“./”开头相对路径。当然还有其他类型,不过这个不做考虑,能力有限呀。

  使用什么工具?我用requests、xpth

  都有那些步骤:1、爬取网页

          2、分析html并获取img中的src的值

          3、获取图片

          4、保存

具体实现

import requests
from lxml import etree
import time
import os
import re requests = requests.session() website_url = ''
website_name = '' '''
爬取的页面
'''
def html_url(url):
try:
head = set_headers()
text = requests.get(url,headers=head)
# print(text)
html = etree.HTML(text.text)
img = html.xpath('//img/@src')
# 保存图片
for src in img:
src = auto_completion(src)
file_path = save_image(src)
if file_path == False:
print('请求的图片路径出错,url地址为:%s'%src)
else :
print('保存图片的地址为:%s'%file_path)
except requests.exceptions.ConnectionError as e:
print('网络地址无法访问,请检查')
print(e)
except requests.exceptions.RequestException as e:
print('访问异常:')
print(e) '''
保存图片
'''
def save_image(image_url):
if not image_url:
return False
size =
number =
while size == :
try:
img_file = requests.get(image_url)
except requests.exceptions.RequestException as e:
raise e # 不是图片跳过
if check_image(img_file.headers['Content-Type']):
return False
file_path = image_path(img_file.headers)
# 保存
with open(file_path, 'wb') as f:
f.write(img_file.content)
# 判断是否正确保存图片
size = os.path.getsize(file_path)
if size == :
os.remove(file_path)
# 如果该图片获取超过十次则跳过
number +=
if number >= :
break
return (file_path if (size > ) else False) '''
自动完成url的补充
'''
def auto_completion(url):
global website_name,website_url
#如果是http://或者https://开头直接返回
if re.match('http://|https://',url):
return url
elif re.match('//',url):
if 'https://' in website_name:
return 'https:'+url
elif 'http://' in website_name:
return 'http:' + url
elif re.match('/',url):
return website_name+url
elif re.match('./',url):
return website_url+url[::] '''
图片保存的路径
'''
def image_path(header):
# 文件夹
file_dir = './save_image/'
if not os.path.exists(file_dir):
os.makedirs(file_dir)
# 文件名
file_name = str(time.time())
# 文件后缀
suffix = img_type(header) return file_dir + file_name + suffix '''
获取图片后缀名
'''
def img_type(header):
# 获取文件属性
image_attr = header['Content-Type']
pattern = 'image/([a-zA-Z]+)'
suffix = re.findall(pattern,image_attr,re.IGNORECASE)
if not suffix:
suffix = 'png'
else :
suffix = suffix[]
# 获取后缀
if re.search('jpeg',suffix,re.IGNORECASE):
suffix = 'jpg'
return '.' + suffix # 检查是否为图片类型
def check_image(content_type):
if 'image' in content_type:
return False
else:
return True
#设置头部
def set_headers():
global website_name, website_url
head = {
'Host':website_name.split('//')[],
'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/73.0.3683.103 Safari/537.36',
}
return head if __name__ == '__main__': #当前的url,不包含文件名的比如index.html,用来下载当前页的页面图片(./)
website_url = 'https://blog.csdn.net/kindroid/article/details'
#域名,用来下载"/"开头的图片地址
#感兴趣的朋友请帮我完善一下这个自动完成图片url的补充
website_name = 'https://blog.csdn.net'
url = 'https://blog.csdn.net/kindroid/article/details/52095833'
html_url(url)

python 爬虫之requests爬取页面图片的url,并将图片下载到本地的更多相关文章

  1. Python 爬虫入门之爬取妹子图

    Python 爬虫入门之爬取妹子图 来源:李英杰  链接: https://segmentfault.com/a/1190000015798452 听说你写代码没动力?本文就给你动力,爬取妹子图.如果 ...

  2. 【转载】教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神

    原文:教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神 本博文将带领你从入门到精通爬虫框架Scrapy,最终具备爬取任何网页的数据的能力.本文以校花网为例进行爬取,校花网:http:/ ...

  3. Python爬虫实例:爬取B站《工作细胞》短评——异步加载信息的爬取

    很多网页的信息都是通过异步加载的,本文就举例讨论下此类网页的抓取. <工作细胞>最近比较火,bilibili 上目前的短评已经有17000多条. 先看分析下页面 右边 li 标签中的就是短 ...

  4. Python爬虫实战之爬取百度贴吧帖子

    大家好,上次我们实验了爬取了糗事百科的段子,那么这次我们来尝试一下爬取百度贴吧的帖子.与上一篇不同的是,这次我们需要用到文件的相关操作. 本篇目标 对百度贴吧的任意帖子进行抓取 指定是否只抓取楼主发帖 ...

  5. Python爬虫实例:爬取猫眼电影——破解字体反爬

    字体反爬 字体反爬也就是自定义字体反爬,通过调用自定义的字体文件来渲染网页中的文字,而网页中的文字不再是文字,而是相应的字体编码,通过复制或者简单的采集是无法采集到编码后的文字内容的. 现在貌似不少网 ...

  6. Python爬虫实例:爬取豆瓣Top250

    入门第一个爬虫一般都是爬这个,实在是太简单.用了 requests 和 bs4 库. 1.检查网页元素,提取所需要的信息并保存.这个用 bs4 就可以,前面的文章中已经有详细的用法阐述. 2.找到下一 ...

  7. python爬虫-基础入门-爬取整个网站《2》

    python爬虫-基础入门-爬取整个网站<2> 描述: 开场白已在<python爬虫-基础入门-爬取整个网站<1>>中描述过了,这里不在描述,只附上 python3 ...

  8. python爬虫-基础入门-爬取整个网站《1》

    python爬虫-基础入门-爬取整个网站<1> 描述: 使用环境:python2.7.15 ,开发工具:pycharm,现爬取一个网站页面(http://www.baidu.com)所有数 ...

  9. Python爬虫教程-17-ajax爬取实例(豆瓣电影)

    Python爬虫教程-17-ajax爬取实例(豆瓣电影) ajax: 简单的说,就是一段js代码,通过这段代码,可以让页面发送异步的请求,或者向服务器发送一个东西,即和服务器进行交互 对于ajax: ...

随机推荐

  1. 开发一个 Parcel-vue 脚手架工具

    前言 像我们熟悉的 vue-cli,create-react-app 等脚手架,只需要输入简单的命令 vue init webpack project,即可快速帮我们生成一个初始项目.在实际工作中,我 ...

  2. 埃及分数问题(带乐观估计函数的迭代加深搜索算法-IDA*)

    #10022. 「一本通 1.3 练习 1」埃及分数 [题目描述] 在古埃及,人们使用单位分数的和(形如 $\dfrac{1}{a}​$​​ 的,$a$ 是自然数)表示一切有理数.如:$\dfrac{ ...

  3. Aurora测试----随机数字产生

    在xilinx模板中,存在一个Aurora样本工程,包含众多的子函数,本系列本文将逐一对其进行解析,首先是aurora_8b10b_0_FRAME_GEN函数,根据官方的说明,其作用是:该模块是一个模 ...

  4. id 和 name 区别

    在html中:name指的是用户名称,ID指的是用户注册是系统自动分配给用户的一个序列号. name是用来提交数据的,提供给表单用,可以重复: id则针对文档操作时候用,不能重复.如:document ...

  5. Maven 集成Tomcat插件(引用)

    Maven已经是Java的项目管理标配,如何在JavaEE开发使用Maven调用Web应用,是很多同学关心的问题.本文将介绍,Maven如何介绍Tomcat插件. Maven Tomcat插件现在主要 ...

  6. Java虚拟机——类加载机制

    转自:http://blog.csdn.net/ns_code/article/details/17881581 类加载过程 类从被加载到虚拟机内存中开始,到卸载出内存为止,它的整个生命周期包括:加载 ...

  7. HTML表单(来自MDN的总结)

    表单介绍 HTML表单是用户和web站点或应用程序之间交互的主要内容之一.它们允许用户将数据发送到web站点.大多数情况下,数据被发送到web服务器,但是web页面也可以拦截它自己并使用它. HTML ...

  8. django之静态文件的设置

    一:静态文件 Django中提供了一种解析的方式配置静态文件路径.静态文件可以放在项目根目录下,也可以放在应用的目录下,由于有些静态文件在项目中是通用的,所以推荐放在项目的根目录下,方便管理. 为了提 ...

  9. Cluster基础(三):配置HAProxy负载平衡集群、Keepalived高可用服务器、Keepalived+LVS服务器

    一.配置HAProxy负载平衡集群 目标: 准备三台Linux服务器,两台做Web服务器,一台安装HAProxy,实现如下功能: 客户端访问HAProxy,HAProxy分发请求到后端Real Ser ...

  10. js不区分大小写匹配并代码高亮,且不改变原来文本大小写格式

    //高亮字符串 string: 需要处理的字符串,keyword:键盘输入的内容 function heightLight(string, keyword) { var reg = new RegEx ...