urllib模块提供的urlretrieve()函数使用

urllib模块提供的urlretrieve()函数,urlretrieve()方法直接将远程的数据下载到本地

注意：若是网站有反爬虫的话这个函数会返回 403 Forbidden

参数url:传入的网址，网址必须得是个字符串

参数filename:指定了保存本地路径（如果参数未指定，urllib会生成一个临时文件保存数据。)

参数reporthook:是一个回调函数，当连接上服务器、以及相应的数据块传输完毕时会触发该回调，我们可以利用这个回调函数来显示当前的下载进度。

参数data:指 post 到服务器的数据，该方法返回一个包含两个元素的(filename, headers)元组，filename 表示保存到本地的路径，header 表示服务器的响应头。

下面例子将表情包下载到本地

import requests

from lxml import etree

from urllib import request

import os

import re

def page(url):

    headers = {

        'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.100 Safari/537.36'

    }

    res = requests.get(url,headers=headers)

    text = res.text

    html = etree.HTML(text)

    imgs = html.xpath("//div[@class='tagbqppdiv']//img")

    for img in imgs:

        img_url = img.get('data-original')

        alt =img.get('alt')

        sufixx = os.path.splitext(img_url)[1]#切割文件后缀名

        alt = re.sub(r'[\?？\.。\！\!]',"",alt)

        filename = alt + sufixx

        request.urlretrieve(img_url,r"F:\pacong\hr class\xpath\images\\"+filename)

        # print(etree.tostring(img))

    # imgs = html.xpath("//div[@class='page-content text-center']//@href")#取出所有href里的链接

    #print(text)

def main():

    for i in range(1,101):

        url = 'https://www.fabiaoqing.com/biaoqing/lists/page/%d.html'%i

        page(url)

        break

if __name__ == '__main__':

    main()

运行结果：

urllib模块提供的urlretrieve()函数使用的更多相关文章

Python基础之 urllib模块urlopen()与urlretrieve()的使用方法详解。
Python urllib模块urlopen()与urlretrieve()的使用方法详解 1.urlopen()方法urllib.urlopen(url[, data[, proxies]]) ...
Python urllib模块urlopen()与urlretrieve()详解
1.urlopen()方法urllib.urlopen(url[, data[, proxies]]) :创建一个表示远程url的类文件对象,然后像本地文件一样操作这个类文件对象来获取远程数据.参数u ...
Python urllib的urlretrieve()函数解析 (显示下载进度)
#!/usr/bin/python #encoding:utf-8 import urllib import os def Schedule(a,b,c): ''''' a:已经下载的数据块 b:数据 ...
Python：urllib模块的urlretrieve方法
转于:https://blog.csdn.net/fengzhizi76506/article/details/59229846 博主:fengzhizi76506 1)功能: urllib模块提供的 ...
Python爬虫之urllib模块1
Python爬虫之urllib模块1 本文来自网友投稿.作者PG,一个待毕业待就业二流大学生.玄魂工作室未对该文章内容做任何改变. 因为本人一直对推理悬疑比较感兴趣,所以这次爬取的网站也是平时看一些悬 ...
Python urllib urlretrieve函数解析
Python urllib urlretrieve函数解析利用urllib.request.urlretrieve函数下载文件觉得有用的话,欢迎一起讨论相互学习~Follow Me 参考文献 Ur ...
Python核心模块——urllib模块
现在Python基本入门了,现在开始要进军如何写爬虫了! 先把最基本的urllib模块弄懂吧. urllib模块中的方法 1.urllib.urlopen(url[,data[,proxies]]) ...
python爬虫-urllib模块
urllib 模块是一个高级的 web 交流库,其核心功能就是模仿web浏览器等客户端,去请求相应的资源,并返回一个类文件对象.urllib 支持各种 web 协议,例如:HTTP.FTP.Gophe ...
[转]Python核心模块——urllib模块
现在Python基本入门了,现在开始要进军如何写爬虫了! 先把最基本的urllib模块弄懂吧. urllib模块中的方法 1.urllib.urlopen(url[,data[,proxies]]) ...

随机推荐

实例演示：如何在Kubernetes上大规模运行CI/CD
本周四晚上8:30,第二期k3s在线培训如约开播!本期课程将介绍k3s的核心架构,如高可用架构以及containerd.一起来进阶探索k3s吧! 报名及观看链接:http://z-mz.cn/PmwZ ...
c++利用初始化列表在类内部和类外部定义构造函数的区别
case 1:在类外定义构造函数,所有data member都在初始化列表中进行初始化. class SupportClass { public: SupportClass() { cout < ...
Optional类包含的方法介绍及其示例
Optional类的介绍 javadoc中的介绍这是一个可以为null的容器对象.如果值存在则isPresent()方法会返回true,调用get()方法会返回> 该对象. 使用场景用于避免 ...
php 截取字符串长度并把超出规定长度的内容用...替代
<?php header("content-type:text/html;charset=utf-8");#设置文件编码 error_reporting(E_ALL);#设置 ...
ELF文件之四——使用链接脚本-2个函数-data
main.c ; int main() { ; } int add() { ; } main.o 反汇编可以看到多了.text节的反汇编,存储的是全局变量的初始化数值 main.o对比,text段后面 ...
不重启清空tomcat日志
1.重定向方法清空文件 [root@localhost logs]# du -h catalina.out 查看文件大小17M catalina.out[root@localhost logs]# ...
[译]Android Studio 3.6 新特性概览
设计设计编辑器设计编辑器(比如布局编辑器和导航编辑器)现在提供了一个拆分视图模式,能够同时查看 UI 界面的 Design 视图和 Code 视图.拆分视图取代并改进了早期的预览窗口,并且可以对每 ...
StackExchange.Redis 之 Set集合类型示例
话不多说直接上代码: // set添加单个元素 stopwatch.Start(); "); stopwatch.Stop(); Console.WriteLine("set添加单 ...
[MongoDB] 使用PHP根据_id字段查询数据
mongo中的_id是一个objectid对象类型,不管是查询时作为条件,还是列表时展示内容,都需要进行一下抓换查询时要转为objectid对象列表时要把对象转成字符串覆盖回_id字段 $filt ...
现在连Linux都搞不懂，当初我要是这么学习操作系统就好了！
原创声明本文首发于微信公众号[程序员黄小斜] 本文作者:黄小斜转载请务必在文章开头注明出处和作者. 本文思维导图简介学习编程,操作系统是你必须要掌握的基础知识,那么操作系统到底是什么呢? 这还 ...

urllib模块提供的urlretrieve()函数使用

urllib模块提供的urlretrieve()函数使用的更多相关文章

随机推荐

热门专题