python网络爬虫数据解析之正则

本节内容，讲解爬取网络图片，利用正则匹配图片地址

请求网页之后，响应部分内容如下图：

 1 时间：2023/1/7 10:42

 2 功能描述

 3 1.进行指定标签的定位

 4 2.标签或者标签对应的属性中存储的数据值进行提取（解析）

 5 获取图片地址并下载

 6

 7

 8 编码流程

 9 1.指定url

10 2.发起请求

11 3，数据解析

12 4.持久化存储

13

14 '''

15 import requests

16 import re   # 导入正则模块

17 import os   # 创建文件夹的时候使用

18 # 创建一个文件夹来保存下载的图片

19 if not os.path.exists('我的图片'):

20     os.mkdir('我的图片')

21 path = '我的图片'

22

23 url = 'https://www.7nua.com/nua/2022051081813.html'

24 headers= {'user-agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/108.0.0.0 Safari/537.36'}

25 # 发送请求并获取响应数据，响应数据是一个html文件

26 url_text = requests.get(url, headers=headers).text

27 # 正则匹配,需要保留的匹配数据，要用（）括起来。

28 # 正则表达式要用一对单引号括起来

29 r = '<p><img src="(.*?)">'

30 # 调用正则方法findall（），第一个参数为正则表达式，第二次参数为应用的数据源，第三个参数re.S表示多行匹配，re.M表示单行匹配，一般都写多行匹配

31 # 其返回值是一个列表,主要，这里返回的是相对地址，还有自己补完整

32 lis = re.findall(r, url_text, re.S)

33 # print(lis)

34 # 我们可以复制一下图片地址，看看其完整地址是什么，好补充

35 for src in lis:

36     src = '    https://www.7nua.com'+src

37     # 请求到了图片的二进制数据,所以用content，而不用text

38     img_data = requests.get(url=src, headers=headers).content

39     # 生成图片名称，用切片函数split(),第一个参数表示以‘/'为切割符，切割好之后，取这个列表的最后一个元素，用-1

40     # 对图片地址字符串src，调用切片函数split

41     img_name = src.split('/')[-1]

42     # 保存图片

43     with open('{}/{}'.format(path,img_name), 'wb')as fp:

44         fp.write(img_data)

45         print(img_name, '下载成功!!')

46     print('所以图片下载完成！')

python网络爬虫数据解析之正则的更多相关文章

Python网络爬虫数据解析的三种方式
request实现数据爬取的流程: 指定url 基于request发起请求获取响应的数据数据解析持久化存储 1.正则解析: 常用的正则回顾:https://www.cnblogs.com/wqz ...
python网络爬虫之解析网页的BeautifulSoup(爬取电影图片)[三]
目录前言一.BeautifulSoup的基本语法二.爬取网页图片扩展学习后记前言本章同样是解析一个网页的结构信息在上章内容中(python网络爬虫之解析网页的正则表达式(爬取4k动漫图 ...
python网络爬虫之解析网页的正则表达式(爬取4k动漫图片)[三]
前言 hello,大家好本章可是一个重中之重,因为我们今天是要爬取一个图片而不是一个网页或是一个json 所以我们也就不用用到selenium模块了,当然有兴趣的同学也一样可以使用selenium去 ...
070.Python聚焦爬虫数据解析
一聚焦爬虫数据解析 1.1 基本介绍聚焦爬虫的编码流程指定url 基于requests模块发起请求获取响应对象中的数据数据解析进行持久化存储如何实现数据解析三种数据解析方式正则表达式 ...
python网络爬虫数据中的三种数据解析方式
一.正则解析常用正则表达式回顾: 单字符: . : 除换行以外所有字符 [] :[aoe] [a-w] 匹配集合中任意一个字符 \d :数字 [0-9] \D : 非数字 \w :数字.字母.下划线 ...
python网络爬虫之解析网页的XPath(爬取Path职位信息)[三]
目录前言 XPath的使用方法 XPath爬取数据后言 @(目录) 前言本章同样是解析网页,不过使用的解析技术为XPath. 相对于之前的BeautifulSoup,我感觉还行,也是一个比较常用 ...
python网络爬虫-数据储存（七）
数据储存主要介绍两种数据储存方法: 储存在文件中,包括text文件和csv文件存储在数据库中,包括MySQL关系型数据库和mongoDB数据库存储到txt title = "第一个文本 ...
05 Python网络爬虫的数据解析方式
一.爬虫数据解析的流程 1.指定url 2.基于requests模块发起请求 3.获取响应中的数据 4.数据解析 5.进行持久化存储二.解析方法 (1)正则解析 (2)bs4解析 (3)xpath解 ...
python爬虫--数据解析
数据解析什么是数据解析及作用概念:就是将一组数据中的局部数据进行提取作用:来实现聚焦爬虫数据解析的通用原理标签定位取文本或者属性正则解析正则回顾单字符: . : 除换行以外所有字符 ...
《精通python网络爬虫》笔记
<精通python网络爬虫>韦玮著目录结构第一章什么是网络爬虫第二章爬虫技能概览第三章爬虫实现原理与实现技术第四章 Urllib库与URLError异常处理第五章正则 ...

随机推荐

Sqoop 之安装
Sqoop 之安装前言安装 Sqoop 的前提是已经具备 Java 和 Hadoop 的环境. 一.下载并解压 1) 下载地址:http://mirrors.hust.edu.cn/apache ...
JUC（5）BlockingQueue四组API
1.读写锁ReadWriteLock package com.readlock; import java.util.HashMap; import java.util.Map; /** * ReadW ...
齐博x2自建流媒体RTMP直播服务器
这里只讲解大家最容易配置的Windows版,测试环境是2008版服务器及WIN7下载下面的软件,解压在任何目录都可,然后双击"启动.bat"即可http://down.php168 ...
Dubbo-聊聊注册中心的设计
前言 Dubbo源码阅读分享系列文章,欢迎大家关注点赞 SPI实现部分 Dubbo-SPI机制 Dubbo-Adaptive实现原理 Dubbo-Activate实现原理 Dubbo SPI-Wrap ...
【高并发】深度解析ScheduledThreadPoolExecutor类的源代码
在[高并发专题]的专栏中,我们深度分析了ThreadPoolExecutor类的源代码,而ScheduledThreadPoolExecutor类是ThreadPoolExecutor类的子类.今天我 ...
知识图谱顶会论文(ACL-2022) ACL-SimKGC：基于PLM的简单对比KGC
12.(2022.5.4)ACL-SimKGC:基于PLM的简单对比KGC 12.(2022.5.4)ACL-SimKGC:基于PLM的简单对比KGC 摘要 1.引言 2.相关工作 2.1 知识图补全 ...
一个实用的 vite + vue3 组件库脚手架工具，提升开发效率
无论是 vue2 全家桶还是 vue3 + vite + TypeScript,组件库的使用几乎大家都会,但自己开发一个独立组件库就不是每个人都掌握的,因为搭建组件库的基础开发环境,就会让很多同学望而 ...
畅联新接入物联设备的情况：丰宝智慧消防领域的 NB水压一体机、智能消防栓、NB液位一体机
我看了一下,似乎三种完全不同的协议额...应该是电信AEP平台,由双美接入. ------------------------------------------------------------- ...
docker构建容器时容器内使用代理
build 容器时使用代理 demo1 使用前指定 env 使用后记得清空, 否则会影响使用容器时的网络 cat dockerfile --> FROM jenkins/jenk ...
Linux Framebuffer 实验
一.准备 linux虚拟机或ARM开发板 Ubuntu18.04 二.Framebuffer介绍次笔记主要的目的是实验,所以我不介绍了,有需要的小伙伴可以去看下面博客 Linux LCD Framb ...

python网络爬虫数据解析之正则

python网络爬虫数据解析之正则的更多相关文章

随机推荐

热门专题