Python爬虫抓取图片（re模块处理正则表达式）

import os.path

import re

import requests

if __name__ == '__main__':

    # 如果不存在该文件夹则进行创建

    if not os.path.exists('./saimenshibo'):

        os.mkdir('./saimenshibo')

    url = 'https://www.symansbon.cn/product_ajax.aspx'

    header = {

        'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/106.0.0.0 Safari/537.36'

    }

    # 抓取前四页的图片数据

    for i in range(1, 5):

        param = {

            't': '10',

            'page': i,

            'pid': '27',

            '_': '1666084852813'

        }

        # 得到页面源码

        page = requests.get(url=url, params=param, headers=header).text

        # 正则匹配它的src () => 匹配括号内的表达式  .*? => 惰性匹配

        ex = '<li>.*?<figure>.*?<img src="(.*?)" alt.*?</li>'

        # 获取到图片所有的url地址

        img_list = re.findall(ex, page, re.S)

        for img in img_list:

            if not str(img).startswith('https:'):

                # 获取完整URL

                img_src = 'https://www.symansbon.cn/' + img

            else:

                img_src = img

            # 根据url下载图片 .content 获取二进制数据

            img_data = requests.get(url=img_src, headers=header).content

            # img_src='Uploadfiles/Picture/2022-8-5/2022851751539645.jpg' 取xxx.jpg作为图片名称

            img_name = str(img).split('/')[-1]

            # 拼接图片的保存路径

            img_url = './saimenshibo/' + img_name

            # 第一部获取的页面上只是获取了所有图片的url，需要根据指定的URL去二进制下载对应图片数据

            with open(img_url, 'wb') as fp:

                fp.write(img_data)

                print('下载成功')

    print('下载完成！')

补充关于python re模块中re.S, re.U, re.I, re.M, re.X

修饰符	描述
re.I	忽略大小写
re.L	做本地化识别（locale-aware）匹配
re.M	多行匹配，影响 ^ 和 $
re.S	即为 . 并且包括换行符在内的任意字符（. 不包括换行符）
re.U	根据Unicode字符集解析字符。这个标志影响 \w, \W, \b, \B
re.X	为了增加可读性，忽略空格和 # 后面的注释

Python爬虫抓取图片（re模块处理正则表达式）的更多相关文章

python 爬虫抓取心得
quanwei9958 转自 python 爬虫抓取心得分享 urllib.quote('要编码的字符串') 如果你要在url请求里面放入中文,对相应的中文进行编码的话,可以用: urllib.quo ...
python爬虫抓网页的总结
python爬虫抓网页的总结更多 python 爬虫学用python也有3个多月了,用得最多的还是各类爬虫脚本:写过抓代理本机验证的脚本,写过在discuz论坛中自动登录自动发贴的脚本,写过自 ...
Python爬虫与数据分析之模块：内置模块、开源模块、自定义模块
专栏目录: Python爬虫与数据分析之python教学视频.python源码分享,python Python爬虫与数据分析之基础教程:Python的语法.字典.元组.列表 Python爬虫与数据分析 ...
[python爬虫] 爬取图片无法打开或已损坏的简单探讨
本文主要针对python使用urlretrieve或urlopen下载百度.搜狗.googto(谷歌镜像)等图片时,出现"无法打开图片或已损坏"的问题,作者对它进行简单的探讨.同时 ...
Python爬虫----抓取豆瓣电影Top250
有了上次利用python爬虫抓取糗事百科的经验,这次自己动手写了个爬虫抓取豆瓣电影Top250的简要信息. 1.观察url 首先观察一下网址的结构 http://movie.douban.com/to ...
Python爬虫抓取东方财富网股票数据并实现MySQL数据库存储
Python爬虫可以说是好玩又好用了.现想利用Python爬取网页股票数据保存到本地csv数据文件中,同时想把股票数据保存到MySQL数据库中.需求有了,剩下的就是实现了. 在开始之前,保证已经安装好 ...
转载：用python爬虫抓站的一些技巧总结
原文链接:http://www.pythonclub.org/python-network-application/observer-spider 原文的名称虽然用了<用python爬虫抓站的一 ...
python爬虫—爬取英文名以及正则表达式的介绍
python爬虫—爬取英文名以及正则表达式的介绍爬取英文名: 一. 爬虫模块详细设计 (1)整体思路对于本次爬取英文名数据的爬虫实现,我的思路是先将A-Z所有英文名的连接爬取出来,保存在一个cs ...
用python爬虫抓站的一些技巧总结 zz
用python爬虫抓站的一些技巧总结 zz 学用python也有3个多月了,用得最多的还是各类爬虫脚本:写过抓代理本机验证的脚本,写过在discuz论坛中自动登录自动发贴的脚本,写过自动收邮件的脚本, ...
python爬虫抓站的一些技巧总结
使用python爬虫抓站的一些技巧总结:进阶篇一.gzip/deflate支持现在的网页普遍支持gzip压缩,这往往可以解决大量传输时间,以VeryCD的主页为例,未压缩版本247K,压缩了以后45 ...

随机推荐

nodejs 升级后， vue+webpack 项目 node-sass 报错的解决方法
1.npm i node-sass -D 在错误提示里有给出了方案,重新构建 node-sass,命令如下: npm rebuild node-sass --force 如果执行完成后不报错,就可以了 ...
网络通讯协议分类-IP地址
网络通讯协议分类通信的协议还是比较复杂的,java.net包中包含的类和接口,它们提供低层次的通信细节.我们可以直接使用这些类和接口,来专注于网络程序开发,而不用考虑通信的细节. java.net包 ...
记一次使用gdb诊断gc问题全过程
原创:扣钉日记(微信公众号ID:codelogs),欢迎分享,转载请保留出处. 简介上次解决了GC长耗时问题后,系统果然平稳了许多,这是之前的文章<GC耗时高,原因竟是服务流量小?> 然 ...
DNA
思路一: 这题需要桶+哈希(简化版像A 1 B 2 ......) 具体: 先把数据输入再枚举可能的右端点,再由右端点得到左端点(l和r相差k) 在 l到r 区间内将这一段区间哈希成一个4进制数 ...
axios设置全局headers
需求:每次请求的时候都设置token为headers非常不方便 axios提供配置全局headers 这里我主要使用的是加一个token验证 Global axios defaults axios. ...
搭个ChatGPT算法模型，离Java程序员有多远？
作者:小傅哥博客:https://bugstack.cn 沉淀.分享.成长,让自己和他人都能有所收获! 最近 ChatGPT 很火,火到了各行各业.记得去年更多的还是码农最新体验后拿它搜代码,现在各 ...
NoSQL(简介、历史）
NoSQL 为什么使用NoSQL 1.单机MySQL的网站 APP----->DAL------>MySQL 90年代:一个基本的网站访问量一般不会很大,单个数据库完全足够. 那个时候,更 ...
ClickHouse使用笔记
什么是ClickHouse? ClickHouse是一个用于联机分析(OLAP)的列式数据库管理系统(DBMS). 更多说明请参考官网:https://clickhouse.com/docs/zh/ ...
Ansible 快速入门到放弃
Ansible 快速入门到放弃最是人间留不住,朱颜辞镜花辞树. 1-Ansible 简介 Ansible是一个配置管理和配置工具,它使用SSH 连接到服务器并运行配置好的任务,服务器上只需要开启ss ...
JS 获取参数、封装
var common = { getQueryString : function(name){ var reg = new RegExp('(^|&)' + name + '=([^& ...

Python爬虫抓取图片（re模块处理正则表达式）

Python爬虫抓取图片（re模块处理正则表达式）的更多相关文章

随机推荐

热门专题