python 爬取淘宝的模特照片

前段时间花了一部分时间学习下正则表达式，总觉得利用正则要做点什么事情，所以想通过爬取页面的方式把一些美女的照片保存下来，其实过程很简单。

1.首先读取页面信息；

2.过滤出来照片的url地址；

3.通过URL地址来保存图片；

#-*-coding:utf-8 -*-

'''爬取评论区的美女照片'''

import requests

import re

RE_PICTURE_NAME = re.compile(r'(\w)+\.[A-Za-z]+$')

RE_URL = re.compile(r'(\w)+\.(\w)+\.(\w)+/(\w)+\/(\w){2,}\/(\w)+.jpg')

request_top_list = requests.get('https://mm.taobao.com/json/request_top_list.htm')

RESPONSE = request_top_list.text #resp.text返回的是Unicode型的数据

def Get_Reuest_Picture_List(RESPONSE):

    '''抓取页面的所有URL'''

    URLS = []

    for match in RE_URL.finditer(RESPONSE): #所有与pattern相匹配的全部字串，以迭代器的形式返回 与findall的区别,findall在字符串中找到正则表达式所匹配的所有子串，并组成一个列表返回

        URL = match.group()

        URLS.append('http://'+URL)

    return URLS

def Download_Url_Picture(URL):

    '''下载图片'''

    REQUEST_CONTENT = requests.get(URL).content #resp.content返回的是bytes型也就是二进制的数据

    PICTURE_NAME = RE_PICTURE_NAME.search(URL).group(0) #根据url获取图片名字

    FILE_OBJECT = open(str(PICTURE_NAME),'wb') #以二进制的方式写文件

    FILE_OBJECT.write('picture\\'+REQUEST_CONTENT)

    FILE_OBJECT.close()

def Save_All_Picture(URLS):

    '''保存所有请求中的图片'''

    for URL in URLS:

        Download_Url_Picture(URL)

if __name__ == '__main__':

    URLS = Get_Reuest_Picture_List(RESPONSE)

    Save_All_Picture(URLS)

python 爬取淘宝的模特照片的更多相关文章

Python 爬取淘宝商品数据挖掘分析实战
Python 爬取淘宝商品数据挖掘分析实战项目内容本案例选择>> 商品类目:沙发: 数量:共100页 4400个商品: 筛选条件:天猫.销量从高到低.价格500元以上. 爬取淘宝商品 ...
使用Python爬取淘宝两千款套套
各位同学们,好久没写原创技术文章了,最近有些忙,所以进度很慢,给大家道个歉. 警告:本教程仅用作学习交流,请勿用作商业盈利,违者后果自负!如本文有侵犯任何组织集团公司的隐私或利益,请告知联系猪哥删除! ...
甜咸粽子党大战，Python爬取淘宝上的粽子数据并进行分析
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 爬虫爬取淘宝数据,本次采用的方法是:Selenium控制Chrome浏览 ...
Python爬取淘宝店铺和评论
1 安装开发需要的一些库 (1) 安装mysql 的驱动:在Windows上按win+r输入cmd打开命令行,输入命令pip install pymysql,回车即可. (2) 安装自动化测试的驱动s ...
【Python爬虫案例学习】Python爬取淘宝店铺和评论
安装开发需要的一些库 (1) 安装mysql 的驱动:在Windows上按win+r输入cmd打开命令行,输入命令pip install pymysql,回车即可. (2) 安装自动化测试的驱动sel ...
一篇文章教会你用Python爬取淘宝评论数据（写在记事本）
[一.项目简介] 本文主要目标是采集淘宝的评价,找出客户所需要的功能.统计客户评价上面夸哪个功能多,比如防水,容量大,好看等等. 很多人学习python,不知道从何学起.很多人学习python,掌握了 ...
【Python爬虫案例学习】python爬取淘宝里的手机报价并以价格排序
第一步: 先分析这个url,"?"后面的都是它的关键字,requests中get函数的关键字的参数是params,post函数的关键字参数是data, 关键字用字典的形式传进去,这 ...
python爬取淘宝排名
import timeimport jsonimport requestsimport xlrdimport randomimport os from xlutils.copy import copy ...
Python 爬取淘宝商品信息和相应价格
!只用于学习用途! plt = re.findall(r'\"view_price\"\:\"[\d\.]*\"',html) :获得商品价格和view_pri ...

随机推荐

linux命令之查看字符集
lucifer@abc:~$ locale -a 查看本地字符集lucifer@abc:~$ locale -m 查看所有支持的字符集将文件从gb2312转为utf8iconv -f gb2312 - ...
GDOI2014模拟pty爬山（mountain）
pty爬山(mountain) 在Pty学校附近,有一座名之为岳之麓的高山.Pty很喜欢和(哔--)一起爬山.山的平面模型如下:山由一个顶点集:A1,A2-An给定,保证Ai的x单调递增.我们将Ai和 ...
tomcat配置管理员-走后门
在Tomcat中,应用程序的部署很简单,只需将你的WAR放到Tomcat的webapp目录下,Tomcat会自动检测到这个文件,并将其解压.在浏览器中访问这个应用的Jsp时,通常第一次会很慢,因为To ...
老李推荐：第14章7节《MonkeyRunner源码剖析》 HierarchyViewer实现原理-装备ViewServer-获取版本号 2
代码先是发送”LIST”命令到ViewServer列出所有的打开的窗口,然后把每个窗口都保存起来.342行起按照源码的注释解析就是说:从协议版本3以后开始加入了窗口自动更新的功能,但是在此之前,如果用 ...
手机自动化测试：Appium源码分析之跟踪代码分析六
手机自动化测试:Appium源码分析之跟踪代码分析六 poptest是国内唯一一家培养测试开发工程师的培训机构,以学员能胜任自动化测试,性能测试,测试工具开发等工作为目标.poptest推出手机自 ...
老李推荐：第1章2节《MonkeyRunner源码剖析》概述:边界
老李推荐:第1章2节<MonkeyRunner源码剖析>概述:边界边界怎么样才算分析清楚一个事物的原理是什么呢?就以前面提到的<LINUX内核源代码情景分析>为例子,分 ...
webService请求方式快速生成代码 (Postman)
Postman 这个东西只能在外网下载,是Goole一个插件. 1.FQ到外网,这里就不具体介绍怎么FQ了 2.上到谷歌浏览器,找到更过工具--->扩张程序--->获取更多扩张程序 3.在 ...
用 config drive 配置网络 - 每天5分钟玩转 OpenStack（173）
上一节最后问了大家一个问题:如果 subnet 没有开 DHCP,会是怎样一个情况? 在其他条件不变的情况下,cloud-init 依然会完成那 3 个步骤,也就是说网卡还是会被配置成 dhcp 模式 ...
我的iOS-App
1.PocketConfidential(密保箱) 简介保存账号密码等敏感信息. 应用技术: sqlite.sqlcipher加密.AES数据加密.GCD https://itunes.apple. ...
jsp的开发模式
JSP 存在两种开发模式1.Model1 : JSP + JavaBean * 不适合开发业务逻辑特别复杂web应用 ----- 业务逻辑复杂,控制代码多,而在jsp中编写控制代码,十分不便 *JS ...

python 爬取淘宝的模特照片

python 爬取淘宝的模特照片的更多相关文章

随机推荐

热门专题