直接上代码:

# python2

# -*- coding: utf-8 -*-

import urllib2

import re

import string

import os

import shutil

def crawl_taobaoMM(baseUrl, start, end):

    imgDir = 'mm_img'

    isImgDirExist = os.path.exists(imgDir)

    if not isImgDirExist:

        os.makedirs(imgDir)

    else:

        shutil.rmtree(imgDir)

    fileName = 'mm.txt'

    picNumber = 0

    with open(fileName, 'a') as f:

        for i in range(start, end + 1):

            url = baseUrl + '?page=' + str(i)

            userAgent = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_6)' \

                        ' AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36'

            headers = {'user-agent': userAgent}

            req = urllib2.Request(url, headers=headers)

            response = urllib2.urlopen(req).read().decode('gbk')

            # 图片url、姓名、年龄、城市、职业

            serchPattern = r'<div class="personal-info">.*?<img src="//(.*?)".*?<a class="lady-name".*?>(.*?)' \

                           r'</a>.*?<strong>(.*?)</strong>.*?<span>(.*?)</span>.*?<em>(.*?)</em>'

            searchObj = re.compile(serchPattern, re.S)

            results = searchObj.findall(response)

            print '第' + str(i) + '页...'

            for result in results:

                message = '%s %s %s %s %s\n' % (result[0], result[1], result[2], result[3], result[4])

                print picNumber

                print message

                f.write(message.encode('utf-8'))

                pic = urllib2.urlopen('https://' + result[0]).read()

                picName = imgDir + '/' + string.zfill(picNumber, 5) + '.jpg'

                with open(picName, 'wb') as pf:

                    pf.write(pic)

                picNumber += 1

crawl_taobaoMM('https://mm.taobao.com/json/request_top_list.htm', 1, 10)

爬下来的图片:

参考资料:

Python爬虫实战四之抓取淘宝MM照片

Python爬虫(三)爬淘宝MM图片的更多相关文章

【python】抄写爬淘宝已买到的宝贝的代码
教程地址:http://cuiqingcai.com/1076.html 这一篇掌握的不好.虽然代码可以跑,但是里面的很多东西都一知半解.需要有空的时候系统整理. 原代码中的正则表达式已经失效了,我自 ...
使用pyspider爬取巨量淘宝MM图片
具体搭建步骤不再赘述,这里主要使用到了fakeagent,phantomjs和proxy pyspider的爬取相当智能,在不能获取图片的时候会适当的暂停一段时间再试探性的爬取,配合fakeagent ...
用pyspider爬淘宝MM照片
#!/usr/bin/env python # -*- encoding: utf-8 -*- # Created on 2016-12-09 15:24:54 # Project: taobaomm ...
Python爬虫之一 PySpider 抓取淘宝MM的个人信息和图片
ySpider 是一个非常方便并且功能强大的爬虫框架,支持多线程爬取.JS动态解析,提供了可操作界面.出错重试.定时爬取等等的功能,使用非常人性化. 本篇通过做一个PySpider 项目,来理解 Py ...
python 爬虫实战4 爬取淘宝MM照片
本篇目标抓取淘宝MM的姓名,头像,年龄抓取每一个MM的资料简介以及写真图片把每一个MM的写真图片按照文件夹保存到本地熟悉文件保存的过程 1.URL的格式在这里我们用到的URL是 http:/ ...
Python爬虫实战四之抓取淘宝MM照片
原文:Python爬虫实战四之抓取淘宝MM照片其实还有好多,大家可以看 Python爬虫学习系列教程福利啊福利,本次为大家带来的项目是抓取淘宝MM照片并保存起来,大家有没有很激动呢? 本篇目标 1. ...
一次Python爬虫的修改，抓取淘宝MM照片
这篇文章是2016-3-2写的,时隔一年了,淘宝的验证机制也有了改变.代码不一定有效,保留着作为一种代码学习. 崔大哥这有篇>>小白爬虫第一弹之抓取妹子图不失为学python爬虫的绝佳教 ...
芝麻HTTP：Python爬虫实战之抓取淘宝MM照片
本篇目标 1.抓取淘宝MM的姓名,头像,年龄 2.抓取每一个MM的资料简介以及写真图片 3.把每一个MM的写真图片按照文件夹保存到本地 4.熟悉文件保存的过程 1.URL的格式在这里我们用到的URL ...
Python爬虫之爬取淘女郎照片示例详解
这篇文章主要介绍了Python爬虫之爬取淘女郎照片示例详解,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧本篇目标抓取淘宝MM ...

随机推荐

Pod容器共享Volume
同一个Pod中的多个容器能够共享Pod级别的存储卷Volume.Volume可以被定义为各种类型,多个容器各自进行挂载操作,将一个Volume挂载为容器内部需要的目录,如图在下面的例子中,在Pod内 ...
数据结构篇-数组（TypeScript版+Java版）
1.TypeScript版本 export default class MyArray<E> { public data: E[]; public size: number = 0; /* ...
【Selenium04篇】python+selenium实现Web自动化：文件上传，Cookie操作，调用 JavaScript，窗口截图
一.前言最近问我自动化的人确实有点多,个人突发奇想:想从0开始讲解python+selenium实现Web自动化测试,请关注博客持续更新! 这是python+selenium实现Web自动化第四篇博 ...
基于ffmpeg不同编码方式转码后的psnr对比
一.测试说明: 源文件:1080psrc.mp4 时长:900秒源文件信息:Video: h264 (High) (avc1 / 0x31637661), yuv420p, 1920x1080 [S ...
flex实现三列布局
css3新引入的flex在某些情况下布局非常实用因为它是弹性盒子所以自适应效果会很棒不过各项布局方案还是各有优劣 <!DOCTYPE html> <html lang=" ...
IO流学习总结
IO: 概述: IO流用来处理设备之间的数据传输,如上传文件和下载文件 Java对数据的操作是通过流的方式 Java用于操作流的对象都在IO包中按照数据流向: 输入流读入数据从操作系统上读入文件到 ...
VXLAN 基础教程：在 Linux 上配置 VXLAN 网络
上篇文章结尾提到 Linux 是支持 VXLAN 的,我们可以使用 Linux 搭建基于 VXLAN 的 overlay 网络,以此来加深对 VXLAN 的理解,毕竟光说不练假把式. 1. 点对点的 ...
【Jenkins】参数化引用
我们在Jenkins里设置了参数如下 1. Jenkins中引用 shell引用 $env windows bat引用 %env% 在git等源码管理时,调用参数的格式${env} 2. jmete ...
frame/iframe多表单切换
应用场景: 在Web应用中经常会遇到frame/iframe表单嵌套页面的应用,WebDriver只能在一个页面上对元素识别与定位,对于frame/iframe表单内嵌页面上的元素无法直接定位.这时就 ...
Android App安全渗透测试(一)
一. 实验环境搭建 1. 安装JDK 2. 安装Android Studio 3. 模拟器或真机我的是夜神模拟器和nexus 工具 Apktool ...

Python爬虫(三)爬淘宝MM图片

Python爬虫实战四之抓取淘宝MM照片

Python爬虫(三)爬淘宝MM图片的更多相关文章

随机推荐

热门专题