用pyspider爬淘宝MM照片

#!/usr/bin/env python

# -*- encoding: utf-8 -*-

# Created on 2016-12-09 15:24:54

# Project: taobaomm

from pyspider.libs.base_handler import *

PAGE_START = 1

PAGE_END = 30

DIR_PATH = 'D:\mzitu\mmmm'

class Handler(BaseHandler):

    crawl_config = {

    }

    def __init__(self):

        self.base_url = 'https://mm.taobao.com/json/request_top_list.htm?page='

        self.page_num = PAGE_START

        self.total_num = PAGE_END

        self.deal = Deal()

    def on_start(self):

        while self.page_num <= self.total_num:

            url = self.base_url + str(self.page_num)

            self.crawl(url, callback=self.index_page, validate_cert = False)

            self.page_num += 1

    def index_page(self, response):

        for each in response.doc('.lady-name').items():

            self.crawl(each.attr.href, callback=self.detail_page, validate_cert = False, fetch_type='js')

    def detail_page(self, response):

        domain = response.doc('.mm-p-domain-info li > span').text()

        if domain:

            page_url = 'https:' + domain

            self.crawl(page_url, callback=self.domain_page, validate_cert = False)

    def domain_page(self, response):

        name = response.doc('.mm-p-model-info-left-top dd > a').text() 　　 ##获取姓名

        dir_path = self.deal.mkDir(name) 　　　　##创建文件夹

        brief = response.doc('.mm-aixiu-content').text()　　　　##获取显示的文本内容

        if dir_path:　　　　##如果文件夹存在

            imgs = response.doc('.mm-aixiu-content img').items()　　##定位到图片

            count = 1　　##定义count 用于后面的自增

            self.deal.saveBrief(brief, dir_path, name)　　##创建一个文本，命名为"名字".txt，将brief中的内容写入文件夹中

            for img in imgs:

                url = img.attr.src  ##获取到图片的url

                if url:

                    extension = self.deal.getExtension(url)  ##调用deal中的getExtension  作用是!!!取到.jpg

                    file_name = name + str(count) + '.' + extension

                    count += 1

                    self.crawl(img.attr.src, callback=self.save_img, validate_cert = False,

                               save={'dir_path': dir_path, 'file_name': file_name})

    def save_img(self, response):

        content = response.content

        dir_path = response.save['dir_path']

        file_name = response.save['file_name']

        file_path = dir_path + '/' + file_name

        self.deal.saveImg(content, file_path)

import os

class Deal:

    def __init__(self):

        self.path = DIR_PATH

        if not self.path.endswith('/'):

            self.path = self.path + '/'

        if not os.path.exists(self.path):

            os.makedirs(self.path)

    def mkDir(self, path):

        path = path.strip()

        dir_path = self.path + path

        exists = os.path.exists(dir_path)

        if not exists:

            os.makedirs(dir_path)

            return dir_path

        else:

            return dir_path

    def saveImg(self, content, path):

        f = open(path, 'wb')

        f.write(content)

        f.close()

    def saveBrief(self, content, dir_path, name):

        file_name = dir_path + "/" + name + ".txt"

        f = open(file_name, "w+")

        f.write(content.encode('utf-8'))

    def getExtension(self, url):

        extension = url.split('.')[-1]

        return extension

用pyspider爬淘宝MM照片的更多相关文章

Python爬虫(三)爬淘宝MM图片
直接上代码: # python2 # -*- coding: utf-8 -*- import urllib2 import re import string import os import shu ...
Python爬虫实战四之抓取淘宝MM照片
原文:Python爬虫实战四之抓取淘宝MM照片其实还有好多,大家可以看 Python爬虫学习系列教程福利啊福利,本次为大家带来的项目是抓取淘宝MM照片并保存起来,大家有没有很激动呢? 本篇目标 1. ...
一次Python爬虫的修改，抓取淘宝MM照片
这篇文章是2016-3-2写的,时隔一年了,淘宝的验证机制也有了改变.代码不一定有效,保留着作为一种代码学习. 崔大哥这有篇>>小白爬虫第一弹之抓取妹子图不失为学python爬虫的绝佳教 ...
python 爬虫实战4 爬取淘宝MM照片
本篇目标抓取淘宝MM的姓名,头像,年龄抓取每一个MM的资料简介以及写真图片把每一个MM的写真图片按照文件夹保存到本地熟悉文件保存的过程 1.URL的格式在这里我们用到的URL是 http:/ ...
芝麻HTTP：Python爬虫实战之抓取淘宝MM照片
本篇目标 1.抓取淘宝MM的姓名,头像,年龄 2.抓取每一个MM的资料简介以及写真图片 3.把每一个MM的写真图片按照文件夹保存到本地 4.熟悉文件保存的过程 1.URL的格式在这里我们用到的URL ...
Python爬虫之一 PySpider 抓取淘宝MM的个人信息和图片
ySpider 是一个非常方便并且功能强大的爬虫框架,支持多线程爬取.JS动态解析,提供了可操作界面.出错重试.定时爬取等等的功能,使用非常人性化. 本篇通过做一个PySpider 项目,来理解 Py ...
python爬虫基础之一（爬淘宝）
没想到python如此强大, 今天看一会视频学会了一段python爬虫这就是我今天学到的内容爬去淘宝网关于书包的一些信息,包括价格, #coding=utf-8 import requests#导入 ...
【python】抄写爬淘宝已买到的宝贝的代码
教程地址:http://cuiqingcai.com/1076.html 这一篇掌握的不好.虽然代码可以跑,但是里面的很多东西都一知半解.需要有空的时候系统整理. 原代码中的正则表达式已经失效了,我自 ...
使用pyspider爬取巨量淘宝MM图片
具体搭建步骤不再赘述,这里主要使用到了fakeagent,phantomjs和proxy pyspider的爬取相当智能,在不能获取图片的时候会适当的暂停一段时间再试探性的爬取,配合fakeagent ...

随机推荐

Eclipse安装Spring-tool-suite
目录结构: // contents structure [-] 在Eclipse上安装Spring-tool-suite的方法有那些如何查看自己的Eclipse版本如何知道自己的Eclipse对应 ...
【IOS开发笔记02】学生管理系统
端到端的机会虽然现在身处大公司,但是因为是内部创业团队,产品.native.前端.服务器端全部坐在一起开发,大家很容易做零距离交流,也因为最近内部有一个前端要转岗过来,于是手里的前端任务好像可以抛一 ...
Linux常用命令大全
系统信息 arch 显示机器的处理器架构(1) uname -m 显示机器的处理器架构(2) uname -r 显示正在使用的内核版本 dmidecode -q 显示硬件系统部件 - (SMBIO ...
O365（世纪互联）SharePoint 之使用Designer报错
前言在SharePoint Online中使用Designer报错,错误为:This Feature has been disabled by your administrator.找了好久发现原因 ...
iOS 获取当前点击的坐标
- (void)touchesBegan:(NSSet<UITouch *> *)touches withEvent:(UIEvent *)event { NSSet *allTouch ...
ListView之多种类型Item
一.概述一般而言,listview每个item的样式是一样的,但也有很多应用场景下不同位置的item需要不同的样式. 拿微信举例,前者的代表作是消息列表,而后者的典型则是聊天会话界面. 本文重点介绍 ...
ASP.NET MVC 让@Html.DropDownList显示默认值
在使用@Html.DropDownList的过程中,发现它的用法很局限,比如在加载的时候显示设定的默认项或者调整它的显示样式,在网上查了一些资料,终于把这个问题解决了. 一.View代码 @using ...
Hibernate 系列 05 - Session 类
引导目录: Hibernate 系列教程目录前言: Session是Hibernate运作的中心,对象的生命周期.事务的管理.数据库的存取都与Session息息相关. 就如同在编写JDBC时需要关 ...
Group by
分组语句必须和聚合函数在一起使用, group by子句负责将数据分成逻辑组,聚合函数对每一组进行统计计算 group by 必须放到 select 语句后面,如果select语句中有where子句, ...
Spring profile配置应用
spring配置文件中可以配置多套不同环境配置,如下: <beans xml.....> <beans profile="dev"> < ...

用pyspider爬淘宝MM照片

用pyspider爬淘宝MM照片的更多相关文章

随机推荐

热门专题