taobao.go

package main

import (
    "crypto/md5"
    "encoding/hex"
    "fmt"
    "github.com/PuerkitoBio/goquery"
    "github.com/hunterhug/go_tool/spider"
    "github.com/hunterhug/go_tool/spider/query"
    "github.com/hunterhug/go_tool/util"
    "regexp"
    "strings"
)

func main() {
    fmt.Println(`欢迎使用淘宝天猫图片下载小工具,在同级目录写入链接进taobao.txt,运行EXE即可`)
    fmt.Println("链接如:tmall.com/item.htm?id=523350171126&skuId=3120562159704,tmall")
    fmt.Println("---------------以上详情页中图片会保存在tmall目录-----------------------")
    c, e := util.ReadfromFile("./taobao.txt")
    if e != nil {
        fmt.Println("打开taobao.txt出错")
    } else {
        urls := strings.Split(string(c), "\n")
        for _, url := range urls {
            url := strings.Replace(strings.TrimSpace(url), "\r", "", -1)
            downlod(url)
        }

    }
    fmt.Println("请手动关闭选框...")
    util.Sleep(100)
}

func md55(s string) string {
    h := md5.New()
    h.Write([]byte(s))
    rs := hex.EncodeToString(h.Sum(nil))
    return rs
}

func downlod(urlmany string) {
    temp := strings.Split(urlmany, ",")
    url := temp[0]
    filename := util.TodayString(3)
    if len(temp) >= 2 {
        filename = temp[1]
    }
    dir := "./" + filename
    util.MakeDir(dir)
    s, e := spider.NewSpider(nil)
    if e != nil {

    } else {
        s.Url = url
        dudu := "detail.tmall.com"
        if strings.Contains(url, "item.taobao.com") {
            dudu = "item.taobao.com"
        }
        s.NewHeader("Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/54.0.2840.99 Safari/537.36", dudu, nil)
        content, err := s.Get()
        if err != nil {

        } else {
            //fmt.Println(string(content))
            docm, err := query.QueryBytes(content)
            if err != nil {
                fmt.Println(err.Error())
            } else {
                //fmt.Println(string(content))
                docm.Find("img").Each(func(num int, node *goquery.Selection) {
                    img, e := node.Attr("src")
                    if e == false {
                        img, e = node.Attr("data-src")
                    }
                    if e && img != "" {
                        if strings.Contains(img, ".gif") {
                            return
                        }
                        fmt.Println("原始文件:" + img)
                        r, _ := regexp.Compile(`([\d]{1,4}x[\d]{1,4})`)
                        imgdudu := r.FindStringSubmatch(img)
                        sizes := "720*720"
                        if len(imgdudu) == 2 {
                            sizes = imgdudu[1]
                        }
                        temp := strings.Replace(img, sizes, "720x720", -1)
                        filename := md55(temp)
                        if util.FileExist(dir + "/" + filename + ".jpg") {
                            fmt.Println("文件存在:" + dir + "/" + filename)
                        } else {
                            fmt.Println("下载:" + temp)
                            s.Url = "http:" + temp
                            imgsrc, e := s.Get()
                            if e != nil {
                                fmt.Println("下载出错" + temp + ":" + e.Error())
                                return
                            }
                            e = util.SaveToFile(dir+"/"+filename+".jpg", imgsrc)
                            if e == nil {
                                fmt.Println("成功保存在" + dir + "/" + filename)
                            }
                            util.Sleep(2)
                            fmt.Println("暂停两秒")
                        }
                    }
                })

            }

        }
    }

}

在源码同级目录写入taobao.txt:

https://detail.tmall.com/item.htm?id=523350171126&skuId=3120562159704,myword

图片将会保存在myword里面

首先安装库

go get -v github.com/PuerkitoBio/goquery
go get -v github.com/hunterhug/go_tool

然后开跑!

go run taobao.go

如果嫌麻烦

请到这里下载打包exe执行文件:

http://pan.baidu.com/s/1jHKUGZG

进入go目录,下载taobao.rar

源码在:

https://github.com/hunterhug/taobao_img

截图如下:


少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区
少于150字的随笔不允许发布到首页候选区

抓取天猫和淘宝的详情页图片|Golang的更多相关文章

  1. 仿淘宝商品详情页上拉弹出新ViewController

    新项目就要开始做了,里面有购物那块,就试着先把淘宝商品详情页的效果做了一下. 1.需求 1.第一次上拉时,A视图拉到一定距离将视图B从底部弹出,A视图也向上 2.显示B视图时下拉时,有刷新效果,之后将 ...

  2. iOS app url scheme跳转到淘宝商品详情页 唤醒app

    最近涉及的一个业务,在app内的一个广告,点击打开webView,加载的是一个淘宝商品详情页,效果是打开该webView自动跳转至淘宝对应的页面,同时在自己的app仍然加载页面,点击评论等也同样能跳转 ...

  3. 第十二篇、OC_仿淘宝商品详情页的翻页

    // // GFBProductViewController.m // elmsc // // Created by MAC on 2016/11/26. // Copyright © 2016年 G ...

  4. android仿京东、淘宝商品详情页上拉查看详情

    话不多说,直接上干货,基本就是一个scrollview中嵌套两个scrollview或者webview;关键点事处理好子scrollview和父scrollview的触摸.滑动事件已达到想要的效果.大 ...

  5. vue实现淘宝商品详情页属性选择功能

    方法一是自己想出来的,方法二来自忘记哪里看到的了 不知道是不是你要的效果: 方法一:利用input[type="radio"] css代码: input { display: no ...

  6. 仿京东淘宝商品详情页属性选择js效果

    在网上找了好久发现都不符合要求就自己摸索写了一个,用到了linq.js这个linq to js 扩展,不然用纯JS遍历json查询要死人啊 demo:http://123.207.28.46:8086 ...

  7. 【Python3 爬虫】14_爬取淘宝上的手机图片

    现在我们想要使用爬虫爬取淘宝上的手机图片,那么该如何爬取呢?该做些什么准备工作呢? 首先,我们需要分析网页,先看看网页有哪些规律 打开淘宝网站http://www.taobao.com/ 我们可以看到 ...

  8. python爬虫爬取京东、淘宝、苏宁上华为P20购买评论

    爬虫爬取京东.淘宝.苏宁上华为P20购买评论 1.使用软件 Anaconda3 2.代码截图 三个网站代码大同小异,因此只展示一个 3.结果(部分) 京东 淘宝 苏宁 4.分析 这三个网站上的评论数据 ...

  9. Vue实现仿淘宝商品详情属性选择的功能

    Vue实现仿淘宝商品详情属性选择的功能 先看下效果图:(同个属性内部单选,属性与属性之间可以多选) 主要实现过程: 所使用到的数据类型是(一个大数组里面嵌套了另一个数组)具体格式如下:   attrA ...

随机推荐

  1. R语言-妹子被追后的选择分析

    前提假设 妹子们一生中可以遇到100个追求者,追求者的优秀程度符合正态分布: 每个妹子都具备判断并比较追求者优秀程度的能力: 接受或拒绝一个追求者后永远无法后悔. 那么,问题来了 当遇到追求者时,如何 ...

  2. maven nexus deploy方式以及相关注意事项

    以前公司都是配管负责管理jar的,现在没有专职配管了,得自己部署到deploy上供使用.总的来说,jar部署到nexus上有两种方式: 1.直接登录nexus控制台进行上传,如下: 但是,某些仓库可能 ...

  3. 二进制打印与逆序_C语言(转)

    //二进制逆序 by MoreWindows( http://blog.csdn.net/MoreWindows ) #include <stdio.h> //二进制打印函数 templa ...

  4. Javascript-回调函数浅谈

    回调函数就是一个通过函数指针调用的函数.如果你把函数的指针(地址)作为参数传递给另一个函数,当这个指针被用来调用其所指向的函数时,我们就说这是回调函数.回调函数不是由该函数的实现方直接调用,而是在特定 ...

  5. CMD和AMD

    CMD是国内玉伯在开发SeaJS的时候提出来的,属于CommonJS的一种规范,此外还有AMD,其对于的框架是RequireJS. 二者的异同之处: 二者都是异步(Asynchronuous Modu ...

  6. 关于IE处理margin和padding值超出父元素高度的问题

    两个div,父div有padding值,子div有margin-top值,浏览器在解析实际父子位置关系时,他们之间的距离是父padding+子margin-top.现在把父div设置固定高度,并有意让 ...

  7. Mac下安装Django

    用到一个Python写的后台服务,需要用到Django,参考Django安装文档,配置过程如下: 1.下载一个用来安装和管理Python包的工具“pip”; 2.下载完成后,运行安装脚本,注意需要管理 ...

  8. <极客学院>视频教程学习笔记-iOS中CALayer的使用

    <1>CALayer简介 1.CALayer一般作为UIView的容器而使用. 2.CALayer是一个管理者图片载体(image-based content)的层结构 3.直接修改单独创 ...

  9. LeetCode 1 Two Sum(二分法)

    题目来源:https://leetcode.com/problems/two-sum/ Given an array of integers, find two numbers such that t ...

  10. Mysql中的视图

    什么是视图 通俗的讲,视图就是一条SELECT语句执行后返回的结果集.所以我们在创建视图的时候,主要的工作就落在创建这条SQL查询语句上. 视图的特性 视图是对若干张基本表的引用,一张虚表,查询语句执 ...