JD 评论晒图爬虫

#coding=utf-8

import requests

import re

import os

__author__ = 'depy'

"""

jd 评论晒图爬虫

@productId 商品id

@startpage 开始页数

@endpage 结束页数

"""

class JDPIC(object):

    def __init__(self,productId,startpage,endpage=20):

        self.headers = {

            'User-Agent':'Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/50.0.2661.102 Safari/537.36',

            'Accept':'*/*',

            'Accept-Encoding':'gzip, deflate, sdch, br',

            'Accept-Language':'zh-CN,zh;q=0.8',

            'Cookie':''

        }

        self.url = 'https://club.jd.com/discussion/getProductPageImageCommentList.action'

        self.startpage = startpage

        self.productId = productId

        self.endpage = endpage

    def sendReq(self,page):

        params = {

            'productId':self.productId,

            'isShadowSku':'0',

            'callback':'jQuery219465',

            'page':page,

            'pageSize':20

        }

        r = requests.get(self.url,params=params,headers=self.headers,timeout=10)

        regex = re.findall(r'"imageUrl":"//(.*?)"',r.text)

        return regex

    def downloadImageFile(self,imgUrl):

        local_filename = imgUrl.split('/')[-1]

        print "Download Image File=", local_filename

        imgUrl = 'http://'+imgUrl

        r = requests.get(imgUrl, headers =self.headers,stream=True, timeout=20)

        dirName = 'JDPIC1'

        if not os.path.exists(dirName):

            os.makedirs(dirName)

        with open(dirName+'/'+local_filename, 'wb') as f:

            for chunk in r.iter_content(chunk_size=1024):

                if chunk:

                    f.write(chunk)

                    f.flush()

            f.close()

if __name__ == '__main__':

    J = JDPIC(1111,51,100)  #商品id自行修改

    #print J.endpage

    list = range(int(J.startpage),int(J.endpage)+1)

    for i in list:

        regexlist = J.sendReq(i)

        for picurl in regexlist:

            J.downloadImageFile(picurl)

    print "downpic success"

JD 评论晒图爬虫的更多相关文章

海淘手表Invicta8926OB到手~晒图
3月3号通过国内代购网站Hai360海外购下单: 3月5号美亚发货: 3月6号到达转运仓: 3月12号到达天津清关: 清关等了7天: 3月19号转国内快递,我将原武汉地址,改上海,耽误了3天: 3月2 ...
EasyUI个人项目晒图（续）
晒自己做的一个管理系统(清新风格)EasyUI 这是自己上一次的文章了,只是给大家看一下自己的美观度是不是还是停留在新手的阶段!反正我自己认为我已经不是一个新手了吧!虽然技术永远学不完,我可以说,我和 ...
JFinal-美女图爬虫-一个不正经的爬虫代码
去年我做了一个项目,大量使用爬虫抓取数据,使用JFinal+JSoup组合,抓取数据,数据清洗筛选,最终保存到数据库里,结构化. 今天,我发布一个不正经的爬虫项目,如果你对JSoup做爬虫感兴趣,可以 ...
爬取网易云音乐评论！python 爬虫入门实战（六）selenium 入门！
说到爬虫,第一时间可能就会想到网易云音乐的评论.网易云音乐评论里藏了许多宝藏,那么让我们一起学习如何用 python 挖宝藏吧! 既然是宝藏,肯定是用要用钥匙加密的.打开 Chrome 分析 Head ...
JD轮播图代码
<!DOCTYPE html> <html> <head> <title>jd网站的轮播图效果</title> <me ...
Scrapy框架实战-妹子图爬虫
Scrapy这个成熟的爬虫框架,用起来之后发现并没有想象中的那么难.即便是在一些小型的项目上,用scrapy甚至比用requests.urllib.urllib2更方便,简单,效率也更高.废话不多说, ...
纯HTML和CSS实现JD轮播图
博主使用了纯HTML和CSS实现了JD的轮播图,没有加动态效果,主要是使用了定位的知识. ,如图为两个侧边箭头图片(其实实际中应该使用CSS3的图标字体,这里没有使用). <!DOCTYPE ...
[Python爬虫]煎蛋网OOXX妹子图爬虫（1）——解密图片地址
之前在鱼C论坛的时候,看到很多人都在用Python写爬虫爬煎蛋网的妹子图,当时我也写过,爬了很多的妹子图片.后来煎蛋网把妹子图的网页改进了,对图片的地址进行了加密,所以论坛里面的人经常有人问怎么请求的 ...
python妹子图爬虫5千张高清大图突破防盗链福利5千张福利高清大图
meizitu-spider python通用爬虫-绕过防盗链爬取妹子图这是一只小巧方便,强大的爬虫,由python编写所需的库有 requests BeautifulSoup os lxml 伪 ...

随机推荐

.Net Core with 微服务 - 分布式事务 - 2PC、3PC
最近比较忙,好久没更新了.这次我们来聊一聊分布式事务. 在微服务体系下,我们的应用被分割成多个服务,每个服务都配置一个数据库.如果我们的服务划分的不够完美,那么为了完成业务会出现非常多的跨库事务.即使 ...
Clickhouse Docker集群部署
写在前面抽空来更新一下大数据的玩意儿了,起初架构选型的时候有考虑Hadoop那一套做数仓,但是Hadoop要求的服务器数量有点高,集群至少6台或以上,所以选择了Clickhouse(后面简称CH). ...
TortoiseSVN日志字体和字号调整
TortoiseSVN提供的"show log"功能很有用,但默认的显示文件log历史的字体太小看不清,这个字体的设置在[TortoiseSVN ->Settings-> ...
@Valid和@Validated 区别
Spring Validation验证框架对参数的验证机制提供了@Validated(Spring's JSR-303规范,是标准JSR-303的一个变种),javax提供了@Valid(标准JSR- ...
从安装到使用——Odoo常见问题及故障处理
小九今天分享了Odoo一键部署.高效安装的图文详解,接下来,针对Odoo使用过程中的一些问题,小九整理了详细的常见问题问答.这样的直观方式往往能快速高效地解决一些疑惑. 也欢迎提出其他问题,共同探讨, ...
AWD比赛组织指南
目录题目构建平台构建后端部署流程前端展示批量启动 check 题目构建赛题全部使用docker部署,需准备check脚本和镜像镜像构建注意事项 1.注意web目录权限 2.注意服务是否自 ...
reduce使用技巧
一.使用reduce同时执行map(循环)和filter(过滤) 例如,将数组中的项的值加倍,然后只选择那些大于50的项 const numbers = [10, 20, 30, 40]; const ...
WPF---数据绑定（一）
一.何为数据绑定场景:考虑一个Window上有一个TextBox和一个Slider两个元素,当我们拖动滑动条的时候,会在TextBox中显示当前滑动条的数值:当我们在TextBox中输入一个有效值, ...
【springcloud】常见面试题总结
1.springcloud与dubbo的区别? https://jingyan.baidu.com/article/b0b63dbf3784294a483070fa.html 1.1 springcl ...
git cherry-pick 教程
转自:http://www.ruanyifeng.com/blog/2020/04/git-cherry-pick.html 对于多分支的代码库,将代码从一个分支转移到另一个分支是常见需求. 这时分两 ...

JD 评论晒图爬虫

JD 评论晒图爬虫的更多相关文章

随机推荐

热门专题