python 爬取京东手机图

初学urllib，高手勿喷...

import re

import urllib.request

#函数：每一页抓取的30张图片

def craw(url,page):

    imagelist = []#这里每次都要重新定义新的空列表，第一次没有定义结果爬取的都是一样的图片

    html1 = urllib.request.urlopen(url)

    data = str(html1.read())

    patter1 = '<li class="gl-item".+?</li>'

    result1 = re.compile(patter1).findall(data)

    patter2 = '//img.+?.jpg'#用.+?代表的是中间可是是任意多个字符

    for i in range(30):

        result_temp = result1[i]

        imagelist.append(re.compile(patter2).findall(result_temp))#用compile和findall得出的是列表，再将得到的列表加入整个的一个列表

    for i in range(1,30):#一开始调试用的是笨办法一个个的点，后来发现可以在断点处设置i==4

        try:#在imagelist中有存在图片抓取失败的情况，最懒的解决办法就是用try——except，无论出现什么情况都pass掉

            imageurl = "http:"+str(imagelist[i][0])

            imagename = "D:/picture/"+str(page)+str(i)+".jpg"

            result = urllib.request.urlopen(imageurl)#得到图片的地址后，**还是用打开连接用read()得到data的方法获取图片

            if (result.getcode() != 200):#如果链接不正常，则跳过这个链接

                pass

            else:

                data = result.read()  # 否则开始下载到本地

                with open(imagename, "wb") as code:

                    code.write(data)

                    code.close()

        except:

            pass

url = 'https://search.jd.com/Search?keyword=%E6%89%8B%E6%9C%BA&enc=utf-8&qrst=1&rt=1&stop=1&vt=2&wq=%E6%89%8B%E6%9C%BA&cid2=653&cid3=655&page='

for i in range(2,10):#先从2页爬取到9页

    url_new = url + str(2*i-1)#分析每页的地址将page后的无用的地方删去，再加上（2n-1），n为页数

    craw(url_new,i)

python 爬取京东手机图的更多相关文章

Java实现爬取京东手机数据
Java实现爬取京东手机数据最近看了某马的Java爬虫视频,看完后自己上手操作了下,基本达到了爬数据的要求,HTML页面源码也刚好复习了下,之前发布两篇关于简单爬虫的文章,也刚好用得上.项目没什么太 ...
使用Python 爬取京东，淘宝。商品详情页的数据。（避开了反爬虫机制）
以下是爬取京东商品详情的Python3代码,以excel存放链接的方式批量爬取.excel如下代码如下 from selenium import webdriver from lxml import ...
Python 爬虫-爬取京东手机页面的图片
具体代码如下: __author__ = 'Fred Zhao' import requests from bs4 import BeautifulSoup import os from urllib ...
python爬取京东评论
一.分析 1.找到京东商品评论所在位置(记得点击商品评论,否则找不到productPageComments.action) 2.解析文件打开后发现是json数据,但不是那么规范,所以需要去点前面的 ...
python爬取京东价格
昨天准备爬取一个京东商品的价格,正则写好了一直是空的后来我去页面里面看了下,价格标签里果然是空的百度了下,大家都说是js来控制显示价格的于是去抓包试试,找到了一条mgets的请求中间很多参数不 ...
毕设二:python 爬取京东的商品评论
# -*- coding: utf-8 -*- # @author: Tele # @Time : 2019/04/14 下午 3:48 # 多线程版 import time import reque ...
教你用python爬取网站美女图（附代码及教程）
我前几篇文章都是说一些python爬虫库的用法,还没有说怎样利用好这些知识玩一些好玩的东西.那我今天带大家玩好玩又刺激的,嘻嘻!对了,requests库和正则表达式很重要的,一定要学会!一定要学会!! ...
python3[爬虫实战] 使用selenium，xpath爬取京东手机
使用selenium ,可能感觉用的并不是很深刻吧,可能是用scrapy用多了的缘故吧.不过selenium确实强大,很多反爬虫的都可以用selenium来解决掉吧. 思路: 入口: 关键字搜索入口 ...
C#爬取京东手机数据+PowerBI数据可视化展示
此系列博文链接 C#爬虫基本知识 Html Agility Pack解析html TODO: EF6中基本认识. EF6操作mysql MySQL乱码问题 C#爬虫在开头贴一下github仓库地址, ...

随机推荐

Java微服务框架一览
引言:本文首先简单介绍了微服务的概念以及使用微服务所能带来的优势,然后结合实例介绍了几个常见的Java微服务框架. 微服务在开发领域的应用越来越广泛,因为开发人员致力于创建更大.更复杂的应用程序,而这 ...
SQL学习之SQL注入学习总结
所谓SQL注入,就是通过把SQL命令插入到Web表单提交或输入域名或页面请求的查询字符串,最终达到欺骗服务器执行恶意的SQL命令. 测试数据库我们本文就以如下数据库作为测试数据库,完成我们的注入分析 ...
Android 深入理解Activity 页面Intent跳转
算法之路 level 01 problem set
2992.357000 1000 A+B Problem1214.840000 1002 487-32791070.603000 1004 Financial Management880.192000 ...
keepalived+nginx实现HA高可用的web负载均衡
Keepalived 是一种高性能的服务器高可用或热备解决方案, Keepalived 可以用来防止服务器单点故障的发生,通过配合 Nginx 可以实现 web 前端服务的高可用.Keepalived ...
ubuntu服务器安装FTP服务
目录 ubuntu服务器安装FTP服务一.实验环境二.安装配置FTP 下载ftp 配置环境新建用户 ubuntu服务器安装FTP服务参考教程 [ubuntu16.04搭建ftp服务器一.实验 ...
CreateDirectory 创建文件夹 C\C++
函数原型: CreateDirectory( LPCTSTR lpPathName, LPSECURITY_ATTRIBUTES lpSecurityAttributes ); 简介: CreateD ...
linux性能分析工具之火焰图
一.环境 1.1 jello@jello:~$ uname -a Linux jello 4.4.0-98-generic #121-Ubuntu SMP Tue Oct 10 14:24:03 UT ...
Bi-shoe and Phi-shoe（欧拉函数/素筛）题解
Bi-shoe and Phi-shoe Bamboo Pole-vault is a massively popular sport in Xzhiland. And Master Phi-shoe ...
object Add(object Before, object After, object Count, object Type);
[表达式] .Add(Before, After, Count, Type) [表达式] 一个代表 Sheets 对象的变量. Before指定工作表的对象,新建的工作表将置于此工作表之前. Afte ...

python 爬取京东手机图

python 爬取京东手机图的更多相关文章

随机推荐

热门专题