Python 爬虫实例（9）—— 搜索爬取淘宝

# coding:utf-

import json

import redis

import time

import requests

session = requests.session()

import logging.handlers

import pickle

import sys

import re

import datetime

from bs4 import BeautifulSoup

import sys

reload(sys)

sys.setdefaultencoding('utf8')

import datetime

# 生成一年的日期

def dateRange(start, end, step=, format="%Y-%m-%d"):

    strptime, strftime = datetime.datetime.strptime, datetime.datetime.strftime

    days = (strptime(end, format) - strptime(start, format)).days

    return [strftime(strptime(start, format) + datetime.timedelta(i), format) for i in xrange(, days, step)]

def spider():

    from selenium import webdriver

    import os

    # 引入chromedriver.exe

    chromedriver = "C:\Program Files (x86)\Google\Chrome\Application\chromedriver.exe"

    os.environ["webdriver.chrome.driver"] = chromedriver

    browser = webdriver.Chrome(chromedriver)

    # 设置浏览器需要打开的url

    url = "https://www.taobao.com/"

    browser.get(url)

    time.sleep()

    browser.find_element_by_id("q").send_keys(u'python')

    browser.find_element_by_class_name("btn-search").click()

    time.sleep()

    for i in range(,):

        browser.find_element_by_xpath('//a[@trace="srp_bottom_pagedown"]').click()

        time.sleep()

        result = browser.page_source

        result_replace = str(result).replace('\n','').replace('\r','').replace('\t','').replace(' ','')

        result_replace = re.findall('<divclass="pic-boxJ_MouseEneterLeaveJ_PicBox">(.*?)</div><divclass="ctx-boxJ_MouseEneterLeaveJ_IconMoreNew">(.*?)</div><divclass="rowrow-4g-clearfix">(.*?)</div></div></div>',result_replace)

        print len(result_replace)

        for item in result_replace:

            item_imgurl = re.findall('data-src="(.*?)"alt=',item[])[]

            item_name = re.findall('alt="(.*?)"/></a></div><divclass=',item[])[]

            item_loation = re.findall('<divclass="location">(.*?)</div>',item[])[]

            company_name = re.findall('</span></span><span>(.*?)</span></a></div><divclass="location">',item[])[]

            company_price = re.findall('<divclass="priceg_priceg_price-highlight"><span>¥</span><strong>(.*?)</strong></div>',item[])[]

            purchase_num = re.findall('<divclass="deal-cnt">(.*?)人付款</div>',item[])[]

            print item_imgurl

            print item_name

            print item_loation

            print company_name

            print company_price

            print purchase_num

            print "="*

            # time.sleep()

    # 关闭浏览器

    # browser.quit()

spider()

Python 爬虫实例（9）—— 搜索爬取淘宝的更多相关文章

Python爬虫实战四之抓取淘宝MM照片
原文:Python爬虫实战四之抓取淘宝MM照片其实还有好多,大家可以看 Python爬虫学习系列教程福利啊福利,本次为大家带来的项目是抓取淘宝MM照片并保存起来,大家有没有很激动呢? 本篇目标 1. ...
一次Python爬虫的修改，抓取淘宝MM照片
这篇文章是2016-3-2写的,时隔一年了,淘宝的验证机制也有了改变.代码不一定有效,保留着作为一种代码学习. 崔大哥这有篇>>小白爬虫第一弹之抓取妹子图不失为学python爬虫的绝佳教 ...
python3编写网络爬虫16-使用selenium 爬取淘宝商品信息
一.使用selenium 模拟浏览器操作爬取淘宝商品信息之前我们已经成功尝试分析Ajax来抓取相关数据,但是并不是所有页面都可以通过分析Ajax来完成抓取.比如,淘宝,它的整个页面数据确实也是通过A ...
python 网路爬虫（二）爬取淘宝里的手机报价并以价格排序
今天要写的是之前写过的一个程序,然后把它整理下,巩固下知识点,并对之前的代码进行一些改进. 今天要爬取的是淘宝里的关于手机的报价的信息,并按照自己想要价格来筛选. 要是有什么问题希望大佬能指出我的错误 ...
Python网络爬虫（6）--爬取淘宝模特图片
经过前面的一些基础学习,我们大致知道了如何爬取并解析一个网页中的信息,这里我们来做一个更有意思的事情,爬取MM图片并保存.网址为https://mm.taobao.com/json/request_t ...
利用Python爬虫爬取淘宝商品做数据挖掘分析实战篇，超详细教程
项目内容本案例选择>> 商品类目:沙发: 数量:共100页 4400个商品: 筛选条件:天猫.销量从高到低.价格500元以上. 项目目的 1. 对商品标题进行文本分析词云可视化 2. ...
python爬虫学习(三)：使用re库爬取"淘宝商品"，并把结果写进txt文件
第二个例子是使用requests库+re库爬取淘宝搜索商品页面的商品信息 (1)分析网页源码打开淘宝,输入关键字“python”,然后搜索,显示如下搜索结果从url连接中可以得到搜索商品的关键字是 ...
【Python3 爬虫】14_爬取淘宝上的手机图片
现在我们想要使用爬虫爬取淘宝上的手机图片,那么该如何爬取呢?该做些什么准备工作呢? 首先,我们需要分析网页,先看看网页有哪些规律打开淘宝网站http://www.taobao.com/ 我们可以看到 ...
使用Python爬取淘宝两千款套套
各位同学们,好久没写原创技术文章了,最近有些忙,所以进度很慢,给大家道个歉. 警告:本教程仅用作学习交流,请勿用作商业盈利,违者后果自负!如本文有侵犯任何组织集团公司的隐私或利益,请告知联系猪哥删除! ...

随机推荐

从小白到区块链工程师：第一阶段：Go语言的HelloWorld初始（2）
四.写下第一段Go语言代码“Hello World” 小建议:就是文件夹路径或者文件名称不要出现中文,可能会导致一些不必要的麻烦(编译失败) 在sublime中,我们在src文件夹上面,单击右键“Ne ...
Android图片缓存框架Glide
Android图片缓存框架Glide Glide是Google提供的一个组件.它具有获取.解码和展示视频剧照.图片.动画等功能.它提供了灵活的API,帮助开发者将Glide应用在几乎任何网络协议栈中. ...
jquery实时获取时间
$(document).ready(function(){ function time(){ var date=new Date(); var h=date.getHours(); var m=dat ...
JMeter-java.lang.OutOfMemoryError: PermGen space错误
PermGen space的全称是Permanent Generation space,是指内存的永久保存区域,这块内存主要是被JVM存放Class和Meta信息的,Class在被Loader时就会被 ...
Lucene入门实例-CRUD
1.导入jar包 lucene-analyzers-common-7.6.0.jar lucene-analyzers-smartcn-7.6.0.jar lucene-core-7.6.0.jar ...
pip安装django失败
pip install django时提示 Cannot fetch index base URL https://mirrors.tuna.tsinghua.edu.cn/pypi/simple/, ...
C#扩展方法实现
C#提供了一种机制,可以扩展系统或者第三方类库中的方法.比如说想在string类型的对象里面多一个ToInt32(),来方便的将字符转换成整形.在实现的过程中的关键字为static和this即可. ...
springmvc注解方式
https://www.cnblogs.com/shanheyongmu/p/5865589.html
Yii2 数组助手类arrayHelper
数组助手类 ArrayHelper 1.什么是数组助手类 Yii 数组助手类提供了额外的静态方法,让你更高效的处理数组. a.获取值(getValue) class User { public $na ...
python:什么是单例？一个简单的单例
单例:即一个类只能生成唯一的一个实例,python中的类如果没有被实例化,则cls._instance为None 如下: class Singleton(object): def __new__(cl ...

Python 爬虫实例（9）—— 搜索 爬取 淘宝

Python 爬虫实例（9）—— 搜索 爬取 淘宝的更多相关文章

随机推荐

热门专题

Python 爬虫实例（9）—— 搜索爬取淘宝

Python 爬虫实例（9）—— 搜索爬取淘宝的更多相关文章