爬虫实战4：用selenium爬取淘宝美食

方案1：一次性爬取全部淘宝美食信息

1. spider.py文件如下

 __author__ = 'Administrator'

 from selenium import webdriver

 from selenium.webdriver.common.by import By

 from selenium.webdriver.support.ui import WebDriverWait

 from selenium.webdriver.support import expected_conditions as EC

 import re

 from pyquery import PyQuery as pq

 from config import *

 import pymongo

 client = pymongo.MongoClient(MONGO_URL)

 db = client[MONGO_DB]

 browser = webdriver.Chrome()

 """

 如果把Chrome修改为使用PhantomJS

 1. 首先需要安装phantomJS

 2. 自定义一些配置参数，这里不加载图片以及使用缓存

 browser = webdriver.PhantomJS(service_args=SERVICE_ARGS)

 3. 设置窗口大小

 browser.set_window_size(1400,900)

 """

 wait = WebDriverWait(browser, 10)  #显示等待10秒再查找目标元素

 def search():

     # print('正在搜索')  用于phantomJS调试

     try:

         browser.get('https://www.taobao.com')

         input1 = wait.until(

             EC.presence_of_element_located((By.CSS_SELECTOR, '#q'))  #定位搜索框

         )

         submit = wait.until(EC.element_to_be_clickable((By.CSS_SELECTOR, '#J_TSearchForm > div.search-button > button')))  #定位搜索按钮

         # 这里的美食可以替换为配置文件中的变量KEYWORD

         input1.send_keys('KEYWORD')

         submit.click()

         total = wait.until(

             EC.presence_of_element_located((By.CSS_SELECTOR, '#mainsrp-pager > div > div > div > div.total'))) #定位总页数，使用右键copy selector的方法找出参数名

         # 调用get_products

         get_products()

         return total.text

     except TimeoutError:

         return search()

 # 使用翻页输入框来翻页

 def next_page(page_number):

     # print('正在翻页',page_number) 用于phantomJS调试

     try:

         input1 = wait.until(

             EC.presence_of_element_located((By.CSS_SELECTOR, '#mainsrp-pager > div > div > div > div.form > input'))

         )

         submit = wait.until(

             EC.element_to_be_clickable((By.CSS_SELECTOR, '#mainsrp-pager > div > div > div > div.form > span.btn.J_Submit'))

         )

         input1.clear()

         input1.send_keys(page_number)

         submit.click()

         # 根据选择页面会高亮这个条件，来判断是否成功跳转

         wait.until(EC.text_to_be_present_in_element(

             (By.CSS_SELECTOR, '#mainsrp-pager > div > div > div > ul > li.item.active > span'), str(page_number)))

         # 调用get_products()

         get_products()

     except TimeoutError:

         next_page(page_number)

 # 解析信息

 def get_products():

     wait.until(EC.presence_of_element_located((By.CSS_SELECTOR, '#mainsrp-itemlist .items .item')))

     html = browser.page_source

     doc = pq(html)

     items = doc('#mainsrp-itemlist .items .item').items()

     for item in items:

         product = {

             'image': item.find('.pic .img').attr('src'),

             'price': item.find('.price').text(),

             'deal': item.find('.deal-cnt').text()[:-3],

             'title': item.find('.title').text(),

             'shop': item.find('.shop').text(),

             'location': item.find('.location').text()

         }

         print(product)

         # 保存数据到mongodb

         save_to_mongo(product)

 # 定义一个保存到mongodb的方法

 def save_to_mongo(result):

     try:

         if db[MON_TABLE].insert(result):

             print('存储到MONGODB成功', result)

     except Exception:

         print('存储到MONGODB失败', result)

 def main():

     try:

         # 输出100数字

         total = search()

         total = int(re.compile('(\d+)').search(total).group(1))

         # 调用翻页函数

         for i in range(2, total + 1):

             next_page(i)

     except Exception:

         print('出错了')

     finally:

         browser.close()

 if __name__ == '__main__':

     main()

2. config.py

 __author__ = 'Administrator'

 MONGO_URL = 'localhost'

 MONGO_DB = 'taobao'

 MON_TABLE = 'product'

 # 配置phantomJS

 SERVICE_ARGS = ['--load-images=false', '--disk-cache=true']

 KEYWORD = '美食'

方案2：上面这种方法经测试可正常运行，但是会一次性爬取全部数据，数据量较大且不能灵活控制抓取内容，下面代码基本实现方法如下

1. 把搜索的关键字直接放在url中

2. 分页抓取商品信息

3. 使用chrome的headless功能

 import pymongo

 from selenium import webdriver

 from selenium.common.exceptions import TimeoutException

 from selenium.webdriver.common.by import By

 from selenium.webdriver.support import expected_conditions as EC

 from selenium.webdriver.support.wait import WebDriverWait

 from pyquery import PyQuery as pq

 from config import *

 from urllib.parse import quote

 # browser = webdriver.Chrome()

 # browser = webdriver.PhantomJS(service_args=SERVICE_ARGS)

 chrome_options = webdriver.ChromeOptions()

 chrome_options.add_argument('--headless')

 browser = webdriver.Chrome(chrome_options=chrome_options)

 wait = WebDriverWait(browser, 10)

 client = pymongo.MongoClient(MONGO_URL)

 db = client[MONGO_DB]

 def index_page(page):

     """

     抓取索引页

     :param page: 页码

     """

     print('正在爬取第', page, '页')

     try:

         url = 'https://s.taobao.com/search?q=' + quote(KEYWORD)

         browser.get(url)

         if page > 1:

             #定位页码输入框

             input = wait.until(

                 EC.presence_of_element_located((By.CSS_SELECTOR, '#mainsrp-pager div.form > input')))

             ##定位页码跳转确定按钮

             submit = wait.until(

                 EC.element_to_be_clickable((By.CSS_SELECTOR, '#mainsrp-pager div.form > span.btn.J_Submit')))

             input.clear()

             input.send_keys(page)

             submit.click()

         """

         验证是否跳转到对应的页码

         只需要判断当前高亮的页码数是当前的页码数即可，可使用等待条件text_to_be_present_in_element,它会等待指定的文本出现在某一节点里面时即返回成功

         我们将高亮的页面节点对应的css选择器和当前要跳转的页面作为这个等待条件的参数，那么这个等待条件就会检测此页码节点是否为指定的页码数

         """

         wait.until(

             EC.text_to_be_present_in_element((By.CSS_SELECTOR, '#mainsrp-pager li.item.active > span'), str(page)))

         #等待商品信息加载，选择器'.m-itemlist .items .item'对应的页面内容就是每个商品的信息，如果加载成功，执行get_products()

         wait.until(EC.presence_of_element_located((By.CSS_SELECTOR, '.m-itemlist .items .item')))

         get_products()

     except TimeoutException:

         index_page(page)

 #解析商品列表

 def get_products():

     """

     提取商品数据

     """

     html = browser.page_source

     doc = pq(html)

     items = doc('#mainsrp-itemlist .items .item').items()

     for item in items:

         product = {

             'image': item.find('.pic .img').attr('data-src'),

             'price': item.find('.price').text(),

             'deal': item.find('.deal-cnt').text(), #成交量

             'title': item.find('.title').text(),

             'shop': item.find('.shop').text(),

             'location': item.find('.location').text()

         }

         print(product)

         save_to_mongo(product)

 def save_to_mongo(result):

     """

     保存至MongoDB

     :param result: 结果

     """

     try:

         if db[MONGO_COLLECTION].insert(result):

             print('存储到MongoDB成功')

     except Exception:

         print('存储到MongoDB失败')

 def main():

     """

     遍历每一页

     """

     for i in range(1, MAX_PAGE + 1):

         index_page(i)

     browser.close()

 if __name__ == '__main__':

     main()

对应的配置文件如下

MONGO_URL = 'localhost'

MONGO_DB = 'taobao'

MONGO_COLLECTION = 'products'

KEYWORD = 'ipad'

MAX_PAGE = 100

SERVICE_ARGS = ['--load-images=false', '--disk-cache=true']

爬虫实战4：用selenium爬取淘宝美食的更多相关文章

利用Selenium爬取淘宝商品信息
一. Selenium和PhantomJS介绍 Selenium是一个用于Web应用程序测试的工具,Selenium直接运行在浏览器中,就像真正的用户在操作一样.由于这个性质,Selenium也是一 ...
python3编写网络爬虫16-使用selenium 爬取淘宝商品信息
一.使用selenium 模拟浏览器操作爬取淘宝商品信息之前我们已经成功尝试分析Ajax来抓取相关数据,但是并不是所有页面都可以通过分析Ajax来完成抓取.比如,淘宝,它的整个页面数据确实也是通过A ...
PYTHON 爬虫笔记十:利用selenium+PyQuery实现淘宝美食数据搜集并保存至MongeDB（实战项目三）
利用selenium+PyQuery实现淘宝美食数据搜集并保存至MongeDB 目标站点分析淘宝页面信息很复杂的,含有各种请求参数和加密参数,如果直接请求或者分析Ajax请求的话会很繁琐.所以我们可 ...
Selenium爬取淘宝商品概要入mongodb
准备: 1.安装Selenium:终端输入 pip install selenium 2.安装下载Chromedriver:解压后放在…\Google\Chrome\Application\:如果是M ...
使用Selenium爬取淘宝商品
import pymongo from selenium import webdriver from selenium.common.exceptions import TimeoutExceptio ...
【Python爬虫案例学习】Python爬取淘宝店铺和评论
安装开发需要的一些库 (1) 安装mysql 的驱动:在Windows上按win+r输入cmd打开命令行,输入命令pip install pymysql,回车即可. (2) 安装自动化测试的驱动sel ...
使用scrapy+selenium爬取淘宝网
--***2019-3-27测试有效***---- 第一步: 打开cmd,输入scrapy startproject taobao_s新建一个项目. 接着cd 进入我们的项目文件夹内输入scrapy ...
【Python爬虫案例学习】python爬取淘宝里的手机报价并以价格排序
第一步: 先分析这个url,"?"后面的都是它的关键字,requests中get函数的关键字的参数是params,post函数的关键字参数是data, 关键字用字典的形式传进去,这 ...
关于爬虫的日常复习（10）—— 实战：使用selenium模拟浏览器爬取淘宝美食

随机推荐

使用Git将码云上的代码Clone至本地
1. 安装Git https://git-scm.com/book/zh/v2/%E8%B5%B7%E6%AD%A5-%E5%AE%89%E8%A3%85-Git Git的网站上有详细的分各种系统的安 ...
vector中resize()和reserve()的区别
先看看<C++ Primer>中对resize()函数两种用法的介绍: 1.resize(n) 调整容器的长度大小,使其能容纳n个元素. 如果n小于容器的当前的size,则删除多出来的元素 ...
73. Set Matrix Zeroes (Array)
Given a m x n matrix, if an element is 0, set its entire row and column to 0. Do it in place. Follow ...
ie11的仿真模式
1>在ie11的仿真模式中,所有版本的按钮都失效,解决方法:再ie的配置中,选项-高级-重置,然后重启ie11 程序员的基础教程:菜鸟程序员
win8上部署.net4.0程序到iis
在win8.1上默认的iis版本为8.5版,不做任何配置回报3个错误, 一下是错误提示内容及解决方案 1>HTTP 错误 404.3 – Not Found由于扩展配置问题而无法提供您请求的页面 ...
python二叉树染色-有严重BUG
#coding:utf-8 ''' 二叉树涂黑输入: 5 2 1 -1 4 2 -1 5 4 -1 3 1 1 2 输出: 3 第二题是:斗地主 ''' import sys b=list() cl ...
Spring源码解析 - BeanFactory
BeanFactory是Spring实现依赖注入的核心接口.提供应用的统一配置注册功能,实现业务开发解偶.使用getBean可以代替单例,原型设计模式. 顶重要的BeanFactory里注释写得太好了 ...
Restful风格wcf调用3——Stream
写在前面上篇文章介绍了restful接口的增删改查,本篇文章将介绍,如何通过数据流进行文件的上传及下载操作. 系列文章 Restful风格wcf调用 Restful风格wcf调用2——增删改查一个 ...
<网络攻防实践> 课程总结20169216
课程总结20169216 每周作业链接汇总第一周作业:Linux基础入门(1-5).基本概念及操作第二周作业:linux基础入门(6-11).网络攻防技术概述网络攻防试验环境搭构.Kali教学视频 ...
windows server2012怎样关机怎样重启-详细教程
| 浏览:1991 | 更新:2014-12-15 17:33 1 2 3 4 5 6 分步阅读百度经验:jingyan.baidu.com windows server2012和以往有些不同,关机 ...

爬虫实战4：用selenium爬取淘宝美食

爬虫实战4：用selenium爬取淘宝美食的更多相关文章

随机推荐

热门专题