selenium实现百度图片爬取

因为是百度图片是瀑布流ajax异步上传的数据，所以这里用到抓包工具来抓取链接（fiddler）

好了直接上代码，

 from selenium import webdriver

 from selenium.webdriver.common.by import By

 import requests,time

 from queue import Queue

 from urllib import request

 import os,gevent

 from lxml import etree

 def get_img(html):

     html = html.get()

     html = etree.HTML(html)

     img_url = html.xpath('//div[@id="imgid"]/div[last()]//li/@data-objurl')

     # print(img_url)

     path = './baidupic/'

     if not os.path.exists(path):

         os.makedirs(path)

     for url in img_url:

         print(url)

         # response = requests.get(url)

         # img = response.content

         try:

             fname = url.split('/')[-1]

             request.urlretrieve(url,os.path.join(path, fname))

             print('下载成功')

         except:

             print('图片不存在')

 def get_page():

     #创建数据队列

     q = Queue()

     #百度图片搜索地址

     base_url = 'https://image.baidu.com/'

     #返回浏览器对象

     browser = webdriver.Chrome(executable_path=r'C:\Users\zhaozhi\Desktop\chromedriver.exe')

     #模拟访问

     browser.get(base_url)

     #输入搜索关键字

     browser.find_element_by_id('kw').send_keys('美女')

     #按键

     browser.find_element_by_class_name('s_search').click()

     # time.sleep(2)

     for i in range(10):

         browser.execute_script('window.scrollTo(0,document.body.scrollHeight)')

         # time.sleep(2)

         # html = browser.page_source

         q.put(browser.page_source)

     # browser.close()

     # print(browser.page_source)

     g_list=[]

     for i  in range(20):

         g= gevent.spawn(get_img,q)

         g_list.append(g)

     gevent.joinall(g_list)

 # browser.save_screenshot('baidupic.png')

 # print(browser.page_source)

 # browser.find_element(By_)

 if __name__ == '__main__':

     get_page()

selenium实现百度图片爬取的更多相关文章

爬虫07 /scrapy图片爬取、中间件、selenium在scrapy中的应用、CrawlSpider、分布式、增量式
爬虫07 /scrapy图片爬取.中间件.selenium在scrapy中的应用.CrawlSpider.分布式.增量式目录爬虫07 /scrapy图片爬取.中间件.selenium在scrapy ...
Python爬虫入门教程 26-100 知乎文章图片爬取器之二
1. 知乎文章图片爬取器之二博客背景昨天写了知乎文章图片爬取器的一部分代码,针对知乎问题的答案json进行了数据抓取,博客中出现了部分写死的内容,今天把那部分信息调整完毕,并且将图片下载完善到代码中 ...
使用Selenium&PhantomJS的方式爬取代理
前面已经爬取了代理,今天我们使用Selenium&PhantomJS的方式爬取快代理 :快代理 - 高速http代理ip每天更新. 首先分析一下快代理,如下使用谷歌浏览器,检查,发现每个代理 ...
4k图片爬取+中文乱码
4k图片爬取+中文乱码此案例有三种乱码解决方法,推荐第一种 4k图片爬取其实和普通图片爬取的过程是没有本质区别的 import requests import os from lxml import ...
scrapy之360图片爬取
#今日目标 **scrapy之360图片爬取** 今天要爬取的是360美女图片,首先分析页面得知网页是动态加载,故需要先找到网页链接规律, 然后调用ImagesPipeline类实现图片爬取 *代码实 ...
[Python_scrapy图片爬取下载]
welcome to myblog Dome地址爬取某个车站的图片 item.py 中 1.申明item 的fields class PhotoItem(scrapy.Item): # define ...
Python实训day07pm【Selenium操作网页、爬取数据-下载歌曲】
练习1-爬取歌曲列表任务:通过两个案例,练习使用Selenium操作网页.爬取数据.使用无头模式,爬取网易云的内容. ''' 任务:通过两个案例,练习使用Selenium操作网页.爬取数据. 使用无 ...
selenium+chrome浏览器驱动-爬取百度图片
百度图片网页中中,当页面滚动到底部,页面会加载新的内容. 我们通过selenium和谷歌浏览器驱动,执行js,是浏览器不断加载页面,通过抓取页面的图片路径来下载图片. from selenium im ...
Scrapy项目 - 实现百度贴吧帖子主题及图片爬取的爬虫设计
要求编写的程序可获取任一贴吧页面中的帖子链接,并爬取贴子中用户发表的图片,在此过程中使用user agent 伪装和轮换,解决爬虫ip被目标网站封禁的问题.熟悉掌握基本的网页和url分析,同时能灵活使 ...

随机推荐

2019 Multi-University Training Contest 6
A.Salty Fish upsolved 题意偷苹果,每个节点上有\(a[i]\)个苹果,在某些位置有摄像机,看管子树里距离不超过\(k[i]\)的节点,损坏摄像机有\(c[i]\)代价,求最大收 ...
CodeForces 939E　Maximize
Maximize 题意:整个程序有2种操作,操作1将一个元素放入集合S中,且保证最新插入的元素不小于上一次的元素, 操作2 找到集合S中的某个子集合, 使得集合中最大的元素减去平均数的值最大. 题解 ...
2018年全国多校算法寒假训练营练习比赛（第二场） B TaoTao要吃鸡 01背包变形题
链接:https://www.nowcoder.com/acm/contest/74/B来源:牛客网 Taotao的电脑带不动绝地求生,所以taotao只能去玩pc版的荒野行动了, 和绝地求生一样,游 ...
CH4301 Can you answer on these queries III 题解
给定长度为N的数列A,以及M条指令 (N≤500000, M≤100000),每条指令可能是以下两种之一: "2 x y",把 A[x] 改成 y. "1 x y&quo ...
题解 UVA11000 【Bee】
传送门 [题目描述] 在非洲有一种非常特殊的蜜蜂.每年,这种蜜蜂的一只雌蜂生育一只雄蜂,而一只雄蜂生育一只雌蜂和一只雄蜂,生育后它们都会死去!现在科学家们意外地发现了这一特殊物种的一只神奇的雌蜂,她 ...
PHP-02.文件上传、php保存／转移上传的文件、常见的网络传输协议、请求报文及属性、响应报文及属性
关系数组 array("key"=>"value",...) ; get没有数据大小的限制 post上传大小没有限制不指定上传方式,默认是get 文件上 ...
JS-特效～ 04. client对象、网页可视区域的宽高、client / offset / scroll 三大家族的区别、冒泡事件、事件委托、获取内嵌式和外链式属性getStyle（ele，attr）；、缓动动画封装
知识点: 模拟滚动条的解除事件问题 : event内置对象,包含了大量事件: page兼容性: pageX || clientX + scool().top : if (true === a)tr ...
open的正确使用
open一个对象的时候,不确定他是图片还是文本啊 #----------------------- import io with open('photo.jpg', 'rb') as inf: ...
Python作业本——第4章列表
课后习题: 1.[]是一个空列表 2. spam.insert(3, 'hello') 错,应为:spam[2] = 'hello' 3.['d'] 'd' 4.['d'] 'd' 5.[ ...
大数据Hadoop基础入门到精通
1.hadoop前世今生: 1) 搜索引擎:网络爬虫+索引服务器(生成索引+检索) 2) Doung Cutting 3) Nutch a.分布式存储 b.分布式计算 4)GFS论文 doung c ...

selenium实现百度图片爬取

selenium实现百度图片爬取的更多相关文章

随机推荐

热门专题