Scrapy——將爬取圖片下載到本地

1. Spider程序：

 1 import scrapy, json

 2 from UnsplashImageSpider.items import ImageItem

 3

 4 class UnsplashImageSpider(scrapy.Spider):

 5     # 定义Spider的名称

 6     name = 'unsplash_image'

 7     allowed_domains = ['unsplash.com']

 8     # 定义起始页面

 9     start_urls = ['https://unsplash.com/napi/photos?page=1&per_page=12']

10     def __init__ (self):

11         self.page_index = 1

12

13     def parse(self, response):

14         # 解析服务器响应的JSON字符串

15         photo_list = json.loads(response.text) # ①

16         # 遍历每张图片

17         for photo in photo_list:

18             item = ImageItem()

19             item['image_id'] = photo['id']

20             item['download'] = photo['links']['download']

21             yield item

22

23         self.page_index += 1

24         # 获取下一页的链接

25         next_link = 'https://unsplash.com/napi/photos?page='\

26             + str(self.page_index) + '&per_page=12'

27         # 继续获取下一页的图片

28         yield scrapy.Request(next_link, callback=self.parse)

2. 在Pipeline中使用urllib.request包直接下載圖片:

 1 from urllib.request import *

 2

 3 class UnsplashimagespiderPipeline(object):

 4     def process_item(self, item, spider):

 5         # 每个item代表一个要下载的图片

 6         print('----------' + item['image_id'])

 7         real_url = item['download'] + "?force=true"

 8         try:

 9             pass

10             # 打开URL对应的资源

11             with urlopen(real_url) as result:

12                 # 读取图片数据

13                 data = result.read()

14                 # 打开图片文件

15                 with open("images/" + item['image_id'] + '.jpg', 'wb+') as f:

16                     # 写入读取的数据

17                     f.write(data)

18         except:

19             print('下载图片出现错误' % item['image_id'])

Scrapy——將爬取圖片下載到本地的更多相关文章

php圖片中寫入字符串然後生成圖片下載到本地
<?php /** * 生成卡片得類 * Enter description here ... * @author perry * @time 2014-03-03 10:02:20 */ cl ...
简单的scrapy实战:爬取腾讯招聘北京地区的相关招聘信息
简单的scrapy实战:爬取腾讯招聘北京地区的相关招聘信息简单的scrapy实战:爬取腾讯招聘北京地区的相关招聘信息系统环境:Fedora22(昨天已安装scrapy环境) 爬取的开始URL:ht ...
使用scrapy框架爬取自己的博文（2）
之前写了一篇用scrapy框架爬取自己博文的博客,后来发现对于中文的处理一直有问题- - 显示的时候 [u'python\u4e0b\u722c\u67d0\u4e2a\u7f51\u9875\u76 ...
Python的scrapy之爬取链家网房价信息并保存到本地
因为有在北京租房的打算,于是上网浏览了一下链家网站的房价,想将他们爬取下来,并保存到本地. 先看链家网的源码..房价信息都保存在 ul 下的li 里面爬虫结构: 其中封装了一个数据库处理模 ...
爬虫框架Scrapy入门——爬取acg12某页面
1.安装1.1自行安装python3环境1.2ide使用pycharm1.3安装scrapy框架2.入门案例2.1新建项目工程2.2配置settings文件2.3新建爬虫app新建app将start_ ...
Scrapy+selenium爬取简书全站
Scrapy+selenium爬取简书全站环境 Ubuntu 18.04 Python 3.8 Scrapy 2.1 爬取内容文字标题作者作者头像发布日期内容文章连接文章ID 思路分 ...
爬虫07 /scrapy图片爬取、中间件、selenium在scrapy中的应用、CrawlSpider、分布式、增量式
爬虫07 /scrapy图片爬取.中间件.selenium在scrapy中的应用.CrawlSpider.分布式.增量式目录爬虫07 /scrapy图片爬取.中间件.selenium在scrapy ...
【Scrapy(四)】scrapy 分页爬取以及xapth使用小技巧
scrapy 分页爬取以及xapth使用小技巧这里以爬取www.javaquan.com为例: 1.构建出下一页的url: 很显然通过dom树,可以发现下一页所在的a标签 2.使用scrapy的 ...
python 使用selenium模块爬取同一个url下不同页的内容（浏览器模拟人工翻页）
页面翻页,下一页可能是一个新的url 也有可能是用js进行页面跳转,url不变,解决方法是实现浏览器模拟人工翻页目标:爬取同一个url下不同页的数据(上述第二种情况) url:http://www. ...

随机推荐

(第一篇)记一次python分布式web开发（利用docker）
作者:落阳日期:2020-12-23 在一次项目开发中,决定使用docker+nginx+flask+mysql的技术栈来开发,用此系列文章记录开发的过程. 系列文章,当前为第一篇,记录一次pyth ...
draggable()拖拽时限制移动区域
jQuery-UI为我们提供了一个非常便捷的拖拽方法:draggable(),在使用此方法时,我们可能会希望控件只在某一区域中移动,不能被拖出边界,这样的话我们可以使用下面的方法: 调用draggab ...
k8s之深入解剖Pod（三）
目录: Pod的调度 Pod的扩容和缩容 Pod的滚动升级一.Pod的调度 Pod只是容器的载体,通常需要通过RC.Deployment.DaemonSet.Job等对象来完成Pod的调度和自动控制 ...
datagrid 根据指定参数重新加载数据
$('#statisticalRecordList').datagrid('reload',{ start_date:$('#dd1').datebox('getValue'), end_date: ...
[LeetCode]501. Find Mode in Binary Search Tree二叉搜索树寻找众数
这次是二叉搜索树的遍历感觉只要和二叉搜索树的题目,都要用到一个重要性质: 中序遍历二叉搜索树的结果是一个递增序列: 而且要注意,在递归遍历树的时候,有些参数如果是要随递归不断更新(也就是如果递归返回 ...
RTC_Configuration
Void RTC_Configuration(void)// 实时时钟的初始化配置 { RCC_APB1PeriphClockCmd(RCC_APB1Periph_PWR | RCC_APB1Peri ...
有关em的个人理解
个人的感觉关键就是在那个font-size, 对于一开始没有设置font-size的可以默认那就是16px 后面的所有的基础都应该是在前面距离他最近的那个font-size的大小作为1em进行设置 ...
APP逆向案例---x会app
步骤一抓个包其中m_d,m_e为加密参数步骤二(已经看了是360加固我们脱壳一下) # Author: hluwa <hluwa888@gmail.com> # HomePage: ...
2020再见&新的计划(建立Android体系架构)
2020,再见关于2020,我心中有四个关键词: 疫情年初突如其来的疫情,打破了原本生活的节奏,也没想到会笼罩全世界整整一年,希望这个世界早点好起来吧. 科比初三的早晨,噩耗传来,我一度不敢相信 ...
文档驱动开发模式在 AIMS 中的应用与实践
摘要:程序员常会说:我最讨厌别人写的代码没有文档,我也最讨厌自己需要写文档. 有一个很老的梗: 我最讨厌别人写的代码没有文档,我也最讨厌自己需要写文档. 有这种想法的程序员应该算是一个老鸟了,对于大多 ...

Scrapy——將爬取圖片下載到本地

Scrapy——將爬取圖片下載到本地的更多相关文章

随机推荐

热门专题