scrapy爬虫爬取小姐姐图片（不羞涩）

这个爬虫主要学习scrapy的item Pipeline

是时候搬出这张图了：

当我们要使用item Pipeline的时候，要现在settings里面取消这几行的注释

我们可以自定义Item Pipeline，只需要实现指定的方法，其中必须要实现的一个方法是： p

　　process_item(item,spider)

另外还有几个方法我们有时候会用到

　　open_spider(spider)

　　close_spider(spider)

　　from_crawler(cls,crawler)

在不羞涩的主页（https://www.buxiuse.com/）我们使用xpath进行分析可以得到每一张小姐姐图片的url，我们将每一页urls作为一个item对象返回，并且找到下一页的链接，持续爬取

class IndexSpider(scrapy.Spider):

    name = 'index'

    allowed_domains = ['buxiuse.com']

    start_urls = ['https://www.buxiuse.com/?page=1']

    base_domain="https://www.buxiuse.com"

    def parse(self, response):

        image_urls=response.xpath('//ul[@class="thumbnails"]/li//img/@src').getall()

        next_url=response.xpath('//li[@class="next next_page"]/a/@href').get()

        item=BuxiuseItem(image_urls=image_urls)

        yield item

        if not next_url:

            return

        else:

            yield scrapy.Request(self.base_domain+next_url)

对于yield的item对象，因为只返回了一个urls，所以我们在items进行设置

class BuxiuseItem(scrapy.Item):

    # define the fields for your item here like:

    # name = scrapy.Field()

    image_urls=scrapy.Field()

　　这样在刚才的index文件里面，才可以新建BuxiuseItem对象，

item=BuxiuseItem(image_urls=image_urls)

　　当然要先在index导入BuxiuseItem这个类

接着在pipeline里面我们处理接收到的Item和下载图片

我们先创建一个image的文件夹储存爬取到的图片，使用os.mkdir(self.path)

这个self.path由我们自己设定，这里学到了一个知识点：os.path.dirname(__file__)可以显示当前文件所在的位置

我们先输出一下

使用os.path.dirname(os.path.dirname(__file__))可以返回到上一级目录位置

我们使用这个方法控制储存的目录，如果是其他比较远的位置就使用绝对路径吧。

因为我是python2的环境，使用

urllib.urlretrieve(link,os.path.join(self.path,image_name))

　　将链接上的图片以指定的文件名保存在指定位置上

所以pipeline里面的代码就是

import os

import urllib

from scrapy.pipelines.images import ImagesPipeline

import settings

i=1

class BuxiusePipeline(object):

    def __init__(self):

        self.path=os.path.join(os.path.dirname(os.path.dirname(__file__)),'images')

        if not os.path.exists(self.path):

            os.mkdir(self.path)

    def process_item(self, item, spider):

        global i

        link_list=item['image_urls']

        for link in link_list:

            print i

            image_name=str(i)+".jpg"

            urllib.urlretrieve(link,os.path.join(self.path,image_name))

            i=i+1

        return item

　　输出i是为了让我能看到脚本还在正常下载，免得被网站ban掉了还不知道。

运行一下看看效果：

可以看到小姐姐的图片已经被下载下来了，并且按照i的编号整齐排列，完事。

github代码：

https://github.com/Cl0udG0d/scrapy_demo/tree/master/buxiuse

scrapy爬虫爬取小姐姐图片（不羞涩）的更多相关文章

使用Python爬虫爬取网络美女图片
代码地址如下:http://www.demodashi.com/demo/13500.html 准备工作安装python3.6 略安装requests库(用于请求静态页面) pip install ...
使用scrapy爬虫,爬取17k小说网的案例-方法一
无意间看到17小说网里面有一些小说小故事,于是决定用爬虫爬取下来自己看着玩,下图这个页面就是要爬取的来源. a 这个页面一共有125个标题,每个标题里面对应一个内容,如下图所示下面直接看最核心spi ...
<scrapy爬虫>爬取校花信息及图片
1.创建scrapy项目 dos窗口输入: scrapy startproject xiaohuar cd xiaohuar 2.编写item.py文件(相当于编写模板,需要爬取的数据在这里定义) # ...
python爬虫——爬取NUS-WIDE数据库图片
实验室需要NUS-WIDE数据库中的原图,数据集的地址为http://lms.comp.nus.edu.sg/research/NUS-WIDE.htm 由于这个数据只给了每个图片的URL,所以需 ...
<scrapy爬虫>爬取360妹子图存入mysql(mongoDB还没学会,学会后加上去)
1.创建scrapy项目 dos窗口输入: scrapy startproject images360 cd images360 2.编写item.py文件(相当于编写模板,需要爬取的数据在这里定义) ...
<scrapy爬虫>爬取猫眼电影top100详细信息
1.创建scrapy项目 dos窗口输入: scrapy startproject maoyan cd maoyan 2.编写item.py文件(相当于编写模板,需要爬取的数据在这里定义) # -*- ...
使用scrapy爬虫,爬取今日头条搜索吉林疫苗新闻（scrapy+selenium+PhantomJS）
这一阵子吉林疫苗案,备受大家关注,索性使用爬虫来爬取今日头条搜索吉林疫苗的新闻依然使用三件套(scrapy+selenium+PhantomJS)来爬取新闻以下是搜索页面,得到吉林疫苗的搜索信息, ...
<scrapy爬虫>爬取quotes.toscrape.com
1.创建scrapy项目 dos窗口输入: scrapy startproject quote cd quote 2.编写item.py文件(相当于编写模板,需要爬取的数据在这里定义) import ...
<scrapy爬虫>爬取腾讯社招信息
1.创建scrapy项目 dos窗口输入: scrapy startproject tencent cd tencent 2.编写item.py文件(相当于编写模板,需要爬取的数据在这里定义) # - ...

随机推荐

索引--mysql 数据库Load data大量数据时性能因素之一
发现load data infile 插入数据时越来越慢,后来发现是因为创建表时有创建索引的动作. 把索引创建删除掉之后,导入很迅速,导入后再创建索引,效率果有提高.
GitLab集成Jenkins、Harborn构建pipeline流水线任务
一.计划在jenkins中构建流水线任务时,从GitLab当中拉取代码,通过maven打包,然后构建dokcer镜像,并将镜像推送至harbor当中.Jenkins中含开发.测试.生产视图,开发人员 ...
Why use MSIX message signal interrupt
处理一个低版本内核中断向量表不够问题:__assign_irq_vector 关联irq 和 vector失败问题: (bug还没解决先记录一下吧) 同时先学习一下MSI-X:MSI, message ...
linux 进程间通信共享内存 shmat
系统调用mmap()通过映射一个普通文件实现共享内存.系统V则是通过映射特殊文件系统shm中的文件实现进程间的共享内存通信.也就是说,每个共享内存区域对应特殊文件系统shm中的一个文件(这是通过shm ...
linux 图解笔记
rgw使用boto3生成可以访问的预签名url
前言如果想访问一个ceph里面的s3地址,但是又不想直接提供secrect key的时候,可以通过预签名的方式生成url 生成方法下载boto3 脚本如下 cat s3.py import bot ...
每天一个linux命令之stat
[Linux]Linux下使用stat命令所显示出来的三个时间转 https://blog.csdn.net/pointer_y/article/details/54347968 在linux系统下 ...
Linux学习 - 02 使用 - Centos8 - 网络配置相关
『Centos8 网络配置』题外话:最近太忙,利用仅有的周末空闲时间记录点东西,草率了. 问题1:安装 Centos8.2 minimal 过程中,只是设置了 WiFi的静态IP,没有进行[以太网] ...
vue中实时监听移动端屏幕高度（采坑后实践）
最近做微信公众号活动,需要首页往input中输入内容,点击input软键盘tabbar被顶起来,网上借鉴很多(踩了许多坑)最后自己实践出来. <--!将手机屏幕的默认高度和实时高度获取--> ...
解决adober reader已停止工作的问题
公司电脑出现打开pdf阅读器后没到1分钟就闪退,应该是adobe做了什么正版审核策略,让安装了这个软件的电脑自动连接到adobe服务器验证导致. 解决方法:在C:\Windows\System32\d ...

scrapy爬虫爬取小姐姐图片（不羞涩）

scrapy爬虫爬取小姐姐图片（不羞涩）的更多相关文章

随机推荐

热门专题