scrapy框架抓取表情包/(python爬虫学习)

抓取网址：https://www.doutula.com/photo/list/?page=1

1.创建爬虫项目：scrapy startproject biaoqingbaoSpider

2.创建爬虫文件：scrapy genspider biaoqingbao doutula.com

xpath提取图片链接和名字：

提取网址后缀，用于实现自动翻页

3.编写爬虫文件：

# -*- coding: utf-8 -*-

import scrapy

import requests

class BiaoqingbaoSpider(scrapy.Spider):

    name = 'biaoqingbao'

    allowed_domains = ['doutula.com']

    start_urls = ['http://www.doutula.com/photo/list/?page=1']

    def parse(self, response):

        #提取地址和图片名称

        pictureUrls = response.xpath("//a[@class='col-xs-6 col-sm-3']/img/@data-original").extract()

        pictureName = response.xpath("//a[@class='col-xs-6 col-sm-3']/p/text()").extract()

        #提取网址后缀，用于实现自动翻页

        next_page = response.xpath("//li/a[@aria-label='Next »']/@href").extract_first()

        for i in range(len(pictureUrls)):

            url = pictureUrls[i]

            name = pictureName[i]

            self.getPicture(url=url, name=name) #对每个图片调用getPicture下载图片并命名

        #自动翻页

        if next_page:

            next_url = response.urljoin(next_page) #返回新的网址

            yield scrapy.Request(next_url, callback=self.parse) #回调函数

    #自定义函数，用于下载图片，因为刚学太菜，就只有先用requests下载了

    def getPicture(self, url, name):

        response = requests.get(url)

        suffix = url.split(".")[-1] #提取图片链接地址的后缀，因为有jpg和gif图片格式

        #二进制格式写入图片

        with open("biaoqingbaoSpider/spiders/images/"+name+ "." + suffix, "wb") as fp:

            fp.write(response.content)

4.执行爬虫文件：scrapy crawl biaoqingbao

切记：觉得爬差不多ctrl + c中止，不中止它会自动爬取到最后一页（3000页），当然也可以自己在代码里设置爬取多少页

5.结果：

scrapy框架抓取表情包/(python爬虫学习)的更多相关文章

利用python scrapy 框架抓取豆瓣小组数据
因为最近在找房子在豆瓣小组-上海租房上找,发现搜索困难,于是想利用爬虫将数据抓取. 顺便熟悉一下Python. 这边有scrapy 入门教程出处:http://www.cnblogs.com/txw1 ...
scrapy框架简介和基础应用(python爬虫)
一.什么是scrapy? scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架,非常出名,非常强悍,所谓的框架就是一个已经被集成了各种功能(高性能异步下载,队列,分布式,持久化等)的具有 ...
Python爬虫学习==>第十章：使用Requests+正则表达式爬取猫眼电影
学习目的: 通过一个一个简单的爬虫应用,初窥门径. 正式步骤 Step1:流程框架抓取单页内容:利用requests请求目标站点,得到单个页面的html代码,返回结果: 正则表达式分析:根据html ...
使用scrapy框架爬取自己的博文（2）
之前写了一篇用scrapy框架爬取自己博文的博客,后来发现对于中文的处理一直有问题- - 显示的时候 [u'python\u4e0b\u722c\u67d0\u4e2a\u7f51\u9875\u76 ...
tcpdump抓取HTTP包
tcpdump抓取HTTP包 tcpdump -XvvennSs 0 -i eth0 tcp[20:2]=0x4745 or tcp[20:2]=0x4854 0x4745为"GET&quo ...
利用Fiddler抓取websocket包
一.利用fiddler抓取websockt包打开Fiddler,点开菜单栏的Rules,选择Customize Rules... 这时会打开CustomRules.js文件,在class Handl ...
使用wireshark抓取TCP包分析1
使用wireshark抓取TCP包分析1 前言介绍目的准备工作传输创建连接握手生成密钥发送数据断开连接结论前言介绍本篇文章是使用wireshrak对某个https请求的tcp ...
【转载】ASP.NET以Post方式抓取远程网页内容类似爬虫功能
使用HttpWebRequest等Http相关类,可以在应用程序中或者网站中模拟浏览器发送Post请求,在请求带入相应的Post参数值,而后请求回远程网页信息.实现这一功能也很简单,主要是依靠Http ...
手机通过Charles抓取https包
因为fiddler不能在mac上使用,而Charles是跨平台的,可以在mac上使用,所以需要了解一下Charles的使用安装破解版Charles 下载破解版包,先启动一次未破解版的Ch ...

随机推荐

Spring高频面试题，你能答的上哪些？（高级篇）
1.什么是 Spring 框架?Spring 框架有哪些主要模块? 2.使用 Spring 框架能带来哪些好处? 3.什么是控制反转(IOC)?什么是依赖注入? 4.请解释下 Spring 框架中的 ...
PHP setcookie 网络函数
setcookie - 发送 Cookie. 语法: setcookie ( string $name [, string $value = "" [, int $expire = ...
工具类ToastUtil 避免在子线程中使用抛异常 "Can't create handler inside thread that has not called Looper.prepare()"
package com.example.kbr.utils; import android.view.Gravity; import android.widget.Toast; import io.r ...
[收藏]Dubbo官方资料
首页 || 下载 || 用户指南 || 开发者指南 || 管理员指南 || 培训文档 || 常见问题解答 || 发布记录 || 发展路线 || 社区 English ...
centos7中python3.6报错ModuleNotFoundError: No module named '_ssl' 或者 Max retries exceeded with url: / (Caused by SSLError("Can't connect to HTTPS URL because the SSL module is not available.",))
如果在运行爬虫时报此错:requests.exceptions.SSLError: HTTPSConnectionPool(host='www.baidu.com', port=443): Max r ...
苹果手机Chrome浏览器显示input:disabled时字体颜色总是为浅灰色
今天被测试人员提了个bug:苹果手机浏览器(Chrome)打开h5,控件在input:disabled的样式始终是浅灰色,要求改成黑色.测试对比:1.在多个pc浏览器上浏览input:disabled ...
[Go] gocron源码阅读-go语言的结构体
结构体类型 type 名字 struct{},下面这段是github.com/urfave/cli包里的代码,声明了一个App的结构体类型 type App struct { // The name ...
Mybatis逆向工程中的 mybatis-generator:generate 代码生成器的使用
使用逆向工程可以根据数据库的表名字生成pojo层(实体类),mapper层(dao层,直接与底层的XML中映射相关),XML(映射执SQL语句) 下面请看具体生成步骤 1. 点击generatorCo ...
mean shift聚类算法的MATLAB程序
mean shift聚类算法的MATLAB程序凯鲁嘎吉 - 博客园 http://www.cnblogs.com/kailugaji/ 1. mean shift 简介 mean shift, 写的 ...
react中antd的表格自定义展开
antd的表格官方案例中给出的都是固定的图表展开,在做需求的时候,需要使用点击最后一列,然后出现展开内容,实现效果图如下在最开始设置一个全局变量 const keys = [];在设置列参数的函数中 ...

scrapy框架抓取表情包/(python爬虫学习)

scrapy框架抓取表情包/(python爬虫学习)的更多相关文章

随机推荐

热门专题