scrapy爬取二级页面的内容

1.定义数据结构item.py文件

# -*- coding: utf-8 -*-

'''

field: item.py

'''

# Define here the models for your scraped items

#

# See documentation in:

# https://doc.scrapy.org/en/latest/topics/items.html

import scrapy

class TupianprojectItem(scrapy.Item):

    # define the fields for your item here like:

    # name = scrapy.Field()

    # 图片标题

    title = scrapy.Field()

    # 发布时间

    publish_time = scrapy.Field()

    # 浏览量

    look = scrapy.Field()

    # 收藏量

    collect = scrapy.Field()

    # 下载量

    download = scrapy.Field()

    # 图片链接

    image_url = scrapy.Field()

2.爬虫文件

# -*- coding: utf-8 -*-

import scrapy

from tupianproject.items import TupianprojectItem

class ImageSpider(scrapy.Spider):

    name = 'image'

    allowed_domains = ['699pic.com']

    start_urls = ['http://699pic.com/people-1-0-0-0-0-0-0.html']

    url = 'http://699pic.com/people-{}-0-0-0-0-0-0.html'

    page = 1

    def parse(self, response):

        # 在一级页面中，应该将所有的图片详情页面的链接获取到

        image_detail_url_list = response.xpath('//div[@class="list"]/a/@href').extract()

        # pass

        # 遍历详情页面，向每一个详情页面发送请求即可

        for image_detail_url in image_detail_url_list:

            yield scrapy.Request(url=image_detail_url, callback=self.parse_detail)

        # 接着发送其他请求

        if self.page <= 3:

            self.page += 1

            url = self.url.format(self.page)

            yield scrapy.Request(url=url, callback=self.parse)

    def parse_detail(self, response):

        # 创建一个item对象

        item = TupianprojectItem()

        # 提取图片的每一个信息

        # title

        item['title'] = response.xpath('//div[@class="photo-view"]/h1/text()').extract_first()

        # 发布时间

        item['publish_time'] = response.xpath('//div[@class="photo-view"]/div/span[@class="publicityt"]')[0].xpath('string(.)').extract_first()

        # 获取浏览量

        item['look'] = response.xpath('//div[@class="photo-view"]/div/span[@class="look"]/read/text()').extract_first()

        # 获取收藏量

        item['collect'] = response.xpath('//div[@class="photo-view"]/div/span[@class="collect"]')[0].xpath('string(.)').extract_first()

        # 获取下载量

        item['download'] = response.xpath('//div[@class="photo-view"]/div/span[@class="download"]')[0].xpath('string(.)').extract_first().strip('\n\t')

        # 获取图片的链接

        item['image_url'] = response.xpath('//div[@class="huabu"]//img/@src').extract_first()

        # 将item发送出去

        yield item

3.管道文件

# -*- coding: utf-8 -*-

'''

filed: pipelines.py

'''

s

# Define your item pipelines here

#

# Don't forget to add your pipeline to the ITEM_PIPELINES setting

# See: https://doc.scrapy.org/en/latest/topics/item-pipeline.html

import json

import urllib.request

import os

class TupianprojectPipeline(object):

    def open_spider(self, spider):

        self.fp = open('tupian.json', 'w', encoding='utf8')

    def process_item(self, item, spider):

        d = dict(item)

        string = json.dumps(d, ensure_ascii=False)

        self.fp.write(string + '\n')

        # 下载图片

        self.download(item)

        return item

    def download(self, item):

        dirname = './people'

        suffix = item['image_url'].split('.')[-1]

        filename = item['title'] + '.' + suffix

        filepath = os.path.join(dirname, filename)

        urllib.request.urlretrieve(item['image_url'], filepath)

    def close_spider(self, spider):

        self.fp.close()

scrapy(四): 爬取二级页面的内容的更多相关文章

scrapy框架爬取多级页面
spides.py # -*- coding: utf-8 -*- import scrapy from weather.items import WeatherItem from scrapy.cr ...
[scrapy]实例:爬取jobbole页面
工程概览: 创建工程 scrapy startproject ArticleSpider 创建spider cd /ArticleSpider/spiders/ 新建jobbole.py # -*- ...
Scrapy 框架使用 selenium 爬取动态加载内容
使用 selenium 爬取动态加载内容开启中间件 DOWNLOADER_MIDDLEWARES = { 'wangyiPro.middlewares.WangyiproDownloaderMidd ...
Scrapy爬取静态页面
Scrapy爬取静态页面安装Scrapy框架: Scrapy是python下一个非常有用的一个爬虫框架 Pycharm下: 搜索Scrapy库添加进项目即可终端下: #python2 sudo p ...
scrapy模拟浏览器爬取验证码页面
使用selenium模块爬取验证码页面,selenium模块需要另外安装这里不讲环境的配置,我有一篇博客有专门讲ubuntn下安装和配置模拟浏览器的开发 spider的代码 # -*- coding: ...
【Scrapy(四)】scrapy 分页爬取以及xapth使用小技巧
scrapy 分页爬取以及xapth使用小技巧这里以爬取www.javaquan.com为例: 1.构建出下一页的url: 很显然通过dom树,可以发现下一页所在的a标签 2.使用scrapy的 ...
Scrapy+selenium爬取简书全站
Scrapy+selenium爬取简书全站环境 Ubuntu 18.04 Python 3.8 Scrapy 2.1 爬取内容文字标题作者作者头像发布日期内容文章连接文章ID 思路分 ...
使用scrapy爬虫,爬取17k小说网的案例-方法二
楼主准备爬取此页面的小说,此页面一共有125章我们点击进去第一章和第一百二十五章发现了一个规律我们看到此链接的 http://www.17k.com/chapter/271047/6336386 ...
简单的scrapy实战:爬取腾讯招聘北京地区的相关招聘信息
简单的scrapy实战:爬取腾讯招聘北京地区的相关招聘信息简单的scrapy实战:爬取腾讯招聘北京地区的相关招聘信息系统环境:Fedora22(昨天已安装scrapy环境) 爬取的开始URL:ht ...

随机推荐

Python报错：SyntaxError: (unicode error) 'unicodeescape' codec can't decode bytes in position 2-3: truncated \UXXXXXXXX escape
运行python文件的时候报错: SyntaxError: (unicode error) 'unicodeescape' codec can't decode bytes in position 2 ...
Python多线程 - threading
目录 1. GIL 2. API 3. 创建子线程 4. 线程同步 4.1. 有了GIL,是否还需要同步? 4.1.1. 死锁 4.1.2. 竞争条件 4.1.3. GIL去哪儿了 4.2. Lock ...
大厂面试过程复盘(微信/阿里/头条均拿offer,附答案篇)
背景本人前端,3年经验,由于个人的原因,决定跳槽,于是大概3月开始找工作,总历时大概2个月,面试了微信/阿里/头条,三家都拿到了offer,来分享一下面经. 问题比较多,而且很多面试题都是跟个人项目 ...
Vugen使用技巧
调整各种选项的超时时间
学员操作——制作5s关闭广告
<!DOCTYPE html><html> <head> <meta charset="utf-8"> <title>广 ...
FastJson对实体类和Json还有JSONObject相互转换
1. 实体类或集合转JSON串 String besnString = JSONObject.toJSONString(实体类); 2.JSON串转JSONObject JSONObject json ...
黎活明8天快速掌握android视频教程--20_采用ContentProvider对外共享数据
1.内容提供者是让当前的app的数据可以让其他应用访问,其他应该可以通过内容提供者访问当前app的数据库 contentProvider的主要目的是提供一个开发的接口,让其他的应该能够访问当前应用的数 ...
mybatis缓存之一级缓存（一）
对于mybatis框架.仿佛工作中一直是在copy着使用.对于mybatis缓存.并没有一个准确的认知.趁着假期.学习下mybatis的缓存.这篇主要学习mybatis的一级缓存. 为什么使用缓存其 ...
Windows安装 PyCharm
PyCharm是一种Python IDE,带有一整套可以帮助用户在使用Python语言开发时提高其效率的工具,比如调试.语法高亮.Project管理.代码跳转.智能提示.自动完成.单元测试.版本控制. ...
Spring AOP学习笔记05：AOP失效的罪因
前面的文章中我们介绍了Spring AOP的简单使用,并从源码的角度学习了其底层的实现原理,有了这些基础之后,本文来讨论一下Spring AOP失效的问题,这个问题可能我们在平时工作中或多或少也会碰到 ...

scrapy(四): 爬取二级页面的内容

scrapy爬取二级页面的内容

1.定义数据结构item.py文件

2.爬虫文件

3.管道文件

scrapy(四): 爬取二级页面的内容的更多相关文章

随机推荐

热门专题