Scrapy爬取某装修网站部分装修效果图

爬取图片资源

spider文件

from scrapy.linkextractors import LinkExtractor

from scrapy.spiders import CrawlSpider, Rule

import re

import time

from ..items import ZhuangxiuItem

class ZhuangxiuspiderSpider(CrawlSpider):

    name = 'zhuangxiuSpider'

    allowed_domains = ['www.zhuangyi.com']

    start_urls = ['http://www.zhuangyi.com/xiaoguotu/keting/p1/']

    rules = (

        # 提取详情页信息 callback 回调函数, 将相应交给这个函数来处理

        # 第二步:分类主页的下一页

        # Rule(LinkExtractor(allow=r'(.*?)/p\d+'), follow=True),

        # 第三步: 详情页面

        Rule(LinkExtractor(allow=r'(.*?)\d+.html'), follow=True, callback='parse_item'),

    )

    def parse_item(self, response):

        img_url_list = re.findall(r'http://pic.zhuangyi.com/Member/\d/\d+/./\d+.jpg', response.text)

        item = ZhuangxiuItem()

        item['image_urls'] = img_url_list

        item['title'] = time.time()

        yield item

items.py 中

import scrapy

class ZhuangxiuItem(scrapy.Item):

    # define the fields for your item here like:

    title = scrapy.Field()

    image_urls = scrapy.Field()

settings

DEFAULT_REQUEST_HEADERS = {

  'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',

  'Accept-Language': 'en',

  'Referer': 'http://www.zhuangyi.com/'

}

IMAGES_STORE = 'img'

ITEM_PIPELINES = {

   'scrapy.pipelines.images.ImagesPipeline': 300,

}

Scrapy爬取某装修网站部分装修效果图的更多相关文章

scrapy爬取西刺网站ip
# scrapy爬取西刺网站ip # -*- coding: utf-8 -*- import scrapy from xici.items import XiciItem class Xicispi ...
Python——Scrapy爬取链家网站所有房源信息
用scrapy爬取链家全国以上房源分类的信息: 路径: items.py # -*- coding: utf-8 -*- # Define here the models for your scrap ...
Python网络爬虫 | Scrapy爬取妹子图网站全站照片
根据现有的知识,写了一个下载妹子图(meizitu.com)Scrapy脚本,把全站两万多张照片下载到了本地. 网站的分析网页的网址分析打开网站,发现网页的网址都是以 http://www.mei ...
44.scrapy爬取链家网站二手房信息-2
全面采集二手房数据: 网站二手房总数据量为27650条,但有的参数字段会出现一些问题,因为只给返回100页数据,具体查看就需要去细分请求url参数去请求网站数据.我这里大概的获取了一下筛选条件参数,一 ...
43.scrapy爬取链家网站二手房信息-1
首先分析:目的:采集链家网站二手房数据1.先分析一下二手房主界面信息,显示情况如下: url = https://gz.lianjia.com/ershoufang/pg1/显示总数据量为27589套 ...
第5章 scrapy爬取知名问答网站
第五章感觉是第四章的练习项目,无非就是多了一个模拟登录. 不分小节记录了,直接上知识点,可能比较乱. 1.常见的httpcode: 2.怎么找post参数? 先找到登录的页面,打开firebug,输入 ...
Scrapy实战篇（七）之爬取爱基金网站基金业绩数据
本篇我们以scrapy+selelum的方式来爬取爱基金网站(http://fund.10jqka.com.cn/datacenter/jz/)的基金业绩数据. 思路:我们以http://fund.1 ...
Python开发爬虫之BeautifulSoup解析网页篇：爬取安居客网站上北京二手房数据
目标:爬取安居客网站上前10页北京二手房的数据,包括二手房源的名称.价格.几室几厅.大小.建造年份.联系人.地址.标签等. 网址为:https://beijing.anjuke.com/sale/ B ...
【转载】教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神
原文:教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神本博文将带领你从入门到精通爬虫框架Scrapy,最终具备爬取任何网页的数据的能力.本文以校花网为例进行爬取,校花网:http:/ ...
用scrapy爬取京东的数据
本文目的是使用scrapy爬取京东上所有的手机数据,并将数据保存到MongoDB中. 一.项目介绍主要目标 1.使用scrapy爬取京东上所有的手机数据 2.将爬取的数据存储到MongoDB 环境 ...

随机推荐

为什么需要激活函数为什么需要归一化 python内置函数：enumerate用法总结
为什么需要激活函数为什么需要归一化 python内置函数:enumerate用法总结待办激活函数的用途(为什么需要激活函数)? 如果不用激励函数(其实相当于激励函数是f(x) = x),在这种情 ...
eli和字符串 (牛客假期训练）
链接:https://ac.nowcoder.com/acm/contest/3002/G来源:牛客网时间限制:C/C++ 2秒,其他语言4秒空间限制:C/C++ 262144K,其他语言5242 ...
OSI七层协议详解
一.简介开放系统互连参考模型 (Open System Interconnect 简称OSI)是国际标准化组织(ISO)和国际电报电话咨询委员会(CCITT)联合制定的开放系统互连参考模型,为开放式 ...
Dockerfile书写介绍及构建ssh镜像、tomcat镜像、nginx镜像
=================================================================================================== ...
刷题4. Median of Two Sorted Arrays
一.题目 Median of Two Sorted Arrays,具体请自行搜索. 这个题目,我看了一下,经过一番思考,我觉得实现起来不是很复杂. 但要做到bug free也不难,最大的问题是性能问题 ...
一些常用的js代码
跳转 window.location.href= 刷新 location.reload()
THINKPHP 模板上传图片--后台接收图片
模板 {extend name="public/base" /} {block name="body"} <div class="row&quo ...
命名元组nametuple
# coding:utf-8 from collections import namedtuple Student = namedtuple('Student', ['no', 'name', 'ag ...
FreeRTOS学习笔记2：列表
list.h 列表结构List_t 列表:主要看三个 xLIST:1.5检查列表完整性的.但是需要开启.默认不开启 2:记录列表中列表项的数量:3:记录当前列表项索引号:4:列表中的最后一个列表 ...
CI框架发送邮件（带附件）
最近写了一个发送带附件的邮件,发邮件挺简单的,在我这里最重要的是遇到问题,哈哈哈哈 1.主要方法看代码 public function send_mail(){ $this->load-> ...

Scrapy爬取某装修网站部分装修效果图

Scrapy爬取某装修网站部分装修效果图的更多相关文章

随机推荐

热门专题