首先创建project:

scrapy startproject CSDNBlog

一. items.py编写

在这里为清晰说明。仅仅提取文章名称和文章网址。

# -*- coding:utf-8 -*-

from scrapy.item import Item, Field

class CsdnblogItem(Item):

    """存储提取信息数据结构"""

    article_name = Field()

    article_url = Field()

二. pipelines.py编写

import json

import codecs

class CsdnblogPipeline(object):

    def __init__(self):

        self.file = codecs.open('CSDNBlog_data.json', mode='wb', encoding='utf-8')

    def process_item(self, item, spider):

        line = json.dumps(dict(item)) + '\n'

        self.file.write(line.decode("unicode_escape"))

        return item

当中，构造函数中以可写方式创建并打开存储文件。

在process_item中实现对item处理，包括将得到的item写入到json形式的输出文件里。

三. settings.py编写

对于setting文件，他作为配置文件，主要是至执行对spider的配置。一些easy被改变的配置參数能够放在spider类的编写中，而差点儿在爬虫执行过程中不改变的參数在settings.py中进行配置。

# -*- coding:utf-8 -*-

BOT_NAME = 'CSDNBlog'

SPIDER_MODULES = ['CSDNBlog.spiders']

NEWSPIDER_MODULE = 'CSDNBlog.spiders'

#禁止cookies,防止被ban

COOKIES_ENABLED = False

ITEM_PIPELINES = {

    'CSDNBlog.pipelines.CsdnblogPipeline':300

}

# Crawl responsibly by identifying yourself (and your website) on the user-agent

#USER_AGENT = 'CSDNBlog (+http://www.yourdomain.com)'

这里将COOKIES_ENABLED參数置为True。使依据cookies推断訪问的网站不能发现爬虫轨迹，防止被ban。

ITEM_PIPELINES类型为字典，用于设置启动的pipeline，当中key为定义的pipeline类，value为启动顺序。默认0-1000。

四. 爬虫编写

爬虫编写始终是重头戏。

原理是分析网页得到“下一篇”的链接，并返回Request对象。进而继续爬取下一篇文章，直至没有。

上码：

#!/usr/bin/python

# -*- coding:utf-8 -*-

# from scrapy.contrib.spiders import  CrawlSpider,Rule

from scrapy.spider import Spider

from scrapy.http import Request

from scrapy.selector import Selector

from CSDNBlog.items import CsdnblogItem

class CSDNBlogSpider(Spider):

    """爬虫CSDNBlogSpider"""

    name = "CSDNBlog"

    #减慢爬取速度 为1s

    download_delay = 1

    allowed_domains = ["blog.csdn.net"]

    start_urls = [

        #第一篇文章地址

        "http://blog.csdn.net/u012150179/article/details/11749017"

    ]

    def parse(self, response):

        sel = Selector(response)

        #items = []

        #获得文章url和标题

        item = CsdnblogItem()

        article_url = str(response.url)

        article_name = sel.xpath('//div[@id="article_details"]/div/h1/span/a/text()').extract()

        item['article_name'] = [n.encode('utf-8') for n in article_name]

        item['article_url'] = article_url.encode('utf-8')

        yield item

        #获得下一篇文章的url

        urls = sel.xpath('//li[@class="next_article"]/a/@href').extract()

        for url in urls:

            print url

            url = "http://blog.csdn.net" + url

            print url

            yield Request(url, callback=self.parse)

慢慢分析：

（1）download_delay參数设置为1，将下载器下载下一个页面前的等待时间设置为1s，也是防止被ban的策略之中的一个。

主要是减轻server端负载。

（2）从response中抽取文章链接与文章题目，编码为utf-8。注意yield的使用。

（3）抽取“下一篇”的url，因为抽取后缺少http://blog.csdn.net部分，所以补充。两个print仅仅为调试。无实际意义。重点在于

yield Request(url, callback=self.parse)

也就是将新获取的request返回给引擎，实现继续循环。

也就实现了“自己主动下一网页的爬取”。

五. 运行

scrapy crawl CSDNBlog

部分存储数据截图：

原创，转载注明：http://blog.csdn.net/u012150179/article/details/34486677

Scrapy研究和探索（五岁以下儿童）——爬行自己主动多页（抢别人博客所有文章）的更多相关文章

（五岁以下儿童）NS3样本演示：桥模块演示样品csma-bridge.cc凝视程序
(五岁以下儿童)NS3:桥模块演示样品csma-bridge.cc凝视程序 1.Ns3 bridge模csma-bridge.cc演示示例程序的目光 // Network topology // // ...
linux下一个Oracle11g RAC建立（五岁以下儿童）
linux下一个Oracle11g RAC建立(五岁以下儿童) 四.建立主机之间的信任关系(node1.node2) 建立节点之间oracle .grid 用户之间的信任(通过ssh 建立公钥和私钥) ...
python学习笔记（五岁以下儿童）深深浅浅的副本复印件，文件和文件夹
python学习笔记(五岁以下儿童) 深拷贝-浅拷贝浅拷贝就是对引用的拷贝(仅仅拷贝父对象) 深拷贝就是对对象的资源拷贝普通的复制,仅仅是添加了一个指向同一个地址空间的"标签" ...
PE文件结构（五岁以下儿童）基地搬迁
PE文件结构(五岁以下儿童) 參考书:<加密与解密> 视频:小甲鱼解密系列视频基址重定位链接器生成一个PE文件时,它会如果程序被装入时使用的默认ImageBase基地址(VC默认 ...
Scrapy研究和探索（七）——如何防止被ban大集合策略
说来设置的尝试download_delay少于1,不管对方是什么,以防止ban策略后.我终于成功ban该. 大约scrapy利用能看到以前的文章: http://blog.csdn.net/u0121 ...
ExtJs4得知（五岁以下儿童）主要的Ext分类
Ext类是ExtJs最常见的.最基本的类,它是一个全局对象,它封装了全班.辛格尔顿和 Sencha 该方法提供了一种有用的库. 嵌套在该命名空间中一个较低的水平最用户界面组件. 但是提供了很多有用的功 ...
android网络开源框架volley(五岁以下儿童)——volley一些细节
最近的一次volley整理出下一个.我以前没有再次遭遇了一些小问题,在该记录: 1.HttpUrlConnection DELETE 信息不能加入body问题:java.net.ProtocolExc ...
nagios二次开发（五岁以下儿童）---nagios和nagiosql关系
基于nagios和nagiosql理解.这将是这两个梳理比较粗糙的简单关系,有关详细信息,请参阅下面的图如: 从上面的关系图中能够看出,nagios与nagiosql共享了主机.主机组.服务 ...
开玩笑Web它servlet(五岁以下儿童)---- 如何解决servlet线程安全问题
servlet默认值是安全线的存在,但说白,servlet安全线实际上是一个多线程线程安全问题.因为servlet它正好是一个多线程的安全问题出现. 每次通过浏览器http同意提交请求,将一个实例se ...

随机推荐

Java实现字符全阵列阵列
import org.junit.Test; public class AllSort { public void permutation(char[] buf, int start, int end ...
WPF 3D：使用GeometryModel3D的BackMaterial
原文 WPF 3D:使用GeometryModel3D的BackMaterial 使用BackMaterial,我们可以定义3D物体的内部材质(或者说是背面),比如,我们定义一个四方体容器,外面现实的 ...
用于编译cm-12.0 的 local_manifest.xml文件
将代码保存为 romservice.xml文件 <?xml version="1.0" encoding="UTF-8"?> <manifes ...
rsync 只是测试，请看下一篇
实现从客户服务器去同步资源服务器 1.解压 # tar -xzpvf rsync-2.5.6.tar.gz 编译安装 # cd rsync-2.5.6/ # ./configure --pref ...
IOS本地化应用
BK项目已完成7788,在项目的后期需要被翻译成多国语言版.为了适应全球多个国家使用多个存储. 应用本地化是分别对字符串.图片和 xib 或 storyboard 文件本地化,而传统的做法是对 xib ...
IE7，8，9兼容性处理
在IE7根据假设高度文本框中设置,则光标将不会被中心的方法如以下: 添加属性,如:style="line-height:32px\9";能够假设一个页面有多个TAB交换的物品.而 ...
android学习经常使用的数据文件夹
android工程实践 1.仿360一键清理实现(一) "一键清理"是一个桌面图标,点击图标后,显示一个视图.进行清理动画.之后显示清理了几个进程,释放了多少M内存.点击" ...
实现app上对csdn的文章列表上拉刷新下拉加载以及加入缓存文章列表的功能（制作csdn app 四）
转载请标明出处:http://blog.csdn.net/lmj623565791/article/details/23698511 今天继续对我们的csdn客户端未完成的功能进行实现,本篇博客接着客 ...
RH033读书笔记(3)-Lab 4 Browsing the Filesystem
Lab 4 Browsing the Filesystem Sequence 1: Directory and File Organization 1. Log in as user student ...
二叉查找树C语言实现
二叉查找树C语言实现 1. 二叉查找树的定义: 左子树不为空的时候,左子树的结点值小于根节点,右子树不为空时,右子树的结点值大于根节点,左右子树分别为二叉查找树 2. 二叉查找树的 ...

Scrapy研究和探索（五岁以下儿童）——爬行自己主动多页（抢别人博客所有文章）