windows下使用python的scrapy爬虫框架，爬取个人博客文章内容信息

scrapy作为流行的python爬虫框架，简单易用，这里简单介绍如何使用该爬虫框架爬取个人博客信息。关于python的安装和scrapy的安装配置请读者自行查阅相关资料，或者也可以关注我后续的内容。

本文使用的python版本为2.7.9 scrapy版本为0.14.3

1.假设我们爬虫的名字为vpoetblog

在命令行下切换到桌面目录，输入startproject scrapy vpoetblog 如下图所示:

命令执行成功后会在桌面生成一个名为vpoetblog的文件夹

该文件夹的目录为:

│  scrapy.cfg

│

└─vpoetblog

    │  items.py

    │  pipelines.py

    │  settings.py

    │  __init__.py

    │

    └─spiders

            __init__.py

这里我们要新建一些文件，最终的目录结构如下:

│  scrapy.cfg

│  data.txt   //用于保存抓取到的数据

└─doubanmoive

    │  items.py  //用于定义抓取的item

    │  pipelines.py  //用于将抓取的数据进行保存

    │  settings.py

    │  __init__.py

    │

    └─spiders

	   blog_spider.py  //主爬虫函数 用于定义抓取规则等

            __init__.py

items.py内容如下:

# -*- coding: cp936 -*-
from scrapy.item import Item, Field
class VpoetblogItem(Item):
# define the fields for your item here like:
# name = Field()
article_name = Field() #文章名字
public_time = Field() #发表时间
read_num = Field() #阅读数量

pipelines.py内容如下:

# -*- coding: utf-8 -*-
import sys
reload(sys)
sys.setdefaultencoding('utf-8')
from scrapy.exceptions import DropItem
from scrapy.conf import settings
from scrapy import log
class Pipeline(object):
def __init__(self):
print 'abc'
def process_item(self, item, spider):
#Remove invalid data
#valid = True
#for data in item:
#if not data:
#valid = False
#raise DropItem("Missing %s of blogpost from %s" %(data, item['url']))
#print 'crawl no data.....\n'
#if valid:
#Insert data into txt
input = open('data.txt', 'a')
input.write('article_name:'+item['article_name'][0]+' ');
input.write('public_time:'+item['public_time'][0]+' ');
input.write('read_num:'+item['read_num'][0]+' ');
input.close()
return item

settings.py内容如下:

# Scrapy settings for vpoetblog project
#
# For simplicity, this file contains only the most important settings by
# default. All the other settings are documented here:
#
# http://doc.scrapy.org/topics/settings.html
#
BOT_NAME = 'vpoetblog'
BOT_VERSION = '1.0'
SPIDER_MODULES = ['vpoetblog.spiders']
NEWSPIDER_MODULE = 'vpoetblog.spiders'
ITEM_PIPELINES={
'vpoetblog.pipelines.Pipeline':300
}
DOWNLOAD_DELAY = 2
RANDOMIZE_DOWNLOAD_DELAY = True
USER_AGENT = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_8_3) AppleWebKit/536.5 (KHTML, like Gecko) Chrome/19.0.1084.54 Safari/536.5'
COOKIES_ENABLED = True

blog_spider.py内容如下:

# -*- coding: utf-8 -*-
from scrapy.selector import HtmlXPathSelector
from scrapy.contrib.spiders import CrawlSpider,Rule
from scrapy.contrib.linkextractors.sgml import SgmlLinkExtractor
from vpoetblog.items import VpoetblogItem
class MoiveSpider(CrawlSpider):
name="vpoetblog"
allowed_domains=["blog.csdn.net"]
start_urls=["http://blog.csdn.net/u013018721/article/list/1"]
rules=[
Rule(SgmlLinkExtractor(allow=(r'http://blog.csdn.net/u013018721/article/list/\d+'))),
Rule(SgmlLinkExtractor(allow=(r'http://blog.csdn.net/u013018721/article/details/\d+')),callback="parse_item"),
]
def parse_item(self,response):
sel=HtmlXPathSelector(response)
item=VpoetblogItem()
item['article_name']=sel.select('//*[@class="link_title"]/a/text()').extract()
item['public_time']=sel.select('//*[@class="link_postdate"]/text()').extract()
item['read_num']=sel.select('//*[@class="link_view"]/text()').extract()
return item

运行命令如下:

运行截图如下:

windows下使用python的scrapy爬虫框架，爬取个人博客文章内容信息的更多相关文章

手把手教大家如何用scrapy爬虫框架爬取王者荣耀官网英雄资料
之前被两个关系很好的朋友拉入了王者荣耀的大坑,奈何技术太差,就想着做一个英雄的随查手册,这样就可以边打边查了.菜归菜,至少得说明咱打王者的态度是没得说的,对吧?大神不喜勿喷!!!感谢!!废话不多说,开 ...
Python爬取CSDN博客文章
0 url :http://blog.csdn.net/youyou1543724847/article/details/52818339Redis一点基础的东西目录 1.基础底层数据结构 2.win ...
scrapy爬虫框架爬取招聘网站
目录结构 BossFace.py文件中代码: # -*- coding: utf-8 -*-import scrapyfrom ..items import BossfaceItemimport js ...
python 爬虫爬取序列博客文章列表
python中写个爬虫真是太简单了 import urllib.request from pyquery import PyQuery as PQ # 根据URL获取内容并解码为UTF-8 def g ...
Python之Scrapy爬虫框架安装及简单使用
题记:早已听闻python爬虫框架的大名.近些天学习了下其中的Scrapy爬虫框架,将自己理解的跟大家分享.有表述不当之处,望大神们斧正. 一.初窥Scrapy Scrapy是一个为了爬取网站数据,提 ...
【python】Scrapy爬虫框架入门
说明: 本文主要学习Scrapy框架入门,介绍如何使用Scrapy框架爬取页面信息. 项目案例:爬取腾讯招聘页面 https://hr.tencent.com/position.php?&st ...
【网络爬虫】【python】网络爬虫（五）：scrapy爬虫初探——爬取网页及选择器
在上一篇文章的末尾,我们创建了一个scrapy框架的爬虫项目test,现在来运行下一个简单的爬虫,看看scrapy爬取的过程是怎样的. 一.爬虫类编写(spider.py) from scrapy.s ...
【Python】【爬虫】爬取酷狗TOP500
好啦好啦,那我们来拉开我们的爬虫之旅吧~~~ 这一只小爬虫是爬取酷狗TOP500的,使用的爬取手法简单粗暴,目的是帮大家初步窥探爬虫长啥样,后期会慢慢变得健壮起来的. 环境配置在此之前需要下载一个谷 ...
Webmagic 爬虫框架爬取马蜂窝、携程旅游、汽车之家游记信息
WebMagic学习遇到的问题 Log4j错误解决:在src目录下添加配置文件 log4j.properties log4j.rootLogger=INFO, stdout, file log4j ...

随机推荐

Django - 模型层 - 下
一.多表 sql 单表多表多对一多对多一对一 =============================================== 一对多:Book id title price p ...
django通用视图
通用视图 1. 前言回想一下,在Django中view层起到的作用是相当于controller的角色,在view中实施的动作,一般是取得请求参数,再从model中得到数据,再通过数据创建模板,返回 ...
MySQL插入性能优化（转）
原文:http://tech.uc.cn/?p=634 对于一些数据量较大的系统,数据库面临的问题除了查询效率低下,还有就是数据入库时间长.特别像报表系统,每天花费在数据导入上的时间可能会长达几个小时 ...
从零开始写JavaWeb框架（第四章节的AOP）
使用"链式代理"实现 AOP 本文是<轻量级 Java Web 框架架构设计>的系列博文. 大家是否还记得<Proxy 那点事儿>中提到的 CGLib ...
CEO 是一家创业公司的天花板
大家说是不是呢?一秒钟内看到本质的人,和半辈子也看不清一件事本质的人,自然是不一样的命运.
mysql 数据操作单表查询 limit 限制查询的记录数
mysql; +----+-----------+------+-----+------------+---------+--------------+------------+--------+-- ...
Windows mysql默认字符集修改
一.通过MySQL命令行修改: set character_set_client=utf8; set character_set_connection=utf8; set character_set_ ...
SVM引入拉格朗日乘子[转载]
转自:https://zhidao.baidu.com/question/494249074914968332.html SVM使用拉格朗日乘子法更为高效地求解了优化问题. SVM将寻找具有最大几何间 ...
PAT 1044 Shopping in Mars[二分][难]
1044 Shopping in Mars(25 分) Shopping in Mars is quite a different experience. The Mars people pay by ...
http webservice socket的区别
1 数据传输方式1.1 socket传输的定义和其特点所谓socket通常也称作"套接字",实现服务器和客户端之间的物理连接,并进行数据传输,主要有udp和tcp两个协议. ...

windows下使用python的scrapy爬虫框架，爬取个人博客文章内容信息

windows下使用python的scrapy爬虫框架，爬取个人博客文章内容信息的更多相关文章

随机推荐

热门专题