用Pymongo保存数据

爬取豆瓣电影top250movie.douban.com/top250的电影数据，并保存在MongoDB中。

items.py

class DoubanspiderItem(scrapy.Item):

    # 电影标题

    title = scrapy.Field()

    # 电影评分

    score = scrapy.Field()

    # 电影信息

    content = scrapy.Field()

    # 简介

    info = scrapy.Field()

spiders/douban.py

import scrapy

from doubanSpider.items import DoubanspiderItem

class DoubanSpider(scrapy.Spider):

    name = "douban"

    allowed_domains = ["movie.douban.com"]

    start = 0

    url = 'https://movie.douban.com/top250?start='

    end = '&filter='

    start_urls = [url + str(start) + end]

    def parse(self, response):

        item = DoubanspiderItem()

        movies = response.xpath("//div[@class=\'info\']")

        for each in movies:

            title = each.xpath('div[@class="hd"]/a/span[@class="title"]/text()').extract()

            content = each.xpath('div[@class="bd"]/p/text()').extract()

            score = each.xpath('div[@class="bd"]/div[@class="star"]/span[@class="rating_num"]/text()').extract()

            info = each.xpath('div[@class="bd"]/p[@class="quote"]/span/text()').extract()

            item['title'] = title[0]

            # 以;作为分隔，将content列表里所有元素合并成一个新的字符串

            item['content'] = ';'.join(content)

            item['score'] = score[0]

            item['info'] = info[0]

            # 提交item

            yield item

        if self.start <= 225:

            self.start += 25

            yield scrapy.Request(self.url + str(self.start) + self.end, callback=self.parse)

pipelines.py



from scrapy.conf import settings

import pymongo

class DoubanspiderPipeline(object):

    def __init__(self):

        # 获取setting主机名、端口号和数据库名

        host = settings['MONGODB_HOST']

        port = settings['MONGODB_PORT']

        dbname = settings['MONGODB_DBNAME']

        # pymongo.MongoClient(host, port) 创建MongoDB链接

        client = pymongo.MongoClient(host=host,port=port)

        # 指向指定的数据库

        mdb = client[dbname]

        # 获取数据库里存放数据的表名

        self.post = mdb[settings['MONGODB_DOCNAME']]

    def process_item(self, item, spider):

        data = dict(item)

        # 向指定的表里添加数据

        self.post.insert(data)

        return item

settings.py

BOT_NAME = 'doubanSpider'

SPIDER_MODULES = ['doubanSpider.spiders']

NEWSPIDER_MODULE = 'doubanSpider.spiders'

ITEM_PIPELINES = {

        'doubanSpider.pipelines.DoubanspiderPipeline' : 300

        }

# Crawl responsibly by identifying yourself (and your website) on the user-agent

USER_AGENT = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_3) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/48.0.2564.116 Safari/537.36'

# MONGODB 主机环回地址127.0.0.1

MONGODB_HOST = '127.0.0.1'

# 端口号，默认是27017

MONGODB_PORT = 27017

# 设置数据库名称

MONGODB_DBNAME = 'DouBan'

# 存放本次数据的表名称

MONGODB_DOCNAME = 'DouBanMovies'

运行

启动MongoDB数据库需要两个命令：

mongod：是mongoDB数据库进程本身

mongo：是命令行shell客户端

sudo mongod # 首先启动数据库服务，再执行Scrapy

sudo mongo # 启动数据库shell

在mongo shell下使用命令:

# 查看当前数据库

> db

# 列出所有的数据库

> show dbs

# 连接DouBan数据库

> use DouBan

# 列出所有表

> show collections

# 查看表里的数据

> db.DouBanMoives.find()

scrapy之Pymongo的更多相关文章

python爬虫的scrapy安装+pymongo的安装
我的:python2.7版本 32位注意scrapy只支持2.7及以上的版本. 1.安装python 2.安装pip 安装pip就不赘述了,网上很多教学 pip安装时要注意更新,如果pip版本 ...
利用scrapy和MongoDB来开发一个爬虫
今天我们利用scrapy框架来抓取Stack Overflow里面最新的问题(),并且将这些问题保存到MongoDb当中,直接提供给客户进行查询. 安装在进行今天的任务之前我们需要安装二个框架,分别 ...
Python爬虫从入门到放弃（二十）之 Scrapy分布式原理
关于Scrapy工作流程回顾 Scrapy单机架构上图的架构其实就是一种单机架构,只在本机维护一个爬取队列,Scheduler进行调度,而要实现多态服务器共同爬取数据关键就是共享爬取队列. 分布式架 ...
Python爬虫【五】Scrapy分布式原理笔记
Scrapy单机架构在这里scrapy的核心是scrapy引擎,它通过里面的一个调度器来调度一个request的队列,将request发给downloader,然后来执行request请求但是这些 ...
scrapy学习笔记(三)：使用item与pipeline保存数据
scrapy下使用item才是正经方法.在item中定义需要保存的内容,然后在pipeline处理item,爬虫流程就成了这样: 抓取 --> 按item规则收集需要数据 -->使用pip ...
Python 爬虫之 Scrapy 分布式原理以及部署
Scrapy分布式原理关于Scrapy工作流程 Scrapy单机架构上图的架构其实就是一种单机架构,只在本机维护一个爬取队列,Scheduler进行调度,而要实现多态服务器共同爬取数据关键就是共享 ...
scrapy分布式原理
scrapy分布式原理关于Scrapy工作流程回顾 Scrapy单机架构上图的架构其实就是一种单机架构,只在本机维护一个爬取队列,Scheduler进行调度,而要实现多态服务器共同爬取数据关键 ...
爬虫（十七）：scrapy分布式原理
一:scrapy工作流程 scrapy单机架构: 单主机爬虫架构: 分布式爬虫架构: 这里重要的就是我的队列通过什么维护?这里一般我们通过Redis为维护,Redis,非关系型数据库,Key-Valu ...
Python之爬虫（二十二） Scrapy分布式原理
关于Scrapy工作流程回顾 Scrapy单机架构上图的架构其实就是一种单机架构,只在本机维护一个爬取队列,Scheduler进行调度,而要实现多态服务器共同爬取数据关键就是共享爬取队列. 分布式架 ...

随机推荐

8个Javascript小技巧
1. 使用 + 字符可以转换成数字比如要把一个字符串数字转换成数字,你可能会这样做: var one = '1'; var two = '2'; var numberOne = Number(one ...
Entity Framework 项目使用心得
在博客园很久了,一直只看不说,这是发布本人的第一个博客. 总结一下在项目中,EntityFramework使用的一下经验拿来和大家分享,希望对大家有用~ 1. 在Entity Fram ...
jmeter常见参数 vars、prev、ctx 、props 类的api
ctx - ( JMeterContext) - gives access to the context vars - ( JMeterVariables) - gives read/write ac ...
Tomcat 下 mysql的连接池配置和使用
最近维护的一个项目出了问题,最后分析是卡在数据库连接池上,然后就做了些学习. 先把我自己的方法写出来,再说下网上其他的没有成功的方法. 1.首先当然是先把mysql的jar包放在lib目录下,tonc ...
https通讯原理
https通讯原理 HTTPS在传输数据之前需要客户端(浏览器)与服务端(网站)之间进行一次握手,在握手过程中将确立双方加密传输数据的密码信息.TLS/SSL协议不仅仅是一套加密传输的协议,更是一件经 ...
（3.9）常用知识-标识值（identity）的不连续与强行插入、计算列
概念:标识值 identity(begin,add_number) 是一种特殊的值,依赖于列,由sql server自动维护,是自增的,而且一般是不会重复的.但是sql server并不维护标识(id ...
CloudFoundry V2 单机版离线安装（伪离线安装）
版权声明:本文为博主原创文章,未经博主同意不得转载. https://blog.csdn.net/wangdk789/article/details/30255763 之前安装CloudFou ...
Laravel 5.3 使用内置的 Auth 组件实现多用户认证功能
https://blog.csdn.net/kevinbai_cn/article/details/54341779 概述在开发中,我们经常会遇到多种类型的用户的认证问题,比如后台的管理员和前台的普 ...
详解MySQL第二篇—DML语句
DML 语句: DML 操作是指对数据库中表记录的操作,主要包括表记录的插入(insert).更新(update).删除(delete)和查(select),是开发人员日常使用最频繁的操作.下面将依次 ...
MySQL5.7密码安全策略（转）
环境介绍:CentOS 6.7 MySQL版本:5.7.11 1.查看现有的密码策略 mysql> SHOW VARIABLES LIKE 'validate_password%';参数解释:1 ...

scrapy之Pymongo

用Pymongo保存数据

items.py

spiders/douban.py

pipelines.py

settings.py

运行

scrapy之Pymongo的更多相关文章

随机推荐

热门专题