scrapy爬取数据进行数据库存储和本地存储

今天记录下scrapy将数据存储到本地和数据库中，不是不会写，因为小编每次都写觉得都一样，所以记录下，以后直接用就可以了-^o^-

１．本地存储

设置pipel ines.py

class Ak17Pipeline(object):

    def __init__(self):

        self.file = open('ak17.json', 'w')     # 存储文件的类型

    def process_item(self, item, spider):

        result = json.dumps(dict(item), ensure_ascii=False) + ',\n'

        self.file.write(result)

        return item

    def close_spider(self):

        self.file.close()

2. 存储到ＭongoＤB数据库

设置setting文件

# mongo数据库

MONGO_HOST = "127.0.0.1"    # 数据库地址

MONGO_PORT = 27017　　　　　　# 端口号

MONGO_DBNAME = "ak17"　　　　# 数据库名称

MONGO_COLNAME = "ak"　　　　 #  集合名称

　设置pipel ines.py

class MongoPipeline(object):

    """

    保存进数据库

    """

    def __init__(self):

        # 初始化操作

        host = settings['MONGO_HOST']

        port = settings['MONGO_PORT']

        dbs = settings['MONGO_DBNAME']

        colname = settings['MONGO_COLNAME']

        # 链接数据库

        self.db = MongoClient(host=host, port=port)

        # 选择数据库

        self.database = self.db[dbs]

        # 选择集合

        self.col = self.database[colname]

    def process_item(self, item, spider):

        # 插入数据

        date = dict(item)

        self.col.insert(date)

        return item

    def close_spider(self):

        # 关闭链接

        self.db.close()

3.MySql数据库存储

　设置setting文件

MYSQL_HOSTS = '127.0.0.1'

MYSQL_USER = 'root'

MYSQL_PASSWORD = 'root'

MYSQL_PORT = 3306

MYSQL_DB='xiciip'

CHARSET='utf8'

设置pipel ines.py

class WebcrawlerScrapyPipeline(object):

    '''保存到数据库中对应的class

       1、在settings.py文件中配置

       2、在自己实现的爬虫类中yield item,会自动执行'''

    def __init__(self, dbpool):

        self.dbpool = dbpool

    @classmethod

    def from_settings(cls, settings):

        '''1、@classmethod声明一个类方法，而对于平常我们见到的叫做实例方法。

           2、类方法的第一个参数cls（class的缩写，指这个类本身），而实例方法的第一个参数是self，表示该类的一个实例

           3、可以通过类来调用，就像C.f()，相当于java中的静态方法'''

        #读取settings中配置的数据库参数

        dbparams = dict(

            host=settings['MYSQL_HOST'],

            db=settings['MYSQL_DBNAME'],

            user=settings['MYSQL_USER'],

            passwd=settings['MYSQL_PASSWD'],

            charset='utf8',  # 编码要加上，否则可能出现中文乱码问题

            cursorclass=MySQLdb.cursors.DictCursor,

            use_unicode=False,

        )

        dbpool = adbapi.ConnectionPool('MySQLdb', **dbparams)  # **表示将字典扩展为关键字参数,相当于host=xxx,db=yyy....

        return cls(dbpool)  # 相当于dbpool付给了这个类，self中可以得到

    # pipeline默认调用

    def process_item(self, item, spider):

        query = self.dbpool.runInteraction(self._conditional_insert, item)  # 调用插入的方法异步处理

        query.addErrback(self._handle_error, item, spider)  # 调用异常处理方法

        return item

    # 写入数据库中

    # SQL语句在这里

    def _conditional_insert(self, tx, item):

        sql = "insert into jsbooks(author,title,url,pubday,comments,likes,rewards,views) values(%s,%s,%s,%s,%s,%s,%s,%s)"

        params = (item['author'], item['title'], item['url'], item['pubday'],item['comments'],item['likes'],item['rewards'],item['reads'])

        tx.execute(sql, params)

    # 错误处理方法

    def _handle_error(self, failue, item, spider):

        print failue

scrapy爬取数据进行数据库存储和本地存储的更多相关文章

如何提升scrapy爬取数据的效率
在配置文件中修改相关参数: 增加并发默认的scrapy开启的并发线程为32个,可以适当的进行增加,再配置文件中修改CONCURRENT_REQUESTS = 100值为100,并发设置成了为100. ...
scrapy爬取数据的基本流程及url地址拼接
说明:初学者,整理后方便能及时完善,冗余之处请多提建议,感谢! 了解内容: Scrapy :抓取数据的爬虫框架异步与非阻塞的区别异步:指的是整个过程,中间如果是非阻塞的,那就是异步 ...
python之scrapy爬取数据保存到mysql数据库
1.创建工程 scrapy startproject tencent 2.创建项目 scrapy genspider mahuateng 3.既然保存到数据库,自然要安装pymsql pip inst ...
将scrapy爬取数据通过django入到SQLite数据库
1. 在django项目根目录位置创建scrapy项目,django_12是django项目,ABCkg是scrapy爬虫项目,app1是django的子应用 2.在Scrapy的settings.p ...
42.scrapy爬取数据入库mongodb
scrapy爬虫采集数据存入mongodb采集效果如图: 1.首先开启服务切换到mongodb的bin目录下命令:mongod --dbpath e:\data\db 另开黑窗口命令:mongo. ...
scrapy爬取数据保存csv、mysql、mongodb、json
目录前言 Items Pipelines 前言用Scrapy进行数据的保存进行一个常用的方法进行解析 Items item 是我们保存数据的容器,其类似于 python 中的字典.使用 item ...
Python使用Scrapy框架爬取数据存入CSV文件(Python爬虫实战4)
1. Scrapy框架 Scrapy是python下实现爬虫功能的框架,能够将数据解析.数据处理.数据存储合为一体功能的爬虫框架. 2. Scrapy安装 1. 安装依赖包 yum install g ...
爬虫必知必会（6）_提升scrapy框架爬取数据的效率之配置篇
如何提升scrapy爬取数据的效率:只需要将如下五个步骤配置在配置文件中即可增加并发:默认scrapy开启的并发线程为32个,可以适当进行增加.在settings配置文件中修改CONCURRENT_ ...
提高Scrapy爬取效率
1.增加并发: 默认scrapy开启的并发线程为32个,可以适当进行增加.在settings配置文件中修改CONCURRENT_REQUESTS = 100值为100,并发设置成了为100. 2.降低 ...

随机推荐

SUSE 安装 iServer、iDesktop启动异常问题
前言: SUSE作为一款经典的linux发行版本,在很多企业用户中都有使用. 本文记录的是在SUSE11 SP3系统中安装iServer.iDesktop出现异常的问题. 环境: 系统:SUSE 11 ...
Git常用命令（二）------ 远程库操作
本文总结自廖雪峰网站. Git支持多种协议,git://使用ssh协议,速度最快,也可使用https等协议. 对远程库操作: 推送: 1.先远程建立一个Repo库,f 2.远程和本地关联: git r ...
（译文）开始学习Vue——构建你的第一个Vue应用
我们要构建如下组件:(最终代码在这里:https://codesandbox.io/s/38k1y8x375) 开始 Vue是支持单文件组件的,但是我们不准备这么做.你也可以构建一个全局的组件,通过V ...
vue小白快速入门
一.vue是什么 Vue 是一套用于构建用户界面的渐进式框架. 压缩后仅有17kb 二.vue环境搭建你直接下载并用 <script> 标签引入,Vue 会被注册为一个全局变量. 但在用 ...
城市安全风险管理项目Postmortem结果
设想和目标 1. 我们的软件要解决什么问题?是否定义得很清楚?是否对典型用户和典型场景有清晰的描述? 本系统希望实现快速识别危害因素,使工作人员对风险作出准确的评估.即让使用者熟悉潜在的危险因素,知道 ...
201621123040《Java程序设计》第2周学习总结
1.本周学习总结关键词:Java中的字符串与数组 c语言基本语法的迁移相关总结:在一周的学习过程中,我自主学习Java的基本语法,前期的相关语法与c语言的基本语法相近,也算是做到了很好的回顾:在郑 ...
Swift -欢迎界面1页，延长启动图片的显示时间（LaunchImage）
转自:http://www.hangge.com/blog/cache/detail_1238.html http://www.hangge.com/blog/cache/detail_672.htm ...
Java HashMap工作原理及实现
Java HashMap工作原理及实现 2016/03/20 | 分类: 基础技术 | 0 条评论 | 标签: HASHMAP 分享到:3 原文出处: Yikun 1. 概述从本文你可以学习到: 什 ...
调用WCF时，调用已超过传入消息(65536)的最大消息大小配额。若要增加配额,请使用相应绑定。
解决方案: 其实只要在客户端配置文件中加上如下紫色粗体属性( maxReceivedMessageSize): <?xml version="1.0" encoding=&q ...
Java XML Dom解析工具
Java XML Dom解析工具缩进等 transformer.setOutputProperty(OutputKeys.OMIT_XML_DECLARATION, "no"); ...

scrapy爬取数据进行数据库存储和本地存储

scrapy爬取数据进行数据库存储和本地存储的更多相关文章

随机推荐

热门专题