如果是使用centos 需要 yum install python-devel mysql-devel`

接下来保存数据库两种方法：

同步操作：数据少可以
异步操作：大数据（scrapy爬取得速度快于数据库插入速度，当数据量大时，就会出现阻塞，异步就能解决）

1.同步

修改数据，由于我们抓取的时间格式是str 需要转换成date存入数据库

import  datetime

try:

    create_date=datetime.datetime.strptime('create_date',"%Y/%m/%d").date()

except Exception as e:

    create_date =datetime.datetime.now().date()  #如果没有就取当前时间

article_item['create_date'] =create_date

建立MysqlPipeline

import MySQLdb

class MysqlPipeline(object):

    def __init__(self):

        self.conn=MySQLdb.connect('localhost','root','root','article',charset='utf8',use_unicode=True)

        self.cursor=self.conn.cursor()

    def process_item(self, item, spider):

        insert_sql="""

            insert into article(title,url,create_date,url_object_id,front_image_url,front_image_path,

            praise,collect_nums,comment_nums,contents,tags)VALUES(%s,%s,%s,%s,%s,%s,%s,%s,%s,%s,%s)

        """

        self.cursor.execute(insert_sql,(item['title'],item['url'],item['create_date'],item['url_object_id'],

        item['front_image_url'],item['front_image_path'],item['praise'],item['collect_nums'],item['comment_nums'],item['contents'],item['tags'] ))

        self.conn.commit()

PIPELINE添加配置

ITEM_PIPELINES = {

  'spider_first.pipelines.ArticleImagePipeline': 1,

  'spider_first.pipelines.MysqlPipeline':2,

}

2.异步

settings.py

MYSQL_HOST='localhost'

MYSQL_DBNAME='article'

MYSQL_USER='root'

MYSQL_PASSWORD='root'

创建异步pipeline

import MySQLdb

import MySQLdb.cursors

from twisted.enterprise import adbapi

class MysqlTwistPipeline(object):

    @classmethod

    def from_settings(cls,settings):#名称固定 会被scrapy调用 直接可用setting的值

        adbparams=dict(

            host=settings['MYSQL_HOST'],

            db = settings['MYSQL_DBNAME'],

            user = settings['MYSQL_USER'],

            password = settings['MYSQL_PASSWORD'],

            charset='utf8',

            cursorclass=MySQLdb.cursors.DictCursor,

            use_unicode=True,

            )

        #这是链接数据库的另一种方法，在settings中写入参数

        dbpool=adbapi.ConnectionPool('MySQLdb',**adbparams)

        return cls(dbpool)

    def __init__(self,dbpool):

        self.dbpool=dbpool

    def process_item(self, item, spider):

        #使用twiest将mysql插入变成异步

        query=self.dbpool.runInteraction(self.do_insert,item)

        #因为异步 可能有些错误不能及时爆出

        query.addErrback(self.handle_error)

    #处理异步的异常

    def handle_error(self,failure):

        print('failure')

    def do_insert(self,cursor,item):

        insert_sql = """

                    insert into article(title,url,create_date,url_object_id,front_image_url,front_image_path,

                    praise,collect_nums,comment_nums,contents,tags)VALUES(%s,%s,%s,%s,%s,%s,%s,%s,%s,%s,%s)

                """

        cursor.execute(insert_sql, (item['title'], item['url'], item['create_date'], item['url_object_id'],item['front_image_url'], item['front_image_path'], item['praise'],item['collect_nums'], item['comment_nums'], item['contents'], item['tags']))

最后同样添加配置即可

scrapy--将爬取得数据保存到数据库中的更多相关文章

ASP.NET网络爬虫小研究 HtmlAgilityPack基础，爬取数据保存在数据库中再显示再自己的网页中
1.什么是网络爬虫关于爬虫百度百科这样定义的:网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本.另外一些 ...
WordPress插件制作教程(四): 将数据保存到数据库
上一篇讲解了添加菜单的方法,这一篇为大家讲解如何将数据保存到数据库中,并且显示在页面上,不会因提交表单时刷新页面输入框中内容消失.要实现这一功能我们需要借助WordPress函数来实现,下面就来讲解具 ...
把Execl表格中的数据获取出来保存到数据库中
比如我们遇到一些需要把execl表格中的数据保存到数据库中,一条一条保存效率底下而且容易出错,数据量少还好,一旦遇到数据量大的时候就会累死个人啊,下面我们就来把execl表格中数据保存到对应的数据库中 ...
Python+Scrapy+Crawlspider 爬取数据且存入MySQL数据库
1.Scrapy使用流程 1-1.使用Terminal终端创建工程,输入指令:scrapy startproject ProName 1-2.进入工程目录:cd ProName 1-3.创建爬虫文件( ...
第三百四十二节，Python分布式爬虫打造搜索引擎Scrapy精讲—爬虫数据保存
第三百四十二节,Python分布式爬虫打造搜索引擎Scrapy精讲—爬虫数据保存注意:数据保存的操作都是在pipelines.py文件里操作的将数据保存为json文件 spider是一个信号检测 ...
二十一 Python分布式爬虫打造搜索引擎Scrapy精讲—爬虫数据保存
注意:数据保存的操作都是在pipelines.py文件里操作的将数据保存为json文件 spider是一个信号检测 # -*- coding: utf-8 -*- # Define your ite ...
把数据保存到数据库附加表 `dede_addonarticle` 时出错，请把相关信息提交给DedeCms官方。Duplicate entry
把数据保存到数据库附加表 `dede_addonarticle` 时出错,请把相关信息提交给DedeCms官方.Duplicate entry ’3′ for key ‘PRIMARY’ 你的主键是不 ...
Android学习笔记——保存数据到SQL数据库中(Saving Data in SQL Databases)
知识点: 1.使用SQL Helper创建数据库 2.数据的增删查改(PRDU:Put.Read.Delete.Update) 背景知识: 上篇文章学习了保存文件,今天学习的是保存数据到SQL数据库中 ...
dedecms新建内容模型“把数据保存到数据库附加表时出错‘xxx’出错”错误的原因分析和解决方案(转)
把数据保存到数据库附加表 `bc_addonarticle17` 时出错,请把相关信息提交给DedeCms官方.INSERT INTO `bc_addonarticle17`(aid,typeid,r ...

随机推荐

python模块之StringIO/cStringIO（内存文件）
1. StringIO/cStringIO是什么这个模块提供了一个类,这个类的实例就像是一个文件一样可以读写,实际上读写的是一个字符串缓存,也可以称之为内存文件. StringIO和文件对象拥有共同 ...
PHP数据库类
简单封装PHP操作MySQL的类 <?php /* 类的名称:Model 类的作用:连接数据库执行sql语句作者:lim 更新时间:20170812 */ class Model{ //存放 ...
python基础之常用内置函数
前言 python有许多内置的函数,它们定义在python的builtins模块,在python的代码中可以直接使用它们. 常用的内置函数类型转换 int python的整数类型都是int类型的实例 ...
python并发编程之asyncio协程(三)
协程实现了在单线程下的并发,每个协程共享线程的几乎所有的资源,除了协程自己私有的上下文栈:协程的切换属于程序级别的切换,对于操作系统来说是无感知的,因此切换速度更快.开销更小.效率更高,在有多IO操作 ...
android 系统的休眠与唤醒+linux 系统休眠
Android休眠与唤醒驱动流程分析标准Linux休眠过程: powermanagement notifiers are executed with PM_SUSPEND_PREPARE tasks ...
JSOI 2017 退役记
意料之中,真的要退役了. 懒得写游记了. Round 2 的时候状态一直不太清醒,最后混了个rank19,准备AFO吧.
Gym 101081K Pope's work
题目链接:Gym - 101081K 题意:给n个箱子,每个箱子有一个重量W和一个承重R,表示它上面能放最多R-W的重量.问最多能把多少箱子堆到一堆. 思路:发现在一堆箱子里,两个箱子交换位置,对其他 ...
php+mysql缓存技术的实现
本教程适合于那些对缓存SQL查询以减少数据库连接与执行的负载.提高脚本性能感兴趣的PHP程序员.概述许多站点使用数据库作为站点数据存储的容器.数据库包含了产器信息.目录结构.文章或者留言本,有些数据 ...
Effective C++笔记（六）：继承与面向对象设计
参考:http://www.cnblogs.com/ronny/p/3756494.html 条款32:确定你的public继承塑模出is-a关系 “public继承”意味着is-a.适用于base ...
纯js的N级联动列表框 —— 基于jQuery
多个列表框联动,不算是啥大问题,但是却挺麻烦,那么怎么才能够尽量方便一点呢?网上搜了一下,没发现太好用的,于是就自己写了一个.基于jQuery,无限级联动,支持下拉列表框和列表框. 先说一下步骤和使用 ...

scrapy--将爬取得数据保存到数据库中

如果是使用centos 需要 yum install python-devel mysql-devel`

接下来保存数据库两种方法：

1.同步

2.异步

scrapy--将爬取得数据保存到数据库中的更多相关文章

随机推荐

热门专题