Spark将计算结果写入到Mysql中

今天主要来谈谈如何将Spark计算的结果写入到Mysql或者其他的关系型数据库里面。其实方式也很简单，代码如下：

package scala

import java.sql.{DriverManager, PreparedStatement, Connection}

import org.apache.spark.{SparkContext, SparkConf}

object RDDtoMysql {

  case class Blog(name: String, count: Int)

  def myFun(iterator: Iterator[(String, Int)]): Unit = {

    var conn: Connection = null

    var ps: PreparedStatement = null

    val sql = "insert into blog(name, count) values (?, ?)"

    try {

      conn = DriverManager.getConnection("jdbc:mysql://localhost:3306/spark",

　　　　"root", "")

      iterator.foreach(data => {

        ps = conn.prepareStatement(sql)

        ps.setString(, data._1)

        ps.setInt(, data._2)

        ps.executeUpdate()

      }

      )

    } catch {

      case e: Exception => println("Mysql Exception")

    } finally {

      if (ps != null) {

        ps.close()

      }

      if (conn != null) {

        conn.close()

      }

    }

  }

  def main(args: Array[String]) {

    val conf = new SparkConf().setAppName("RDDToMysql").setMaster("local")

    val sc = new SparkContext(conf)

    val data = sc.parallelize(List(("www", ), ("iteblog", ), ("com", )))

    data.foreachPartition(myFun)

  }

}

其实是通过foreachPartition遍历RDD的每个分区，并调用普通的Scala方法来写数据库。在运行程序之前需要确保数据库里面存在blog表，可以通过下面语句创建：

CREATE TABLE `blog` (

  `name` varchar() NOT NULL,

  `count` int() unsigned DEFAULT NULL

) ENGINE=InnoDB DEFAULT CHARSET=utf-

然后直接运行上述的代码即可。运行完成你就可以在数据库里面查询结果：

SELECT * FROM blog b;

www　　

iteblog　　

com

需要注意的是：
　　1、你最好使用foreachPartition 函数来遍历RDD，并且在每台Work上面创建数据库的connection。
　　2、如果你的数据库并发受限，可以通过控制数据的分区来减少并发。
　　3、在插入Mysql的时候最好使用批量插入。
　　4、确保你写入数据库过程能够处理失败，因为你插入数据库的过程可能会经过网络，这可能会导致数据插入到数据库失败。
　　5、不建议将你的RDD数据写入到Mysql等关系型数据库中。

Spark将计算结果写入到Mysql中的更多相关文章

spark读取mongodb数据写入hive表中
一环境: spark-: hive-; scala-; hadoop--cdh-; jdk-1.8; mongodb-2.4.10; 二.数据情况: MongoDB数据格式{ "_i ...
spark streaming将处理结果存入mysql中（使用c3p0连接池）
1.c3p0相应的架包导入工程中将以下四个架包导入工程, 主要有三个架包:c3p0-0.9.5.2.jar c3p0-oracle-thin-extras-0.9.5.2.jar mchange-c ...
Spark操作dataFrame进行写入mysql，自定义sql的方式
业务场景: 现在项目中需要通过对spark对原始数据进行计算,然后将计算结果写入到mysql中,但是在写入的时候有个限制: 1.mysql中的目标表事先已经存在,并且当中存在主键,自增长的键id 2. ...
通过Spark Streaming的foreachRDD把处理后的数据写入外部存储系统中
转载自:http://blog.csdn.net/erfucun/article/details/52312682 本博文主要内容包括: 技术实现foreachRDD与foreachPartition ...
NET MVC全局异常处理（一）【转载】网站遭遇DDoS攻击怎么办使用 HttpRequester 更方便的发起 HTTP 请求 C#文件流。 Url的Base64编码以及解码 C#计算字符串长度，汉字算两个字符 2019周笔记（2.18-2.23） Mysql语句中当前时间不能直接使用C#中的Date.Now传输 Mysql中Count函数的正确使用
NET MVC全局异常处理(一) 目录 .NET MVC全局异常处理 IIS配置静态错误页配置 .NET错误页配置程序设置全局异常配置 .NET MVC全局异常处理一直知道有.NET有相关 ...
Spark使用Java、Scala 读取mysql、json、csv数据以及写入操作
Spark使用Java读取mysql数据和保存数据到mysql 一.pom.xml 二.spark代码 2.1 Java方式 2.2 Scala方式三.写入数据到mysql中四.DataFrame ...
flink04 -----1 kafkaSource 2. kafkaSource的偏移量的存储位置 3 将kafka中的数据写入redis中去 4 将kafka中的数据写入mysql中去
1. kafkaSource 见官方文档 2. kafkaSource的偏移量的存储位置默认存在kafka的特殊topic中,但也可以设置参数让其不存在kafka的特殊topic中 3 将k ...
mysql中计算两个日期的时间差函数TIMESTAMPDIFF用法
mysql中计算两个日期的时间差函数TIMESTAMPDIFF用法: 语法: TIMESTAMPDIFF(interval,datetime_expr1,datetime_expr2) 说明: 返回日 ...
Spark比MR快是因为在内存中计算？错！
MapReduce 就像一台又慢又稳的老爷车,虽然距离 MapReduce 面市到现在已经过去了十几年的时间,但它始终没有被淘汰,任由大数据技术日新月异.蓬蓬勃勃.花里胡哨地发展,这个生态圈始终有它的 ...

随机推荐

PHP array_merge 隐藏坑。。
foreach ($list as $k=> $teamGoods){ if($teamGoods['status'] > 4){ $_soldGoods[] = $teamGoods; ...
【MATLAB】评价二值分割结果的函数
根据PASCAL challenges的标准:intersection-over-union score,所写的matlab评价程序,处理二值图像. 其思想即分割结果与Ground Trueth的交集 ...
开始使用ARC
Automatic Reference Counting (ARC)是编译器自动管理Objective-C对象的一个功能,相对于不得不考虑retain和release操作来说,ARC让我们有更多的精力 ...
关于ASP.NET和.NET的区别和联系
对于一个新手,往往会被这些名字给搞蒙了,对不起(笨小孩我也被搞蒙过,见笑啦),这归根结底还是怪自己对知识掌握和了解的不够,废话不多,直接到主题. ASP.NET和.NET的区别和联系 .NET 一般所 ...
原生js--元素尺寸、位置和溢出
判断元素尺寸和位置的方法: elem.getBoundingClientRect() // 已验证IE7+.firefox.chrome均支持此方法该方法返回一个对象(坐标值为视口坐标,不是文档坐 ...
Android Studio 3.0.1 版本包下载
Android Studio 3.0.1 发布了,这是对 Android Studio 3.0 的一个小的更新,包括一般错误修复和性能改进下载地址: Windows 64 位:https://dl. ...
流程图 --- BPMN规范简介
BPMN 目前是2.0规范 http://www.bpmn.org/ BPMN Quick Guide http://blog.csdn.net/flygoa/article/details/5 ...
邮件MIME格式分析
http://www.cnblogs.com/crystalray/articles/3302427.html 邮件mime格式参考: rfc4021,Registration of Mail an ...
电子邮件 -- 图解TCP_IP_第5版
图解TCP_IP_第5版作者: [日]竹下隆史 / [日]村山公保 / [日]荒井透 / [日]苅田幸雄出版社: 人民邮电出版社原作名: マスタリングTCP/IP 入門編第5版译者: 乌尼日其其 ...
Sencha Touch 实战开发培训视频教程第二期第八节 (完结)
2014.4.23 晚上8:00左右开课. 本节课耗时超长,因为演示过程中出现了一些小错误,所以耗时接近2小时. 本期培训一共八节,前两节免费,后面的课程需要付费才可以观看. 本节内容: 开发cord ...

Spark将计算结果写入到Mysql中

Spark将计算结果写入到Mysql中的更多相关文章

随机推荐

热门专题