Spark RDD aggregateByKey

aggregateByKey 这个RDD有点繁琐，整理一下使用示例，供参考

直接上代码

import org.apache.spark.rdd.RDD

import org.apache.spark.{SparkContext, SparkConf}

/**

  * Created by Edward on 2016/10/27.

  */

object AggregateByKey {

  def main(args: Array[String]) {

    val sparkConf: SparkConf = new SparkConf().setAppName("AggregateByKey")

      .setMaster("local")

    val sc: SparkContext = new SparkContext(sparkConf)

    val data = List((1, 3), (1, 2), (1, 4), (2, 3))

    var rdd = sc.parallelize(data,2)//数据拆分成两个分区

    //合并在不同partition中的值，a,b的数据类型为zeroValue的数据类型

    def comb(a: String, b: String): String = {

      println("comb: " + a + "\t " + b)

      a + b

    }

    //合并在同一个partition中的值， a的数据类型为zeroValue的数据类型，b的数据类型为原value的数据类型

    def seq(a: String, b: Int): String = {

      println("seq: " + a + "\t " + b)

      a + b

    }

    rdd.foreach(println)

    
    //zeroValue 中立值，定义返回value的类型，并参与运算

    //seqOp 用来在一个partition中合并值的

    //comb 用来在不同partition中合并值的

    val aggregateByKeyRDD: RDD[(Int, String)] = rdd.aggregateByKey("100")(seq,comb)

    //打印输出

    aggregateByKeyRDD.foreach(println)

    sc.stop()

  }

}

输出结果说明：

 /*

将数据拆分成两个分区

//分区一数据

(1,3)

(1,2)

//分区二数据

(1,4)

(2,3)

//分区一相同key的数据进行合并

seq: 100     3   //(1,3)开始和中立值进行合并  合并结果为 1003

seq: 1003     2   //(1,2)再次合并 结果为 10032

//分区二相同key的数据进行合并

seq: 100     4  //(1,4) 开始和中立值进行合并 1004

seq: 100     3  //(2,3) 开始和中立值进行合并 1003

将两个分区的结果进行合并

//key为2的，只在一个分区存在，不需要合并 (2,1003)

(2,1003)

//key为1的, 在两个分区存在，并且数据类型一致，合并

comb: 10032     1004

(1,100321004)

* */

参考代码及下面的说明进行理解

官网的说明

aggregateByKey(zeroValue)(seqOp, combOp, [numTasks]) When called on a dataset of (K, V) pairs, returns a dataset of (K, U) pairs where the values for each key are aggregated using the given combine functions and a neutral "zero" value. Allows an aggregated value type that is different than the input value type, while avoiding unnecessary allocations. Like in groupByKey, the number of reduce tasks is configurable through an optional second argument.

源码中函数的说明

/**
 * Aggregate the values of each key, using given combine functions and a neutral "zero value".
 * This function can return a different result type, U, than the type of the values in this RDD,
 * V. Thus, we need one operation for merging a V into a U and one operation for merging two U's,
 * as in scala.TraversableOnce. The former operation is used for merging values within a
 * partition, and the latter is used for merging values between partitions. To avoid memory
 * allocation, both of these functions are allowed to modify and return their first argument
 * instead of creating a new U.
 */

Spark RDD aggregateByKey的更多相关文章

Spark RDD 操作
1. Spark RDD 创建操作 1.1 数据集合 parallelize 可以创建一个能够并行操作的RDD.其函数定义如下: ) scala> sc.defaultParallelism ...
Spark RDD Transformation 简单用例（二）
aggregateByKey(zeroValue)(seqOp, combOp, [numTasks]) aggregateByKey(zeroValue)(seqOp, combOp, [numTa ...
Spark RDD Transformation 简单用例（一）
map(func) /** * Return a new RDD by applying a function to all elements of this RDD. */ def map[U: C ...
spark RDD官网RDD编程指南
http://spark.apache.org/docs/latest/rdd-programming-guide.html#using-the-shell Overview(概述) 在较高的层次上, ...
spark学习13（spark RDD）
RDD及其特点 1)RDD(Resillient Distributed Dataset)弹性分布式数据集,是spark提供的核心抽象.它代表一个不可变.可分区.里面的元素可并行计算的集合 2)RDD ...
Spark RDD :Spark API--Spark RDD
一.RDD的概述 1.1 什么是RDD? RDD(Resilient Distributed Dataset)叫做弹性分布式数据集,是Spark中最基本的数据抽象,它代表一个不可变.可分区.里面的元素 ...
Spark RDD 算子总结
Spark算子总结算子分类 Transformation(转换) 转换算子含义 map(func) 返回一个新的RDD,该RDD由每一个输入元素经过func函数转换后组成 filter(func) ...
Spark—RDD编程常用转换算子代码实例
Spark-RDD编程常用转换算子代码实例 Spark rdd 常用 Transformation 实例: 1.def map[U: ClassTag](f: T => U): RDD[U] ...
Spark Rdd coalesce()方法和repartition()方法
在Spark的Rdd中,Rdd是分区的. 有时候需要重新设置Rdd的分区数量,比如Rdd的分区中,Rdd分区比较多,但是每个Rdd的数据量比较小,需要设置一个比较合理的分区.或者需要把Rdd的分区数量 ...

随机推荐

Encrypting bootloader (程序BIN文件加密及在线升级）
了解更多关于bootloader 的C语言实现,请加我QQ: 1273623966 (验证信息请填 bootloader),欢迎咨询或定制bootloader(在线升级程序). 在上一个博客随笔,我介 ...
20个编写现代CSS代码的建议
明白何谓Margin Collapse 不同于其他很多属性,盒模型中垂直方向上的Margin会在相遇时发生崩塌,也就是说当某个元素的底部Margin与另一个元素的顶部Margin相邻时,只有二者中的较 ...
仿google art图片预览算法及demo（web版本）
演示地址: http://codeman35.itongyin.com:19001/v3/preview.html 功能支持:拖动滚轴放大缩小按钮放大缩小鹰眼预览鹰眼拖动等功能
IT在线学习网站总结
以下是我自己做软件过程中发现的一些不错的IT学习网站,个人感觉比较受用,故总结出来以供IT爱好者一起学习: www.maiziedu.com 麦子学院 www.jikexueyuan.com 极客学 ...
js部分总结
1 currentStyle 可以获取行间样式,但是不兼容其他浏览器用getComputedStyle(div,null)这个ie低级版本不兼容; if(div.currentStyle){ } e ...
public, protected and private inheritance in C++
Get from Stackoverflow. The details can easily understand from the below example. class A { public: ...
实现SQL Server 2008 Reporting Services匿名访问报表有两种方法
一.通过修改SQL Server 2008的配置文件,去掉Windows的验证. 1.首先我们找到SQL安装目录下的两个Web.config配置文件,默认安装目录分别是(C:\Program File ...
Spark+Hadoop问题小结
1.spark执行./start-all.sh报"WARN Utils: Service 'sparkWorker' could not bind on port 0. Attempting ...
php 文件锁
当写为LOCK_EX锁且读为LOCK_SH锁时最为妥当,经测试,这时情况如下: 1, 先运行w.php,马上支行r.php 后程序会先等写入后再读取 2, 先运行r.php,再马上支行w.php ...
第十二课：Sizzle引擎详解
这篇博客难度太大,跟前端开发其实没什么关系,如果你想成为大牛,那就去了解下吧.如果你还不想,那可以忽略,毕竟面试官也不会问到这里来,因为他也不太懂.呵呵. Sizzle引擎是jQuery的选择器,它大 ...

Spark RDD aggregateByKey

Spark RDD aggregateByKey的更多相关文章

随机推荐

热门专题