Spark算子 - aggregateByKey

释义

aggregateByKey逻辑类似 aggregate，但 aggregateByKey针对的是PairRDD，即键值对 RDD，所以返回结果也是 PairRDD，结果形式为：(各个Key, 同样Key对应的Value聚合后的值)
aggregateByKey先将每个partition内元素进行分组计算，然后将每个partition的计算结果进行combine，得到最终聚合结果。且最终结果允许跟原始RDD类型不同

方法签名如下：

def aggregateByKey[U: ClassTag](zeroValue: U)(seqOp: (U, V) => U, combOp: (U, U) => U): RDD[(K, U)] = self.withScope {

    ...

}

zeroValue: 每个partition的聚合初始值
seqOp: sequence operation，对partition内数据进行映射，最终1个partition只有1个结果。输入类型为U跟V，输出为U，即每次操作结果要跟zeroValue类型一致
- 第一次操作时，U为zeroValue（初始值），第一次操作之后输出结果U，作为下一次操作的U
- 第二次操作及之后操作时，U为前一次操作输出结果，而不再是zeroValue
combOp: combine operation，对每个partition的结果进行combine操作。输入类型为U跟U，输出为U，即输入类型与输出类型一致，最终结果为：(K, U)类型的PairRDD

案例

统计单词个数 WordCount

object TestAggregateByKey {

  def main(args: Array[String]): Unit = {

    val conf: SparkConf = new SparkConf().setAppName("TestAggregateByKey").setMaster("local[1]")

    val sc = new SparkContext(conf)

    val data = Array("hello world", "simple app is good", "good world")

    val result: Array[(String, Int)] = sc.parallelize(data, 1)

      .flatMap(_.split(" "))

      .map((_, 1))

      .aggregateByKey(0)(

        (cnt1: Int, cnt2: Int) => cnt1 + cnt2,

        (partitionAllCnt1: Int, partitionAllCnt2: Int) => partitionAllCnt1 + partitionAllCnt2

      )

      .collect()

    result.foreach(println)

  }

}

输出

(is,1)

(app,1)

(simple,1)

(hello,1)

(good,2)

(world,2)

解释

先将每个词map成 (词语, 1)的形式
调用aggregateByKey之后，每个partition内已经按key进行分组了，之后传入初始值0作为每个组的个数，接着进行 cnt1 + cnt2，就是同个key内进行1+1操作，比如单词good 有两个value都是1，此时单词good的组内，计算的值即为2
所有partition的结果进行计算

Spark算子 - aggregateByKey的更多相关文章

对spark算子aggregateByKey的理解
案例 aggregateByKey算子其实相当于是针对不同“key”数据做一个map+reduce规约的操作. 举一个简单的在生产环境中的一段代码有一些整理好的日志字段,经过处理得到了RDD类型为( ...
spark-聚合算子aggregatebykey
spark-聚合算子aggregatebykey Aggregate the values of each key, using given combine functions and a neutr ...
Spark：常用transformation及action，spark算子详解
常用transformation及action介绍,spark算子详解一.常用transformation介绍 1.1 transformation操作实例二.常用action介绍 2.1 act ...
(转)Spark 算子系列文章
http://lxw1234.com/archives/2015/07/363.htm Spark算子:RDD基本转换操作(1)–map.flagMap.distinct Spark算子:RDD创建操 ...
Spark算子总结及案例
spark算子大致上可分三大类算子: 1.Value数据类型的Transformation算子,这种变换不触发提交作业,针对处理的数据项是Value型的数据. 2.Key-Value数据类型的Tran ...
UserView--第二种方式（避免第一种方式Set饱和），基于Spark算子的java代码实现
UserView--第二种方式(避免第一种方式Set饱和),基于Spark算子的java代码实现测试数据 java代码 package com.hzf.spark.study; import ...
UserView--第一种方式set去重，基于Spark算子的java代码实现
UserView--第一种方式set去重,基于Spark算子的java代码实现测试数据 java代码 package com.hzf.spark.study; import java.util.Ha ...
spark算子之DataFrame和DataSet
前言传统的RDD相对于mapreduce和storm提供了丰富强大的算子.在spark慢慢步入DataFrame到DataSet的今天,在算子的类型基本不变的情况下,这两个数据集提供了更为强大的的功 ...
Spark算子总结（带案例）
Spark算子总结(带案例) spark算子大致上可分三大类算子: 1.Value数据类型的Transformation算子,这种变换不触发提交作业,针对处理的数据项是Value型的数据. 2.Key ...

随机推荐

Typescript Record的用法
Record<Keys,Type> 构造一个对象类型,其属性key是Keys,属性value是Tpye.被用于映射一个类型的属性到另一个类型 interface CatInfo { age ...
VMware_win10能ping通虚拟机ip，虚拟机ping不通win10ip的解决方法
一.虚拟机设置为桥接模式二.修改虚拟机linux的ip 查看win10的ip和网关使用ifconfig查看网卡名,并在 /etc/sysconfig/network-scripts/目录修改对应的 ...
spring security +MySQL + BCryptPasswordEncoder 单向加密验证 + 权限拦截 --- 心得
1.前言前面学习了 security的登录与登出 , 但是用户信息是 application 配置或内存直接注入进去的 ,不具有实用性,实际上的使用还需要权限管理,有些访问接口需要某些权限才可 ...
Jsp页面中常见的page指令
注:图片如果损坏,点击文章链接:https://www.toutiao.com/i6513327323628962312/ 1.<JSP页面实际上就是Servlet> 2.<JSP页 ...
Collection中的常用方法
1:往集合中添加元素 boolean add(Object o);2:获取集合中元素的个数 int size();3:boolean contains(Object o) 判断集合是否包含元素o4:清 ...
SYCOJ2205超级百钱百鸡
题目-超级百钱百鸡 (shiyancang.cn) 百钱百鸡的加强版百钱百鸡的话,因为是有范围,所以挨个挨个尝试即可,确定两个,即可确定第三个. 超级百钱百鸡,通过题目的描述,最后可以得到一个二元的 ...
MySQL使用时间作为判断条件
背景:在开发过程中,我们经常需要根据时间作为判断条件来查询数据,例如:当月,当日,当前小时,几天内...... 1. 当月我们只需要使用一个mysql的MONTH(date)函数即可实现.(注意判断 ...
兼容h5在ios上登录窗口input失焦后页面不会滚
$("#logincode").blur(function(){ //滚动到顶部 window.scrollTo(0, 0); })一般多用于密码框失焦后,页面不回滚
Struts-S2-045漏洞利用
最近也是在看Struts2的漏洞,这里与大家共同探讨一下,本次我复现的是s2-045这个编号的漏洞漏洞介绍 Apache Struts 2被曝存在远程命令执行漏洞,漏洞编号S2-045,CVE编号C ...
VUE3 之表单元素
1. 概述老话说的好:行动起来,原地观望是没有用的. 言归正传,今天我们来聊聊 VUE3 的表单元素. 2. 表单元素 2.1 文本框与数据绑定 <body> <div id=& ...

Spark算子 - aggregateByKey

释义

案例

输出

解释

Spark算子 - aggregateByKey的更多相关文章

随机推荐

热门专题