对spark算子aggregateByKey的理解

案例

aggregateByKey算子其实相当于是针对不同“key”数据做一个map+reduce规约的操作。

举一个简单的在生产环境中的一段代码
有一些整理好的日志字段，经过处理得到了RDD类型为(String,(String,String))的List格式结果，其中各个String代表的是：(用户名,(访问时间,访问页面url))
同一个用户可能在不同的时间访问了不同或相同的页面，为了合并同一个用户的访问行为，写了下面这段代码，用到aggregateByKey。

val data = sc.parallelize(

List(

("13909029812",("20170507","http://www.baidu.com")),("18089376778",("20170401","http://www.google.com")),("18089376778",("20170508","http://www.taobao.com")),("13909029812",("20170507","http://www.51cto.com"))

)

)

        data.aggregateByKey(scala.collection.mutable.Set[(String, String)](), 200)((set, item) => {

          set += item

        }, (set1, set2) => set1 union set2).mapValues(x => x.toIterable).collect

结果：

res12: Array[(String, Iterable[(String, String)])] = Array((18089376778,Set((20170401,http://www.google.com), (20170508,http://www.taobao.com))), (13909029812,Set((20170507,http://www.51cto.com), (20170507,http://www.baidu.com))))

分解分析：##

aggregateByKey(参数1)(参数2，参数3)

过程：对于data的某个key，参数1为初始化值，在参数2的函数中，初始值和该key的每一个value传入函数进行操作，所有返回的结果在参数3中进行规约。

参数1

  scala.collection.mutable.Set[(String, String)]()

new 了一个空的set集合，做为初始值

参数2
(set, item) => {
set += item
}
一个类似于map的映射函数，将该key的每一个value（在本案例之是(访问时间，访问url)）作为item，将其放入set中并返回。
可知某个key的所有value都会返回一个含有该value的set
参数3
(set1, set2) => set1 union set2
该key的所有value得到的set进行union规约。并返回

最终结果：得到了每一个用户在所有时间的访问url的行为信息。

作者：Entry_1
链接：https://www.jianshu.com/p/09912beb1350
來源：简书
简书著作权归作者所有，任何形式的转载都请联系作者获得授权并注明出处。

对spark算子aggregateByKey的理解的更多相关文章

Spark算子 - aggregateByKey
释义 aggregateByKey逻辑类似 aggregate,但 aggregateByKey针对的是PairRDD,即键值对 RDD,所以返回结果也是 PairRDD,结果形式为:(各个Key, ...
Spark：常用transformation及action，spark算子详解
常用transformation及action介绍,spark算子详解一.常用transformation介绍 1.1 transformation操作实例二.常用action介绍 2.1 act ...
【Spark】Spark-reduceByKey-深入理解
Spark-reduceByKey-深入理解 spark.apache.org_百度搜索 Apache Spark™ - Lightning-Fast Cluster Computing reduce ...
PairRDD中算子aggregateByKey图解
PairRDD 有几个比较麻烦的算子,常理解了后面又忘记了,自己按照自己的理解记录好,以备查阅 1.aggregateByKey aggregate 是聚合意思,直观理解就是按照Key进行聚合. 转化 ...
spark-聚合算子aggregatebykey
spark-聚合算子aggregatebykey Aggregate the values of each key, using given combine functions and a neutr ...
(转)Spark 算子系列文章
http://lxw1234.com/archives/2015/07/363.htm Spark算子:RDD基本转换操作(1)–map.flagMap.distinct Spark算子:RDD创建操 ...
Spark机器学习 Day2 快速理解机器学习
Spark机器学习 Day2 快速理解机器学习有两个问题: 机器学习到底是什么. 大数据机器学习到底是什么. 机器学习到底是什么人正常思维的过程是根据历史经验得出一定的规律,然后在当前情况下根据这 ...
Spark算子总结及案例
spark算子大致上可分三大类算子: 1.Value数据类型的Transformation算子,这种变换不触发提交作业,针对处理的数据项是Value型的数据. 2.Key-Value数据类型的Tran ...
UserView--第二种方式（避免第一种方式Set饱和），基于Spark算子的java代码实现
UserView--第二种方式(避免第一种方式Set饱和),基于Spark算子的java代码实现测试数据 java代码 package com.hzf.spark.study; import ...

随机推荐

word-wrap与break-word属性的区别
共同点 word-wrap:break-word与word-break:break-all都能把长单词强行断句不同点 word-wrap:break-word会首先起一个新行来放置长单词,新的行还是 ...
PSP0级记录2
上课编写程序课外资料日总计 3.13 周一 ...
python笔记1-基础概念、python安装使用配置
Python 1.基础概念一.什么是python? python是一种面向对象.解释型的计算机语言,它的特点是语法简洁.优雅.简单易学.在1989诞生,Guido(龟叔)开发.这里的python并不 ...
Fedora的一些个人配置
0,老传统 yum install screenfetch 1,关闭蜂鸣器 edit /etc/bashrc setterm -blength 0#setterm -bfreq 10 #这个可以设置声 ...
Linux文件系统命令 ls
名称:ls 功能:查看文件列表 renjg@renjg-HP-Compaq-Pro--MT:~$ ls add-on.yaml Desktop examples.desktop meta-gnome3 ...
java语言登陆界面（菜鸟版）
最近在看的Java入门书是<Head First Java>,一本很棒的Java书. 老师要求的程序流程图我没有,之前我们的做法是写完代码再画流程图,我想这样的做法是不对的,流程图应该是在 ...
51nod1009
给定一个十进制正整数N,写下从1开始,到N的所有正数,计算出其中出现所有1的个数. 例如:n = 12,包含了5个1.1,10,12共包含3个1,11包含2个1,总共5个1. Input 输入N( ...
hdu3001（状压dp，三进制）
Travelling Time Limit: 6000/3000 MS (Java/Others) Memory Limit: 32768/32768 K (Java/Others)Total ...
jquery转换json对象为字符串
jquery转换json对象为字符串 JSON.stringify(jsonObject),可用于单个JSON对象,也可用于JSON数组 alert(JSON.stringify(jsonObject ...
python监控服务器的主备模式
#-*- coding:utf8 -*-import paramikoimport re def check_active_ac(intervals=1): client = paramiko.Tra ...

对spark算子aggregateByKey的理解

案例

分解分析：##

对spark算子aggregateByKey的理解的更多相关文章

随机推荐

热门专题