spark UDAF

感谢我的同事李震给我讲解UDAF

网上找到的大部分都只有代码，但是缺少讲解，官网的的API有讲解，但是看不太明白。我还是自己记录一下吧，或许对其他人有帮助。

接下来以一个求几何平均数的例子来说明如何实现一个自己的UDAF

首先需要导入这些包：

import org.apache.spark.sql.expressions.MutableAggregationBuffer

import org.apache.spark.sql.expressions.UserDefinedAggregateFunction

import org.apache.spark.sql.Row

import org.apache.spark.sql.types._


需要继承实现这个抽象类

class GeometricMean extends UserDefinedAggregateFunction {

  // This is the input fields for your aggregate function.
  就是需要输入的列的类型，可以有多个列，多个列的写法如下：
/*

StructType(StructField("slot",IntegerType) :: StructField("score",IntegerType)::Nil)

*/

  override def inputSchema: org.apache.spark.sql.types.StructType =

    StructType(StructField("value", DoubleType) :: Nil)

  存储聚合结果的中间buffer

  // This is the internal fields you keep for computing your aggregate.

  override def bufferSchema: StructType = StructType(

    StructField("count", LongType) ::

    StructField("product", DoubleType) :: Nil

  )

  // This is the output type of your aggregatation function.
  返回结果的类型，比如这个集合平均数就是返回一个double值

  override def dataType: DataType = DoubleType


  是每次运行结果都过一样，但是我也不太明白啊

  override def deterministic: Boolean = true

   初始化存储聚合结果的buffer

  // This is the initial value for your buffer schema.

  override def initialize(buffer: MutableAggregationBuffer): Unit = {

    buffer(0) = 0L

    buffer(1) = 1.0

  }


   每次更新怎么更新，比如新来了一行，如何加入更新聚合的结果

  // This is how to update your buffer schema given an input.

  override def update(buffer: MutableAggregationBuffer, input: Row): Unit = {

    buffer(0) = buffer.getAs[Long](0) + 1

    buffer(1) = buffer.getAs[Double](1) * input.getAs[Double](0)

  }


   spark会把数据划分成多个块，每个块都会进行处理，然后把每个块的结果进行合并处理

  // This is how to merge two objects with the bufferSchema type.

  override def merge(buffer1: MutableAggregationBuffer, buffer2: Row): Unit = {

    buffer1(0) = buffer1.getAs[Long](0) + buffer2.getAs[Long](0)

    buffer1(1) = buffer1.getAs[Double](1) * buffer2.getAs[Double](1)

  }


  返回结果

  // This is where you output the final value, given the final value of your bufferSchema.

  override def evaluate(buffer: Row): Any = {

    math.pow(buffer.getDouble(1), 1.toDouble / buffer.getLong(0))

  }

}

使用方法：

先注册

sqlContext.udf.register("gm", new GeometricMean)

使用自定义的UDAF

%sql

-- Use a group_by statement and call the UDAF.

select group_id, gm(id) from simple group by group_id

参考资料：

https://docs.databricks.com/spark/latest/spark-sql/udaf-scala.html

spark UDAF的更多相关文章

Spark UDAF实现举例 -- average pooling
目录 1.UDAF定义 2.向量平均(average pooling) 2.1 average的并行化 2.2 代码实现 2.3 使用参考 1.UDAF定义 spark中的UDF(UserDefin ...
自定义spark UDAF
官网链接样例代码: import java.util.ArrayList; import java.util.List; import org.apache.spark.sql.Dataset; i ...
转：Spark User Defined Aggregate Function (UDAF) using Java
Sometimes the aggregate functions provided by Spark are not adequate, so Spark has a provision of ac ...
Spark SQL 用户自定义函数UDF、用户自定义聚合函数UDAF 教程（Java踩坑教学版）
在Spark中,也支持Hive中的自定义函数.自定义函数大致可以分为三种: UDF(User-Defined-Function),即最基本的自定义函数,类似to_char,to_date等 UDAF( ...
【Spark篇】---SparkSql之UDF函数和UDAF函数
一.前述 SparkSql中自定义函数包括UDF和UDAF UDF:一进一出 UDAF:多进一出 (联想Sum函数) 二.UDF函数 UDF:用户自定义函数,user defined functio ...
Spark SQL UDAF示例
UDAF:用户自定义聚合函数 Scala 2.10.7,spark 2.0.0 package UDF_UDAF import java.util import org.apache.spark.Sp ...
【Spark篇】---SparkSQL中自定义UDF和UDAF，开窗函数的应用
一.前述 SparkSQL中的UDF相当于是1进1出,UDAF相当于是多进一出,类似于聚合函数. 开窗函数一般分组取topn时常用. 二.UDF和UDAF函数 1.UDF函数 java代码: Spar ...
Spark之UDAF
import org.apache.spark.sql.{Row, SparkSession} import org.apache.spark.sql.expressions.{MutableAggr ...
Spark笔记之使用UDAF（User Defined Aggregate Function）
一.UDAF简介先解释一下什么是UDAF(User Defined Aggregate Function),即用户定义的聚合函数,聚合函数和普通函数的区别是什么呢,普通函数是接受一行输入产生一个输出 ...

随机推荐

IO流入门-第二章-FileOutputStream
FileOutputStreamj基本用法和方法示例 /* java.io.OutputStream java.io.FileOutputStream 文件字节输出流将计算机内存中的数据写入到硬盘文 ...
Java基础语法 - 面向对象 - 类的主方法main方法
主方法是类的入口点,它指定了程序从何处开始,提供对程序流向的控制.Java编译器通过主方法来执行程序. 主方法的语法如下: /* a.主方法是静态的,如果要直接在主方法中调用其它方法,则该方法必须也是 ...
django-应用中和amdin使用富文本编辑器kindeditor
文章描述.新闻详情和产品介绍等,都需要大量的文字描述信息或图片.视频.文字的编辑等,这个时候我们就需要介绍第三方富文本编辑器. 今天介绍的是django中绑定和应用kindeditor编辑器: 效果如 ...
[动态规划]UVA437 - The Tower of Babylon
The Tower of Babylon Perhaps you have heard of the legend of the Tower of Babylon. Nowadays many d ...
007-组件和Props
一.概述组件让你可以将用户界面分成独立的,可重复使用的部分,并且可以独立思考每个部分. 从概念上讲,组件就像JavaScript函数一样.他们接受任意输入(称为“props”)并返回描述屏幕上应显示 ...
golang redis的模式订阅
c := redisPool.Get() psc := redis.PubSubConn{c} psc.PSubscribe("aa*") for { switch v := ps ...
Linux命令详情
iOS学习之七牛云存储应用
前言七牛云存储,是专为移动时代开发者打造的数据管理平台,为互联网网站和移动App提供数据的在线托管.传输加速以及图片.音视频等富媒体的云处理服务. 七牛云官网http://www.qiniu.com ...
socketserver 源码剖析：
socketserver 源码剖析[有图有真相]: (一).Socketserver 内部流程调用图: 详解: 1.self.RequestHandlerClass() = MyCla ...
s5_day5作业
# 1.写函数,用户传入修改的文件名,与要修改的内容,执行函数,完成批量修改操作 # def number_file(file,change_s,change): # import os # with ...

spark UDAF

spark UDAF的更多相关文章

随机推荐

热门专题