Hive 10、Hive的UDF、UDAF、UDTF

Hive自定义函数包括三种UDF、UDAF、UDTF

　　UDF(User-Defined-Function) 一进一出

　　UDAF(User- Defined Aggregation Funcation) 聚集函数，多进一出。Count/max/min

　　UDTF(User-Defined Table-Generating Functions) 一进多出，如lateral view explore()

　　使用方式：在HIVE会话中add 自定义函数的jar文件，然后创建function继而使用函数

UDF

1、UDF函数可以直接应用于select语句，对查询结构做格式化处理后，再输出内容。

2、编写UDF函数的时候需要注意一下几点：

　　a）自定义UDF需要继承org.apache.hadoop.hive.ql.UDF。

　　b）需要实现evaluate函数，evaluate函数支持重载。

　　例：写一个返回字符串长度的Demo:

import org.apache.hadoop.hive.ql.exec.UDF;

public class GetLength extends UDF{

    public int evaluate(String str) {

        try{

            return str.length();

        }catch(Exception e){

            return -1;

        }

    }

}

3、步骤

　　a）把程序打包放到目标机器上去；

　　b）进入hive客户端，添加jar包：

hive> add jar /root/hive_udf.jar

　　c）创建临时函数：

hive> create temporary function getLen as 'com.raphael.len.GetLength';

　　d）查询HQL语句：

hive> select getLen(info) from apachelog;

OK

60

29

87

102

69

60

67

79

66

Time taken: 0.072 seconds, Fetched: 9 row(s)

　　e）销毁临时函数：

hive> DROP TEMPORARY FUNCTION getLen;

UDAF

多行进一行出，如sum()、min()，用在group by时

1.必须继承

　　org.apache.hadoop.hive.ql.exec.UDAF(函数类继承)

　　org.apache.hadoop.hive.ql.exec.UDAFEvaluator(内部类Evaluator实现UDAFEvaluator接口)

2.Evaluator需要实现 init、iterate、terminatePartial、merge、terminate这几个函数

　　init():类似于构造函数，用于UDAF的初始化

　　iterate():接收传入的参数，并进行内部的轮转，返回boolean

　　terminatePartial():无参数，其为iterate函数轮转结束后，返回轮转数据，类似于hadoop的Combiner

　　merge():接收terminatePartial的返回结果，进行数据merge操作，其返回类型为boolean

　　terminate():返回最终的聚集函数结果

　　#开发一个功能同：

　　#Oracle的wm_concat()函数

　　#Mysql的group_concat()

　　UDAF 详细文档：http://www.cnblogs.com/ggjucheng/archive/2013/02/01/2888051.html

UDTF

　　UDTF 详细文档: http://www.cnblogs.com/ggjucheng/archive/2013/02/01/2888819.html

Hive 10、Hive的UDF、UDAF、UDTF的更多相关文章

[转]HIVE UDF/UDAF/UDTF的Map Reduce代码框架模板
FROM : http://hugh-wangp.iteye.com/blog/1472371 自己写代码时候的利用到的模板 UDF步骤: 1.必须继承org.apache.hadoop.hive ...
hive中 udf,udaf,udtf
1.hive中基本操作: DDL,DML 2.hive中函数 User-Defined Functions : UDF(用户自定义函数,简称JDF函数)UDF: 一进一出 upper lower ...
Hive 自定义函数 UDF UDAF UDTF
1.UDF:用户定义(普通)函数,只对单行数值产生作用: 继承UDF类,添加方法 evaluate() /** * @function 自定义UDF统计最小值 * @author John * */ ...
【转】HIVE UDF UDAF UDTF 区别使用
原博文出自于:http://blog.csdn.net/longzilong216/article/details/23921235(暂时) 感谢! 自己写代码时候的利用到的模板 UDF步骤: 1 ...
简述UDF/UDAF/UDTF是什么，各自解决问题及应用场景
UDF User-Defined-Function 自定义函数 .一进一出: 背景系统内置函数无法解决实际的业务问题,需要开发者自己编写函数实现自身的业务实现诉求. 应用场景非常多,面临的业务不同导 ...
Hive 文件格式 & Hive操作（外部表、内部表、区、桶、视图、索引、join用法、内置操作符与函数、复合类型、用户自定义函数UDF、查询优化和权限控制）
本博文的主要内容如下: Hive文件存储格式 Hive 操作之表操作:创建外.内部表 Hive操作之表操作:表查询 Hive操作之表操作:数据加载 Hive操作之表操作:插入单表.插入多表 Hive语 ...
Hadoop生态圈-Hive的自定义函数之UDAF（User-Defined Aggregation Function）
Hadoop生态圈-Hive的自定义函数之UDAF(User-Defined Aggregation Function) 作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任.
Hive扩展功能(三)--使用UDF函数将Hive中的数据插入MySQL中
软件环境: linux系统: CentOS6.7 Hadoop版本: 2.6.5 zookeeper版本: 3.4.8 主机配置: 一共m1, m2, m3这五部机, 每部主机的用户名都为centos ...
10.hive安装
上传hive安装包并解压给hive设置一个软链接给hive配置环境变量 sudo vim /etc/profile #hive export HIVE_HOME=/opt/modules/hive ...

随机推荐

PYCHARM配置文件如何导入
请到此下载,如下: http://share.weiyun.com/c00040649e85c4ab1dbc47a0fe9a0a7a 或者:http://files.cnblogs.com/files ...
opencv 实现进度控制
进度控制: #include <opencv\cv.h> #include <opencv\highgui.h> #include <opencv\cxcore.h> ...
Qt 5.4正式发布！引入WP，支持HTML5混合开发
北京时间12月11日消息,Digia全资子公司The Qt Company在其官方博客上宣布,正式发布Qt 5.4,支持HTML5混合开发,引入对于Windows Phone的支持,以及众多跨桌面. ...
XMLHTTP请求的当前状态
readyState,此属性只读,状态用长度为4的整型表示.定义如下: 0 (未初始化) 对象已建立,但是尚未初始化(尚未调用open方法) 1 (初始化) 对象已建立,尚未调用send方法 2 (发 ...
android-用xml自定义背景（可自定义显示具体那一边）
常见的描边都是闭合的.四个边都有.如下: <?xml version="1.0" encoding="UTF-8"?> <layer-list ...
用sp_change_users_login消除Sql Server的孤立用户
异常详细信息: System.Data.SqlClient.SqlException: 拒绝了对对象 'zwj_EnterpriseActivities' (数据库 'Ntours',架构 'dbo' ...
web 调用OPC HRESULT:0x80070005 (E_ACCESSDENIED))
除了配置DCOM外,还需要在web.config里面添加设置系统管理员权限的帐号和密码<identity impersonate="true" userName=" ...
android如何保存读取读取文件文件保存到SDcard
android如何保存读取读取文件文件保存到SDcard 本文来源于www.ifyao.com禁止转载!www.ifyao.com 上图为保存文件的方法体. 上图为如何调用方法体保存数据. 上面的截图 ...
hadoop调优之一：概述
hadoop集群性能低下的常见原因 (一)硬件环境 1.CPU/内存不足,或未充分利用 2.网络原因 3.磁盘原因 (二)map任务原因 1.输入文件中小文件过多,导致多次启动和停止JVM进程.可以设 ...
Sherlock and GCD
1 import fractions, functools, sys if __name__ == '__main__': T = int(sys.stdin.readline()) for _ in ...

Hive 10、Hive的UDF、UDAF、UDTF

Hive 10、Hive的UDF、UDAF、UDTF的更多相关文章

随机推荐

热门专题