Spark(Hive) SQL中UDF的使用（Python）

相对于使用MapReduce或者Spark Application的方式进行数据分析，使用Hive SQL或Spark SQL能为我们省去不少的代码工作量，而Hive SQL或Spark SQL本身内置的各类UDF也为我们的数据处理提供了不少便利的工具，当这些内置的UDF不能满足于我们的需要时，Hive SQL或Spark SQL还为我们提供了自定义UDF的相关接口，方便我们根据自己的需求进行扩展。

在Hive的世界里使用自定义UDF的过程是比较复杂的。我们需要根据需求使用Java语言开发相应的UDF（UDAF、UDTF），然后将UDF的代码及其依赖编译打包为Jar，使用方法有两种：

（1）临时函数

在一次会话（Session）中使用如下语句创建临时函数：

ADD JAR /run/jar/udf_test.jar;

CREATE TEMPORARY FUNCTION my_add AS 'com.hive.udf.Add';

这种方式有一个缺点：每一次会话过程中使用函数时都需要创建，而且仅在当前会话中有效。

（2）永久函数

这个特性需要高版本的Hive支持，它的好处是可以将UDF Jar存放至HDFS，函数仅需要创建一次即可以永久使用，如下：

CREATE FUNCTION func.ipToLocationBySina AS 'com.sina.dip.hive.function.IPToLocationBySina' USING JAR 'hdfs://dip.cdh5.dev:8020/user/hdfs/func/location.jar';

虽然永久函数相对于临时函数有一定优势，但Java语言的开发门槛很大程度上妨碍了UDF在实际数据分析过程中使用，毕竟我们的数据分析师多数是以Python、SQL为主要分析工具的，每一次UDF的开发都需要工程师的参与，开发效率与应用效果都是不是很好（可能需要频繁更新UDF的问题），PySpark的出现确很好地解决了这个问题：它可以非常方便地将一个普通的Python函数注册为一个UDF。

为了说明如何在Spark(Hive) SQL中的使用Python UDF，我们首先模拟一张数据表，为了简单起见，该表仅有一行一列数据：

我们模拟了一张数据表temp_table，该表仅有一列，其中列名称为col，列类型为字符串且不允许包含Null，输出结果：

我们在表temp_table的基础之上演示UDF的使用方法：

首先我们定义一个普通的Python函数：func_string，为了简单起见它没有任何参数，仅仅返回一个简单的字符串；

然后我们通过HiveContext registerFunction即可以将函数func_string注册为UDF，registerFunction接收两个参数：UDF名称、UDF关联的Python函数；

最后我们可以在Spark(Hive) SQL中使用这个UDF，输出结果：

我们需要注意的是，HiveContext registerFunction实际上有三个参数：

name：UDF名称；

f：UDF关联的Python函数；

returnType：UDF（Python函数）返回值类型，默认为StringType()。

上述示例中因为我们的UDF函数的返回值类型为字符串，因此使用Hive registerFunction注册UDF时省略了参数returnType，即returnType默认值为StringType()，如果UDF（Python函数）的返回值类型不为字符串，则需要显式为其指定returnType。

我们以类型IntegerType、ArrayType、StructType、MapType为例演示需要显式指定returnType的情况。

（1）IntegerType

（2）ArrayType

注意：ArrayType（数组）必须确保元素类型的一致性，如指定UDF返回值类型为ArrayType(IntegerType())，则函数func_array的返回值类型必须为list或tuple，其中的元素类型必须为int。

（3）StructType

注意：StructType必须确保函数的返回值类型为tuple，而且使用HiveContext registerFunction注册UDF时需要依次为其中的元素指定名称各类型，如上述示例中每一个元素的名称为first，类型为IntegerType；第二个元素的名称为second，类型为FloatType；第三个元素的名称为third，类型为StringType。

（4）MapType

注意：MapType必须确保函数的返回值类型为dict，而且所有的“key”应保持类型一致，“value”也就保持类型一致。

Spark(Hive) SQL中UDF的使用（Python）的更多相关文章

Spark(Hive) SQL中UDF的使用（Python）【转】
相对于使用MapReduce或者Spark Application的方式进行数据分析,使用Hive SQL或Spark SQL能为我们省去不少的代码工作量,而Hive SQL或Spark SQL本身内 ...
Spark(Hive) SQL数据类型使用详解(Python)
Spark SQL使用时需要有若干“表”的存在,这些“表”可以来自于Hive,也可以来自“临时表”.如果“表”来自于Hive,它的模式(列名.列类型等)在创建时已经确定,一般情况下我们直接通过Spar ...
Spark SQL中UDF和UDAF
转载自:https://blog.csdn.net/u012297062/article/details/52227909 UDF: User Defined Function,用户自定义的函数,函数 ...
两种方式— 在hive SQL中传入参数
第一种: sql = sql.format(dt=dt) 第二种: item_third_cate_cd_list = " 发发发 " ...... ""&qu ...
Hive SQL 编译过程
转自:http://www.open-open.com/lib/view/open1400644430159.html Hive跟Impala貌似都是公司或者研究所常用的系统,前者更稳定点,实现方式是 ...
【转】Hive SQL的编译过程
Hive是基于Hadoop的一个数据仓库系统,在各大公司都有广泛的应用.美团数据仓库也是基于Hive搭建,每天执行近万次的Hive ETL计算流程,负责每天数百GB的数据存储和分析.Hive的稳定性和 ...
Hive SQL的编译过程
文章转自:http://tech.meituan.com/hive-sql-to-mapreduce.html Hive是基于Hadoop的一个数据仓库系统,在各大公司都有广泛的应用.美团数据仓库也是 ...
转:Hive SQL的编译过程
Hive是基于Hadoop的一个数据仓库系统,在各大公司都有广泛的应用.美团数据仓库也是基于Hive搭建,每天执行近万次的Hive ETL计算流程,负责每天数百GB的数据存储和分析.Hive的稳定性和 ...
Hive SQL的编译过程[转载自https://tech.meituan.com/hive-sql-to-mapreduce.html]
https://tech.meituan.com/hive-sql-to-mapreduce.html Hive是基于Hadoop的一个数据仓库系统,在各大公司都有广泛的应用.美团数据仓库也是基于Hi ...

随机推荐

Python教程：连接数据库，对数据进行增删改查操作
各位志同道合的同仁可以点击上方关注↑↑↑↑↑↑ 本教程致力于程序员快速掌握Python语言编程. 本文章内容是基于上次课程Python教程:操作数据库,MySql的安装详解和python基础知识之上 ...
隐藏元素的宽高无法通过原生js获取的问题
1.起源:移动app项目中,页面加载时需要加载国家下拉列表,将隐藏的透明浮层和一个显示加载过程中的框显示出来,隐藏的透明浮层设置宽高都是100%即可,而这个加载提示框需要先得出它的宽高,然后再根据页 ...
Python初学记录
发音: 拍怂语系:类C 特点: 1语句控制不用{}和(),而是强制用户空格或tab缩进.空格和tab数量不一定. 2解释性语言,不需要事先声明变量,即写即用. 3.list 列表可存放多种类型数据. ...
C#中堆和栈的区别分析(有待更新总结)
转载:http://blog.csdn.net/zevin/article/details/5721495 一.预备知识-程序的内存分配一个由C/C++编译的程序占用的内存分为以下几个部分 1.栈区 ...
Mysql DB2等数据库分页的实现
一.Mysql的分页 (一).MySQL分页的实现,使用关键字:Limit 语法:select * from tableName Limit A,B; 注释:tableName:表名 A:查询的 ...
配置hive元数据库mysql时候出现 Unable to find the JDBC database jar on host : master
解决办法: cd /usr/share/java/,(没有java文件夹,自行创建)rz mysql-connector-java-***.jar,mv mysql-connector-java-* ...
Set集合中的HashSet集合
HashSet集合的特点:元素是具备唯一性的,每次存储都要先算出哈希值,看有没相同,没有相同的存储到相应的位置,如果相同则再判断存储进来的值是否与被比较的相同,如果相同,则不再存储,不同就存储 pac ...
PHP 编译问题PEAR package PHP_Archive not installed的解决
php 的编译时需要依赖pear package ,目前的问题错误"PEAR package PHP_Archive not installed",已经明显报出这个问题. 因此编译 ...
PHP常用数组函数
一.数组操作的基本函数数组的键名和值 array_values($arr); 获得数组的值 array_keys($arr); 获得数组的键名 array_flip($arr); 数组中的 ...
css字体大小设置em与rem的区别
em 单位em是相对于父元素的,如果父元素没有设置字体大小,那就会追溯到body. 比如如果我在box_text的父元素box加了一个字体大小那么body的8px就会被box_text的父元 ...

Spark(Hive) SQL中UDF的使用（Python）

Spark(Hive) SQL中UDF的使用（Python）的更多相关文章

随机推荐

热门专题