特性速览| Apache Hudi 0.5.3版本正式发布

1. 下载连接

源代码下载：Apache Hudi 0.5.3 Source Release (asc, sha512)
0.5.3版本相关jar包地址：https://repository.apache.org/#nexus-search;quick~hudi

2. 迁移指南

这是一个bugfix版本，从0.5.2升级时不需要任何特殊的迁移步骤。如果要从早期版本"X"升级，请阅读"X"和0.5.3之间的每个后续版本的迁移指南。
0.5.3是Hudi毕业后的第一个版本，因此所有hudi jar的版本名称中不再带有"-incubating"。在所有提及hudi版本的地方，请确保不再存在"-incubating"。

例如，hudi-spark-bundle pom依赖如下所示：

<dependency>

	<groupId>org.apache.hudi</groupId>

	<artifactId>hudi-spark-bundle_2.12</artifactId>

	<version>0.5.3</version>

</dependency>

3. 关键特性

Hudi内置支持 aliyun OSS 对象存储。
默认情况下将为delta-streamer和spark datasource写入启用Embedded Timeline Server。在此版本之前，此功能处于实验模式，embeddedTimeline Server在Spark Driver中缓存文件列表，并提供Restful接口给Spark Writer任务调用来减少了每次写入时的list文件列表的操作，此优化对云上对象存储非常友好。
默认情况下为delta-streamer和Spark datasource写入均启用"增量清理(incremental cleaning)"。在此版本之前，此功能还处于实验模式，在稳定状态下，增量清理避免了扫描所有分区的昂贵步骤，而是使用Hudi元数据来查找要清理的文件，此优化也对云上对象存储非常友好。
支持将Delta-Streamer配置文件放置在与实际数据不同的文件系统中。
Hudi Hive Sync现在支持按日期类型列分区的表。

Hudi Hive Sync现在支持直接通过Hive MetaStore进行同步。您只需要设置hoodie.datasource.hive_sync.use_jdbc = false。Hive Metastore Uri将从environment中隐式读取。例如当通过Spark datasource写入时，

 spark.write.format(“hudi”)

 .option(…)

 .option(“hoodie.datasource.hive_sync.username”, “<user>”)

 .option(“hoodie.datasource.hive_sync.password”, “<password>”)

 .option(“hoodie.datasource.hive_sync.partition_fields”, “<partition_fields>”)

 .option(“hoodie.datasource.hive_sync.database”, “<db_name>”)

 .option(“hoodie.datasource.hive_sync.table”, “<table_name>”)

 .option(“hoodie.datasource.hive_sync.use_jdbc”, “false”)

 .mode(APPEND)

 .save(“/path/to/dataset”)

支持Presto查询MoR表时Hudi侧的改造。
其他与Writer Performance相关的缺陷修复。
- 现在DataSource Writer避免了写入后不必要的数据加载。
- Hudi Writer现在利用spark的并发来加速小文件查找。

4. 感谢

感谢如下贡献者（排名不分先后）: @bhasudha，@yanghua ，@ddong ，@smarthi ，@afilipchik，@zhedoubushishi，@umehrot2，@varadar，@ffcchi，@bschell，@vinothchandar ，@shenh062326，@lamber-ken，@zhaomin1423，@EdwinGuo，@prashantwason ，@pratyakshsharma，@dengziming ，@AakashPradeep，@Jecarm ，@xushiyan ，@cxzl25，@garyli1019 ，@rolandjohann ，@nsivabalan，@leesf ，@jfrazee

特性速览| Apache Hudi 0.5.3版本正式发布的更多相关文章

Apache Hudi 0.5.1版本重磅发布
历经大约3个月时间,Apache Hudi 社区终于发布了0.5.1版本,这是Apache Hudi发布的第二个Apache版本,该版本中一些关键点如下版本升级将Spark版本从2.1.0升级到2 ...
Apache Hudi 0.6.0版本重磅发布
1. 下载信息源码:Apache Hudi 0.6.0 Source Release (asc, sha512) 二进制Jar包:nexus 2. 迁移指南如果您从0.5.3以前的版本迁移至0.6 ...
Apache Hudi 0.8.0版本重磅发布
1. 重点特性 1.1 Flink集成自从Hudi 0.7.0版本支持Flink写入后,Hudi社区又进一步完善了Flink和Hudi的集成.包括重新设计性能更好.扩展性更好.基于Flink状态索引 ...
Apache Pulsar 2.6.1 版本正式发布：2.6.0 功能增强版，新增 OAuth2 支持
在 Apache Pulsar 2.6.0 版本发布后的 2 个月,2020 年 8 月 21 日,Apache Pulsar 2.6.1 版本正式发布! Apache Pulsar 2.6.1 修复 ...
golang1.16新特性速览
今天是假期最后一天,明天起大家也要陆续复工了.golang1.16也在今天正式发布了. 原定计划是2月1号年前发布的,不过迟到也是golang的老传统了,正好也趁着最后的假期快速预览一下golang1 ...
Apache Hudi 0.7.0版本重磅发布
重点特性 1. Clustering 0.7.0版本中支持了对Hudi表数据进行Clustering(对数据按照数据特征进行聚簇,以便优化文件大小和数据布局),Clustering提供了更灵活地方式增 ...
Python 3.9 新特性速览
国庆假期,Python 社区发布了 3.9 版本的第一个 stable release. 相比于 3.8,Python 3.9 新特性众多,但不少特性与大多数 Python"使用者" ...
官宣！AWS Athena正式可查询Apache Hudi数据集
1. 引入 Apache Hudi是一个开源的增量数据处理框架,提供了行级insert.update.upsert.delete的细粒度处理能力(Upsert表示如果数据集中存在记录就更新:否则插入) ...
Apache Hudi又双叕被国内顶级云服务提供商集成了！
是的,最近国内云服务提供商腾讯云在其EMR-V2.2.0版本中优先集成了Hudi 0.5.1版本作为其云上的数据湖解决方案对外提供服务 Apache Hudi 在 HDFS 的数据集上提供了插入更新和 ...

随机推荐

Android_基础之分辨率
常见屏幕分辨率对应尺寸标屏分辨率比例宽屏分辨率比例 QCIF 176X144 11:9 CIF 352X288 11:9 QVGA 320X240 4:3 WQVG ...
【数字图像处理】OpenCV中cv2.imread()与PIL中Image.open()的差别
cv2.imread()与PIL中Image.open()两个函数都是用来读取图像,但是在使用过程存在一些差别. 1. 首先,从导入库方面看: # opencv-python import cv2 # ...
子串 NOIP2015 D2T2 luoguP2679 字符串处理+DP
AC通道! 题目大意: 给定两个长度分别为 n 和 m 的字符串 A 和 B,选取 A 中的 k 个子串,使这 k 个子串按照先后顺序连接起来后等于 B 子串. 输入输出样例输入 #1 6 3 ...
[安卓基础] 004.运行app
运行你的app 这篇课程会教你: 1.如何在设备上运行你的app. 2.如何在模拟器上运行你的app. 当然,在学习之前,你还需要知道: 1.如何使用设备. 2.如何使用模拟器. 3.管理你的项目. ...
C# 根据BackgroundWoker异步模型和ProgressBar控件,自定义进度条控件
前言程序开发过程中,难免会有的业务逻辑,或者算法之类产生让人能够感知的耗时操作,例如循环中对复杂逻辑处理;获取数据库百万乃至千万级数据;http请求的时候等...... 用户在使用UI操作并不知道程 ...
常用docker命令备忘录
查看镜像 docker images 查看运行中的容器 docker ps 删除镜像 docker rmi 容器id 直接删除所有镜像 docker rmi `docker images -q` 直接 ...
Matlab矩阵学习二矩阵的修改
Matlab矩阵的修改一.元素修改 (1).矩阵扩充 (2)矩阵删除某行或某列删除某行:A(m,:)=[] %删除A矩阵的第m行删除某列: A(:,n)=[] %删除A矩阵的第n列 ...
CTR学习笔记&代码实现6-深度ctr模型后浪 xDeepFM/FiBiNET
xDeepFM用改良的DCN替代了DeepFM的FM部分来学习组合特征信息,而FiBiNET则是应用SENET加入了特征权重比NFM,AFM更进了一步.在看两个model前建议对DeepFM, Dee ...
Cypress系列（5）- 自定义 Cypress
如果想从头学起Cypress,可以看下面的系列文章哦 https://www.cnblogs.com/poloyy/category/1768839.html 前言 Cypress 不仅支持用户自定义 ...
ASP.NET MVC 数据传递视图向控制器传递
视图向控制器传递 MVC 视图向控制器传递,就是获取用户输入的数据,在去进行操作好了,我们不多说直接进行我们的案例. 在HomeController类中添加下来方法 [HttpPost] publi ...

特性速览| Apache Hudi 0.5.3版本正式发布

1. 下载连接

2. 迁移指南

3. 关键特性

4. 感谢

特性速览| Apache Hudi 0.5.3版本正式发布的更多相关文章

随机推荐

热门专题