FusionInsight大数据开发---Hive应用开发

Hive应用开发

了解Hive的基本架构原理
掌握JDBC客户端开发流程
了解ODBC客户端的开发流程
了解python客户端的开发流程
了解Hcatalog/webHcat开发接口
掌握Hive开发规则

1. 了解Hive的基本架构原理
守护进程：

HiveServer（Thrift/Compiler）
webHcat
MetaStore

Hive的应用场景

数据挖掘
非实时分析
数据汇总
作为数据仓库

2. 掌握JDBC客户端开发流程
JDBC开发-参数初始化

设置ZooKeeper地址
krb5文件路径
设置JAAS配置
配置ZooKeeper Principal
执行登陆

JDBC开发-拼接URL

JDBC前缀设置
服务发现模式
安全配置：qop.auth.principal
非安全配置

JDBC开发-执行SQL

加载驱动类
建立连接
执行SQL
关闭连接

JDBC开发-SQL实现

创建preparedStatement
执行statement
关闭statement

规则建议：
开发调式：在开发程序时，可通过使用Hive的客户端Beeline先进行调试，检验语句与结果正确性，再部署基于JDBC等的应用程序。
获取数据库连接：Hive的数据库URL再拼接时已经经过安全认证，所以Hive数据库的用户名和密码为null或空。

JDBC超时限制:Hive提供的JDBC实现的超时限制，默认是5分钟。

执行HQL：再JAVA　JDBC应用开发中，拼装HQL语句，注意HQL语句不能以“;“结尾。

HQL语法规则之判空：判断字段为空使用：”is null“，判断不为空，即有值，使用："is not null"

UDF的管理：建议由管理员创建永久UDF，避免每次使用时都去add jar，和重新定义UDF。

UDF的注解：Hive的UDF会有一些默认属性。@UDFType(deterministic = false)

使用分区表：当数据量较大时，且经常需要按天统计时，建议使用分区表，按天存放数据。

动态分区表：为了避免插入动态分区数据过程中，产生过多的小文件，在执行插入时，在分区字段上加distribut by。

文件格式选择：Hive支持多种存储格式，比如TextFile,RCFile,ORC,Sequence,Parquet.

FusionInsight大数据开发---Hive应用开发的更多相关文章

FusionInsight大数据开发学习总结（1）
FusionInsight大数据开发 FusionInsight HD是一个大数据全栈商用平台,支持各种通用大数据应用场景. 技能需求扎实的编程基础 Java/Scala/python/SQL/sh ...
大数据全栈式开发语言 – Python
前段时间,ThoughtWorks在深圳举办一次社区活动上,有一个演讲主题叫做“Fullstack JavaScript”,是关于用JavaScript进行前端.服务器端,甚至数据库(MongoDB) ...
为什么说Python 是大数据全栈式开发语言
欢迎大家访问我的个人网站<刘江的博客和教程>:www.liujiangblog.com 主要分享Python 及Django教程以及相关的博客交流QQ群:453131687 原文链接 h ...
大数据平台Hive数据迁移至阿里云ODPS平台流程与问题记录
一.背景介绍最近几天,接到公司的一个将当前大数据平台数据全部迁移到阿里云ODPS平台上的任务.而申请的这个ODPS平台是属于政务内网的,因考虑到安全问题当前的大数据平台与阿里云ODPS的网络是不通的 ...
FusionInsight大数据开发---MapReduce与YARN应用开发
MapReduce MapReduce的基本定义及过程搭建开发环境代码实例及运行程序 MapReduce开发接口介绍 1. MapReduce的基本定义及过程 MapReduce是面向大数据并行处 ...
FusionInsight大数据开发---HDFS应用开发
HDFS应用开发 HDFS(Dadoop Distributed File System) HDFS概述高容错性高吞吐量大文件存储 HDFS架构包含三部分 Name Node DataNode ...
FusionInsight大数据开发---Redis应用开发
Redis应用开发要求: 了解Redis应用场景掌握Redis二次开发环境搭建掌握Redis业务开发 Redis简介 Redis是一个基于网络的,高性能key-value内存数据库 Redis根 ...
一文总结高并发大数据量下MySQL开发规范【军规】
在互联网公司中,MySQL是使用最多的数据库,那么在并发量大.数据量大的互联网业务中,如果高效的使用MySQL才能保证服务的稳定呢?根据本人多年运维管理经验的总结,梳理了一些核心的开发规范,希望能给大 ...
大数据利器Hive
序言:在大数据领域存在一个现象,那就是组件繁多,粗略估计一下轻松超过20种.如果你是初学者,瞬间就会蒙圈,不知道力往哪里使.那么,为什么会出现这种现象呢?在本文的开头笔者就简单的阐述一下这种现象出现的 ...

随机推荐

获取Android崩溃crash信息并写入日志发送邮件
一.实现Thread.UncaughtExceptionHandlerUnChecked异常发生时,由于没有相应的try…catch处理该异常对象,所以Java运行环境将会终止,程序将退出,也就是我们 ...
未能加载文件或程序集“Spire.Pdf, Version=4.8.8.2020, Culture=neutral, PublicKeyToken=663f351905198cb3”或它的某一个依赖项。未能授予最小权限请求
问题:运行程序执行到代码报错:未能加载文件或程序集“Spire.Pdf, Version=4.8.8.2020, Culture=neutral, PublicKeyToken=663f3519051 ...
c++ c的拓展
C++对c的拓展之, 引用和const关键字 bool类型关键字 C++中的布尔类型 C++在C语言的基本类型系统之上增加了bool C++中的bool可取的值只有true和false 理论上bool ...
np.random 系列函数
1 random() # 产生区间 [0, 1) 均匀分布的浮点数样本值 np.random.seed(42) 2 rand(d0, d1, ..., dn) # 产生区间 [0, 1) 均 ...
Nginx对图片进行防盗链
这里需要使用两台Linux主机(一台充当防盗链服务器,一台充当盗链服务器),下表是它们所使用的操作系统以及IP地址. 两台Linux主机所使用的操作系统以及IP地址主机名称操作系统 IP地址防盗 ...
防御流类型的xss攻击
1.建立一个工具类 package im.lsn.oss.exhibition.utils; import org.apache.commons.lang3.StringUtils; import j ...
Anaconda3（0）环境基本使用
https://blog.csdn.net/u012005313/article/details/82347817 主要内容: 查看环境列表创建新的 Python 环境激活/停止 Python 环 ...
Python——IO多路复用之select模块poll方法
Python——IO多路复用之select模块poll方法使用poll方法实现IO多路复用 .├── poll_client.py├── poll_server.py└── settings.py ...
[RN] React Native 使用图片预览和放大插件 react-native-image-zoom-viewer 过程中，放大报错问题
React Native 使用图片预览和放大插件 react-native-image-zoom-viewer 过程中,放大报错问题报错如下: Cannot record touch end w ...
failed to execute /bin/bash: Resource temporarily unavailable的问题处理
[admin@localhost ~]$ sudo su - scloanLast login: Tue Jun 12 14:06:31 CST 2018 on pts/3su: failed to ...

FusionInsight大数据开发---Hive应用开发

Hive应用开发

FusionInsight大数据开发---Hive应用开发的更多相关文章

随机推荐

热门专题