hive实践

本地一份包含有中文的文本文件在上传到hive前，需要先转化为UTF-8格式，否则会出现乱码。(notepad++ 格式>>>转化UTF-8编码格式)

--------------------------------------------------------------------------------------------------不带分区----------------------------------------------------------------------------------------------------------

不带分区的表创建：(换行符\n做行分割，制表符\t做列分割)

drop table if exists SCAN.ZTO_SCAN_COME_TEST_WL;

create table SCAN.ZTO_SCAN_COME_TEST_WL

(

USERNAME string,

USERID string

)

ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' LINES TERMINATED BY '\n' STORED AS TEXTFILE;

删除表数据： insert overwrite table ZTO_SCAN_COME_TEST_WL select * from ZTO_SCAN_COME_TEST_WL where 1=0;

全量导入数据方式一：覆盖

insert overwrite table ZTO_SCAN_COME_TEST_WL

select '李磊' as username,'1006' as userid from ZTO_SCAN_COME_MANSUM limit 1

全量导入数据方式二：覆盖

load data inpath '/user/hive/HQL_SOURCE/date_test_one.txt'

overwrite into table ZTO_SCAN_COME_TEST_WL

增量导入数据方式一：添加

insert into table ZTO_SCAN_COME_TEST_WL

select '李磊1' as username,'1007' as userid from ZTO_SCAN_COME_TEST_WL limit 1

增量导入数据方式二：添加

load data inpath '/user/hive/HQL_SOURCE/date_test_one.txt'

into table ZTO_SCAN_COME_TEST_WL

--------------------------------------------------------------------------------------------------带分区----------------------------------------------------------------------------------------------------------------

带分区的表创建：(换行符\n做行分割，制表符\t做列分割)

drop table if exists SCAN.ZTO_SCAN_COME_TEST_WL;

create table SCAN.ZTO_SCAN_COME_TEST_WL

(

USERNAME string,

USERID string

)

partitioned by(ds1 string,ds2 string)

ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' LINES TERMINATED BY '\n' STORED AS TEXTFILE;

删除某个分区数据：

ALTER TABLE ZTO_SCAN_COME_TEST_WL DROP IF EXISTS PARTITION (ds2='南京');

ALTER TABLE ZTO_SCAN_COME_TEST_WL DROP IF EXISTS PARTITION (ds1='20160902');

alter table ZTO_SCAN_COME_TEST_WL drop if exists partition(ds1='20160902',ds2='北京');

注意：

1、带有分区的表数据插入时，必须指定到每个分区，一个不能少

2、带有分区的表数据删除时，至少指定一个分区即可

全量导入数据方式一：覆盖

insert overwrite table ZTO_SCAN_COME_TEST_WL partition (ds1='20160901',ds2='上海')

select '李磊' as username,'1006' as userid from ZTO_SCAN_COME_MANSUM limit 1;

insert overwrite table ZTO_SCAN_COME_TEST_WL partition (ds1='20160901',ds2='南京')

select '李磊' as username,'1007' as userid from ZTO_SCAN_COME_MANSUM limit 1;

全量导入数据方式二：覆盖

load data inpath '/user/hive/HQL_SOURCE/date_test_one.txt'

overwrite into table ZTO_SCAN_COME_TEST_WL partition (ds1='20160902',ds2='南京')

load data inpath '/user/hive/HQL_SOURCE/date_test_one.txt'

overwrite into table ZTO_SCAN_COME_TEST_WL partition (ds1='20160902',ds2='泰州')

增量导入方式一：添加

insert into table ZTO_SCAN_COME_TEST_WL partition (ds1='20160901',ds2='上海')

select '李磊' as username,'1006' as userid from ZTO_SCAN_COME_MANSUM limit 1;

增量导入方式二：添加

load data inpath '/user/hive/HQL_SOURCE/date_test_one.txt'

into table ZTO_SCAN_COME_TEST_WL partition (ds1='20160902',ds2='南京')

hive实践_01的更多相关文章

达观数据分析平台架构和Hive实践——TODO
转自: http://www.infoq.com/cn/articles/hadoop-ten-years-part03 编者按:Hadoop于2006年1月28日诞生,至今已有10年,它改变了企业对 ...
Hive实践（hive0.12）
版本号:cdh5.0.0+hadoop2.3.0+hive0.12 一.原始数据: 1. 本地数据 [root@node33 data]# ll total 12936 -rw-r--r--. 1 r ...
hive学习_01
1.构建在Hadoop之上的数据仓库(数据计算使用MR,数据存储使用HDFS) 2.Hive定义了一种类SQL查询语言----HQL 3.通常用于进行离线数据处理(非实时) 4.一个ETL工具 5.可 ...
DEVOPS技术实践_01:jenkins集成平台
一.准备环境准备三台机器角色 IP地址用户名密码 jenkins-master 172.25.254.130 admin meiyoumima gitlab 172.25.254 ...
Hadoop生态系统—数据仓库Hive的安装
一.数据仓库数据仓库是一个面向主题的.集成的.随时间变化,但信息本身相对稳定的数据集合,相比于传统型数据库,它主要用于支持企业或组织的决策分析处理.主要有以下3个特点: 数据仓库是面向主题的: 数据 ...
Impala 笔记
简介 Cloudera公司推出,提供对HDFS.Hbase数据的高性能.低延迟的交互式SQL查询功能. 基于Hive使用内存计算,兼顾数据仓库.具有实时.批处理.多并发等优点是CDH平台首选的PB级 ...
【转】Kylin实践之使用Hive视图
http://blog.csdn.net/yu616568/article/details/50548967 为什么需要使用视图 Kylin在使用的过程中使用hive作为cube的输入,但是有些情况下 ...
hive权限管理之实践
一.实践心得主要参考这个连接,里面说得也挺详细的.http://www.aboutyun.com/thread-12549-1-1.html 总结如下: 1.若赋予用户某个表的权限,查用户在该表所属 ...
ETL实践--kettle转到hive
ETL实践--kettle只做源数据的抽取,其他数据转换转到hive上. 1.用hive代替kettle的数据关联的原因 (1).公司之前的数据ELT大量使用了kettle.用kettle导原始数据速 ...

随机推荐

HDU-1164-Eddy's research I(分解质因数)
由于这道题目数据范围小,所以属于水题.可以采取暴力的做法来解决. 代码如下: #include"bits/stdc++.h" using namespace std; ; ]; v ...
Android开发之《Module相互引用，NDK不能正常Debug》
解决Android Studio不能进入调试模式问题 Android Studio 2.2.3 native debug 无法调试?:https://www.zhihu.com/question/54 ...
python多重逻辑排序
python有自带的排序sorted函数,而且用reverse =True or False,来控制降序还是升序.但是如果有多个条件需要排序应该如何办呢? L = [(12, 12), (34, 13 ...
RocketMQ 单机版安装并测试
一.安装maven 1.下载maven,http://maven.apache.org/download.cgi,并解压: -bin.tar.gz 2.修改系统环境变量,并验证: vim /etc/p ...
从国内APP更新“精雕细琢” 看国内外产品理念之差
看国内外产品理念之差" title="从国内APP更新"精雕细琢" 看国内外产品理念之差"> 对于当下的大众来说,智能手机已经成为新的" ...
Presto单机/集群模式安装笔记
Presto单机/集群模式安装笔记一.安装环境二.安装步骤三.集群模式安装: 3.1 集群模式修改配置部分 3.1.1 coordinator 节点配置. Node172配置 3.1.2 nod ...
Jprofile解析dump文件使用详解
1 Jprofile简介官网下载对应的系统版本即可性能查看工具JProfiler,可用于查看java执行效率,查看线程状态,查看内存占用与内存对象,还可以分析dump日志. 2 功能简介选择a ...
Leetcode 703题数据流中的第K大元素（Kth Largest Element in a Stream）Java语言求解
题目链接 https://leetcode-cn.com/problems/kth-largest-element-in-a-stream/ 题目内容设计一个找到数据流中第K大元素的类(class) ...
痞子衡嵌入式：恩智浦i.MX RT1xxx系列MCU启动那些事（11.2）- FlexSPI NOR连接方式大全(RT1060/1064(SIP))
大家好,我是痞子衡,是正经搞技术的痞子.今天痞子衡给大家介绍的是恩智浦i.MX RT1060/1064(SIP)两款MCU的FlexSPI NOR启动的连接方式. 上一篇文章<FlexSPI N ...

hive实践_01

hive实践_01的更多相关文章

随机推荐

热门专题