hive学习笔记之三：内部表和外部表

欢迎访问我的GitHub

https://github.com/zq2599/blog_demos

内容：所有原创文章分类汇总及配套源码，涉及Java、Docker、Kubernetes、DevOPS等；

《hive学习笔记》系列导航

本篇概览

本文是《hive学习笔记》系列的第三篇，要学习的是各种类型的表及其特点，主要内容如下：

建库
内部表(也叫管理表或临时表)
外部表
表的操作

接下来从最基本的建库开始

建库

创建名为test的数据库(仅当不存在时才创建)，添加备注信息test database：

create database if not exists test

comment 'this is a database for test';

查看数据库列表（名称模糊匹配）：

hive> show databases like 't*';

OK

test

test001

Time taken: 0.016 seconds, Fetched: 2 row(s)

describe database命令查看此数据库信息：

hive> describe database test;

OK

test	this is a database for test	hdfs://node0:8020/user/hive/warehouse/test.db	hadoop	USER

Time taken: 0.035 seconds, Fetched: 1 row(s)

上述命令可见，test数据库在hdfs上的存储位置是hdfs://node0:8020/user/hive/warehouse/test.db，打开hadoop的web页面，查看hdfs目录，如下图，该路径的文件夹已经创建，并且是以.db结尾的：

5. 新建数据库的文件夹都在/user/hive/warehouse下面，这是在中配置的，如下图红框：

6. 删除数据库，加上if exists，当数据库不存在时，执行该语句不会返回Error：

hive> drop database if exists test;

OK

Time taken: 0.193 seconds

以上就是常用的库相关操作，接下来实践表相关操作；

内部表

按照表数据的生命周期，可以将表分为内部表和外部表两类；
内部表也叫管理表或临时表，该类型表的生命周期时由hive控制的，默认情况下数据都存放在/user/hive/warehouse/下面；
删除表时数据会被删除；
以下命令创建的就是内部表，可见前面两篇文章中创建的表都是内部表：

create table t6(id int, name string)

row format delimited

fields terminated by ',';

向t6表新增一条记录：

insert into t6 values (101, 'a101');

使用hadoop命令查看hdfs，可见t6表有对应的文件夹，里面的文件保存着该表数据：

[hadoop@node0 bin]$ ./hadoop fs -ls /user/hive/warehouse/t6

Found 1 items

-rwxr-xr-x   3 hadoop supergroup          9 2020-10-31 11:14 /user/hive/warehouse/t6/000000_0

查看这个000000_0文件的内容，如下可见，就是表内的数据：

[hadoop@node0 bin]$ ./hadoop fs -cat /user/hive/warehouse/t6/000000_0

101	a101

执行命令drop table t6;删除t6表，再次查看t6表对应的文件，发现整个文件夹都不存在了：

[hadoop@node0 bin]$ ./hadoop fs -ls /user/hive/warehouse/

Found 5 items

drwxr-xr-x   - hadoop supergroup          0 2020-10-27 20:42 /user/hive/warehouse/t1

drwxr-xr-x   - hadoop supergroup          0 2020-10-29 00:13 /user/hive/warehouse/t2

drwxr-xr-x   - hadoop supergroup          0 2020-10-29 00:14 /user/hive/warehouse/t3

drwxr-xr-x   - hadoop supergroup          0 2020-10-29 13:04 /user/hive/warehouse/t4

drwxr-xr-x   - hadoop supergroup          0 2020-10-29 16:47 /user/hive/warehouse/t5

外部表

创建表的SQL语句中加上external，创建的就是外部表了；
外部表的数据生命周期不受Hive控制；
删除外部表的时候不会删除数据；
外部表的数据，可以同时作为多个外部表的数据源共享使用；
接下来开始实践，下面是建表语句：

create external table t7(id int, name string)

row format delimited

fields terminated by ','

location '/data/external_t7';

查看hdfs文件，可见目录/data/external_t7/已经创建：

[hadoop@node0 bin]$ ./hadoop fs -ls /data/

Found 1 items

drwxr-xr-x   - hadoop supergroup          0 2020-10-31 12:02 /data/external_t7

新增一条记录：

insert into t7 values (107, 'a107');

在hdfs查看t7表对应的数据文件，可以见到新增的内容：

[hadoop@node0 bin]$ ./hadoop fs -ls /data/external_t7

Found 1 items

-rwxr-xr-x   3 hadoop supergroup          9 2020-10-31 12:06 /data/external_t7/000000_0

[hadoop@node0 bin]$ ./hadoop fs -cat /data/external_t7/000000_0

107,a107

试试多个外部表共享数据的功能，执行以下语句再建个外部表，名为t8，对应的存储目录和t7是同一个：

create external table t8(id_t8 int, name_t8 string)

row format delimited

fields terminated by ','

location '/data/external_t7';

建好t8表后立即查看数据，发现和t7表一模一样，可见它们已经共享了数据：

hive> select * from t8;

OK

107	a107

Time taken: 0.068 seconds, Fetched: 1 row(s)

hive> select * from t7;

OK

107	a107

Time taken: 0.074 seconds, Fetched: 1 row(s)

接下来删除t7表，再看t8表是否还能查出数据，如下可见，数据没有被删除，可以继续使用：

hive> drop table t7;

OK

Time taken: 1.053 seconds

hive> select * from t8;

OK

107	a107

Time taken: 0.073 seconds, Fetched: 1 row(s)

把t8表也删掉，再去看数据文件，如下所示，依然存在：

[hadoop@node0 bin]$ ./hadoop fs -cat /data/external_t7/000000_0

107,a107

可见外部表的数据不会在删除表的时候被删除，因此，在实际生产业务系统开发中，外部表是我们主要应用的表类型；

表的操作

再次创建t8表：

create table t8(id int, name string)

row format delimited

fields terminated by ',';

修改表名：

alter table t8 rename to t8_1;

可见修改表名已经生效：

hive> alter table t8 rename to t8_1;

OK

Time taken: 0.473 seconds

hive> show tables;

OK

alltype

t1

t2

t3

t4

t5

t6

t8_1

values__tmp__table__1

values__tmp__table__2

Time taken: 0.029 seconds, Fetched: 10 row(s)

添加字段：

alter table t8_1 add columns(remark string);

查看表结构，可见已经生效：

hive> desc t8_1;

OK

id                  	int

name                	string

remark              	string

Time taken: 0.217 seconds, Fetched: 3 row(s)

至此，咱们对内部表和外部表已经有了基本了解，接下来的文章学习另一种常见的表类：分区表；

你不孤单，欣宸原创一路相伴

欢迎关注公众号：程序员欣宸

微信搜索「程序员欣宸」，我是欣宸，期待与您一同畅游Java世界...

https://github.com/zq2599/blog_demos

hive学习笔记之三：内部表和外部表的更多相关文章

大数据学习day26----hive01----1hive的简介 2 hive的安装（hive的两种连接方式，后台启动，标准输出，错误输出）3. 数据库的基本操作 4. 建表（内部表和外部表的创建以及应用场景，数据导入，学生、分数sql练习）5.分区表 6加载数据的方式
1. hive的简介(具体见文档) Hive是分析处理结构化数据的工具本质:将hive sql转化成MapReduce程序或者spark程序 Hive处理的数据一般存储在HDFS上,其分析数据底 ...
hive 内部表和外部表的区别和理解
1. 内部表 create table test (name string , age string) location '/input/table_data'; 注:hive默认创建的是内部表此时 ...
【转】Hive内部表、外部表
hive内部表.外部表区别自不用说,可实际用的时候还是要小心. 1. 内部表: create table tt (name string , age string) location '/input/ ...
hive内部表、外部表
hive内部表.外部表区别自不用说,可实际用的时候还是要小心. Hive的数据分为表数据和元数据,表数据是Hive中表格(table)具有的数据:而元数据是用来存储表的名字,表的列和分区及其属性,表的 ...
hive 学习笔记——表的入门操作和命令
1.受控表(managed table)包括内部表.分区表.桶表: 1.1.分区表创建分区表: create table banji(id INT,name STRING) partitioned ...
一起学Hive——创建内部表、外部表、分区表和分桶表及导入数据
Hive本身并不存储数据,而是将数据存储在Hadoop的HDFS中,表名对应HDFS中的目录/文件.根据数据的不同存储方式,将Hive表分为外部表.内部表.分区表和分桶表四种数据模型.每种数据模型各有 ...
hive内部表、外部表、分区
hive内部表.外部表.分区内部表(managed table) 默认创建的是内部表(managed table),存储位置在hive.metastore.warehouse.dir设置,默认位置是 ...
Hive创建内部表、外部表
使用hive需要hive环境启动Hive 进入HIVE_HOME/bin,启动hive ./hive 内部表建表 hive> create table fz > (id int,nam ...
hive 内部表与外部表的区别
hive 内部表: hive> create table soyo55(name STRING,addr STRING,money STRING) row format delimited fi ...

随机推荐

Jenkins 基础篇 - 小试牛刀
现在我们来创建一个简单的 Jenkins 任务,这个任务输出 Java 版本信息和系统信息,通过这个任务我们先了解创建 Jenkins 任务的流程,以及了解一些对任务的基础设置,接下来就是演示任务的整 ...
.Net Core——用代码写代码？
想要用代码写代码,肯定是绕不开反射的.反射的概念相比都不陌生,只是应用多少就因人而异,今天分享一个代码生成器的思路,仅供参考,不要过分依赖哦. 思路分析众所周知,利用反射可以在程序运行时获取到任一对 ...
mybaties longtext 类型不能映射到自动生成的文件
假设数据库里有 fun_detail 这样一个字段. 使用 MyBatis Generator 生成的 XXExample 文件,发现没有 fun_detail 这个字段. 需要加一行: <co ...
[刷题] 454 4Sum II
要求给出四个整型数组ABCD,寻找有多少 i j k l 的组合,使得A[i]+B[j]+C[k]+D[l]=0 ABCD元素个数均为N,0<=N<=500 示例输入: A = [ 1 ...
Xrdp - 通过Windows的RDP连接Linux远程桌面（Ubuntu/CentOS/Redhat 7）
Xrdp - 通过Windows的RDP连接Linux远程桌面(Ubuntu/CentOS/Redhat 7) 您多久访问一次Linux桌面? 您使用什么工具来访问远程桌面? Xrdp是一个开源工具, ...
CentOS 7.3 安装指南作者： Matei Cezar 译者： LCTT geekpi
CentOS 7.3 安装指南作者: Matei Cezar 译者: LCTT geekpi | 2016-12-20 09:12 评论: 11 收藏: 4 分享: 1 基于 Red Hat 企 ...
利用stat指令查看文件创建时间
-shroot@test-W330-C30:/# stat * 文件:'b' 大小:4096 块:8 IO 块:4096 目录设备:802h/2050d Inode:5636097 硬链接:2权限:( ...
备份分区，备份文件切割保存 dd
cd /tmp wget dl.fedoraproject.org/pub/epel/6/x86_64/dcfldd-1.3.4.1-4.el6.x86_64.rpm sudo yum install ...
week-01
week-01 1. 计算机组成从底层开始: 硬件: CPU.内存.硬盘.网卡.主板.显卡.风扇.电源.鼠标键盘等: 系统: Linux.Windows.Mac 等: 软件: QQ.微信.吃鸡.农 ...
MySQL 通过.frm文件和.ibd文件实现InnoDB引擎的数据恢复
起因是这样的,公司的领导表示说服务器崩了,修理好之后,只剩下数据库目录下的物理文件(即.frm文件与.ibd文件).然后,整了一份压缩包给我,叫我瞅一下能不能把数据恢复出来.我当场愣了一下,这都啥文件 ...