Hive数据库【操作】+ 【分区】+【分桶】+【查询】+【运算】+【函数】
键值对信息
添加数据库的描述信息(添加键值对信息)
create database [数据库] with dbproperties('name'='RenZetong','data'='20200101')
--数据所有者:RenZetong 日期:2020-01-01
查看键值对信息
describe database extended [数据库]
修改键值对信息
alter database [数据库] set dbproperties('name'='RenZetong2')
查看更多详细信息
desc database extended [数据库]
数据库的删除操作
drop database [数据库] #删除一个空的数据库
drop database [数据库] cascade #连同数据库下的表一起删除掉 "强制性删除"
数据库表操作
CREATE [EXTERNAL] TABLE [IF NOT EXISTS] table_name
[(col_name data_type [COMMENT col_comment], ...)]
[COMMENT table_comment]
[PARTITIONED BY (col_name data_type [COMMENT col_comment], ...)]
[CLUSTERED BY (col_name, col_name, ...)
[SORTED BY (col_name [ASC|DESC], ...)] INTO num_buckets BUCKETS]
[ROW FORMAT row_format]
[STORED AS file_format]
[LOCATION hdfs_path]
- comment 表示注释,默认不能使用中文
- partitioned by 表示使用表分区,一个表可以拥有多个分区,每一个分区单独存在一个目录下
- clustered by 对于每一个表分区文件,Hive可以进一步组织成桶,也就是说桶是更为细粒度的数据范围划分。Hive也是针对某一列进行桶的组织
- sorted by 指定排序字段和排序规则
- row format 指定表文件字段分隔符
- stored as 指定表文件的存储格式,常用格式:sequencefile,textfile,rcfile,如果是纯文本文件,可以使用STORED AS TEXTFILE
- location 指定表文件的存储路径
内部表操作
创建表并指定字段之间的分隔符
create table stu2(id int,name string)
row format
delimited fields
terminated by '/t'; --指定的分隔符
创建表并指定文件的存放路径
create table stu3(id int,name string)
row format
delimited fields
terminated by '\t'
location '/user/stu3'; --指定文件存储路径
根据查询结果来创建表
create table stu3 as select * from stu2;
根据已存在的表结构来创建表
create table stu4 like stu2;
查看表结构
desc stu4;
查看表结构详细信息
desc formatted stu2;
删除表
drop table stu4;
外部表操作
外部表的数据一般是用来共享的,所以删除hive表的时候,数据仍然会存放在hdfs中
分别创建老师和学生的外部表,并向表中添加数据
1、创建老师表
create external table teacher (t_id string,t_name string)
row format
delimited fields terminated by '\t'
2、创建学生表
create external table student(s_id string,s_name string,s_birth string,s_sex string) row format delimited fields terminated by '\t'
将数据加载入表的方式
1、普通加载方式
load data local inpath '/***/***/data.csv' into table ***
2、加载并覆盖方式
load data local inpath '/***/***/data.csv' overwrite into table ***
3、从hdfs文件系统中向表中加载数据(前提是得将数据上传到hdfs系统中)
hdfs dfs -put ***.csv /hivesource
load data inpath '/hivesource/***.csv' into table ***
分区表的操作
在hive中分区就是分文件夹,把大文件切割划分成一个个的小文件,这样每次操作一个小的文件就会很容易了,例如把一个大数据按照每月或者每天进行分割成一个个的小文件,存放在不同的文件夹中.(多分区就是目录的嵌套)
创建一个表带一个分区的语法
create table score(s_id string,c_id string,s_score int)
partitioned by (month string) --指定分区字段
row format
delimited fields
terminated by '\t';
创建一个表带多个分区语法
create table score2(s_id string,c_id string,s_score int)
partitioned by(year string,month string,day string) --指定分区字段
row format
delimited fields
terminated by '\t';
给一个表带一个分区的加载数据
load data local inpath '/root/score.csv' into table score partition(month='20180101');
多分区表加载数据
load data local inpath '/root/score.csv' into table score2
partition(year='2018',month='06',day='01');
分区表查询
select * from score where month = '20180102';
多分区表联合查询(使用union all)
select * from score where month='20180102' union all select * from score where month='20180101';
查看分区
show partitions score;
添加分区
alter table score add partition(month='201805');
删除分区
alter table drop partition(month='201806');
表的修复(建立表与数据文件之间的一个关系映射)
msck repair table ***
分桶表操作
分桶就是MapReduce中的分区。
开启hive的分桶功能
set hive.enforce.bucketing=true;
设置Reduce个数
set mapreduce.job.reduces=3;
创建分桶表
create table course(c_id string,c_name string,t_id string)
clustered by(c_id) into 3 buckets
row format
delimited fields
terminated by '\t';
数据查询
求总行数
select count(*) from table;
求分数的最大值
select max(s_score) from table;
求分数的最小值
select min(s_score) from table;
求分数的总和
select sum(s_score) from table;
求分数的平均值
select avg(s_score) from table;
关系运算
等值比较
select 1 from data_tb where 1=1;
不等值比较
select 1 from data_tb where 1<>2;
小于比较
select 1 from data_tb where 1 < 2;
小于等于比较
select 1 from data_tb where 1 <= 1
大于比较
select 1 from data_tb where 2>1
大于等于比较
select 1 from data_tb where 1 >=1
空值判断
select 1 from data_tb where null is null
非空值判断
select 1 from data_tb where 1 is not null
like比较
select 1 from data_tb where 'footabll' like 'foot%';
select 1 from data_tb where 'footabll' like '%foot%';
like否定比较
select 1 from data_tb where not 'football' like 'foot%';
select 1 from data_tb where not 'football' like '%foot%';
数学运算
加法操作
select 1+9 from data_tb;
减法操作
select 10-5 from data_tb;
乘法操作
select 40*5 from data_tb;
除法操作
select 40/5 from data_tb;
逻辑运算
逻辑与操作:AND
select 1 from data_tb where 1=1 and 2=2;
逻辑或操作:OR
select 1 from data_tb where 1=2 or 2=2;
逻辑非操作:NO
select 1 from data_tb where not 1=2
数值计算
取整函数:round
select round(3.1415925) from data_tb;
> 3
select round(3.5) from data_tb;
> 4
指定精度取整函数:round
select round(3.1415926,4) from data_tb;
> 3.1416
随机数函数:rand
select rand() from data_tb;
> 0.26472837228287
select rand(100) from data_tb;
> 0.72636263627272
绝对值函数:abs
select abs(-3.9) from data_tb;
> 3.9
日期函数
from_unixtime函数将yyyy/mm/dd类型的日期转换为yyyy-mm-dd日期类型
select from_unixtime(unix_timestamp(date,'yyyy/mm/dd'),'yyyy-mm-dd') from date_1;
时间转日期函数:to_date
select to_date('2020-11-12 10:02:11') from data_tb;
> 2020-11-12
日期转年函数:year
select year('2020-11-12 10:22:22') from data_dt;
> 2011
日期转月函数:month
select month('2020-11-12') from data_dt;
> 12
日期转天函数:day
select day('2020-11-12') from data_dt;
> 12
日期转小时函数:hour
select hour('2020-01-02 20:22:12') from data_dt;
> 20
Hive数据库【操作】+ 【分区】+【分桶】+【查询】+【运算】+【函数】的更多相关文章
- 【Hive学习之五】Hive 参数&动态分区&分桶
环境 虚拟机:VMware 10 Linux版本:CentOS-6.5-x86_64 客户端:Xshell4 FTP:Xftp4 jdk8 hadoop-3.1.1 apache-hive-3.1.1 ...
- Hive数据库操作
Hive数据结构 除了基本数据类型(与java类似),hive支持三种集合类型 Hive集合类型数据 array.map.structs hive (default)> create table ...
- laravel 数据库操作之 DB facade & 查询构造器 & Eloquent ORM
<?php namespace App\Http\Controllers; use App\Student; use Illuminate\Support\Facades\DB; class S ...
- Spark SQL解析查询parquet格式Hive表获取分区字段和查询条件
首先说一下,这里解决的问题应用场景: sparksql处理Hive表数据时,判断加载的是否是分区表,以及分区表的字段有哪些?再进一步限制查询分区表必须指定分区? 这里涉及到两种情况:select SQ ...
- yii学习笔记(7),数据库操作,联表查询
在实际开发中,联表查询是很常见的,yii提供联表查询的方式 关系型数据表:一对一关系,一对多关系 实例: 文章表和文章分类表 一个文章对应一个分类 一个分类可以对应多个文章 文章表:article 文 ...
- oracle数据库中,分天查询数目
select to_CHAR(SP_MT_TIME,'DD'),count(*) from table2 group by to_CHAR(SP_MT_TIME,'DD');
- HIVE—索引、分区和分桶的区别
一.索引 简介 Hive支持索引,但是Hive的索引与关系型数据库中的索引并不相同,比如,Hive不支持主键或者外键. Hive索引可以建立在表中的某些列上,以提升一些操作的效率,例如减少MapRed ...
- hive -- 分区,分桶(创建,修改,删除)
hive -- 分区,分桶(创建,修改,删除) 分区: 静态创建分区: 1. 数据: john doe 10000.0 mary smith 8000.0 todd jones 7000.0 boss ...
- Hive 的分桶 & Parquet 概念
分区 & 分桶 都是把数据划分成块.分区是粗粒度的划分,桶是细粒度的划分,这样做为了可以让查询发生在小范围的数据上以提高效率. 分区之后,分区列都成了文件目录,从而查询时定位到文件目录,子数据 ...
- 二 Hive分桶
二.Hive分桶 1.创建分桶表 create table t_buck (id string ,name string) clustered by (id) //根据id分桶 sorted by ( ...
随机推荐
- 世界第一!华为云图引擎服务GES大幅刷新世界纪录
近日,国际关联数据基准委员会(Linked Data Benchmark Council,以下简称LDBC)公布了社交网络测试交互式负载(SNB INTERACTIVE WORKLOAD,以下简称为S ...
- markdown的html优雅使用语法(2024/10/10guixiang原创)
一:图片部分 第一范式 图 2 全字段排序 <center> <img style="border-radius: 0.3125em; box-shadow: 0 2px ...
- MSF 入侵安卓手机
生成木马文件 msfvenom -p android/meterpreter/reverse_tcp LHOST=192.168.135.247 LPPRT=5555 进行文件传输: python3 ...
- 【ZROJ2730】简单题 可持久化分块题解
Description 给定一棵 \(n\) 个节点的树,每次询问编号为 \([l, r]\) 的点中有多少个是祖先关系. \(n, q \le 10^5\). Solution 直接做的话树上的祖先 ...
- 快速部署单服务器oracle12c
docker pull docker.io/truevoly/oracle-12c mkdir -p /usr/local/oracle/data_temp chmod 777 /usr/local/ ...
- css动画(仿微信聊天页面)
微信聊天框以其简洁直观的界面和流畅的交互体验而广受欢迎.本文将展示如何利用HTML和CSS技术,在自己的网页上实现类似微信的聊天框效果.我们将一步步指导您完成,让网站或应用也能拥有专业且用户友好的聊天 ...
- 从零开始学逆向CTF比赛,免费参加,欢迎来玩!
大家好,我是轩辕. 告诉大家一个好消息:我准备了一次逆向CTF比赛,面向所有人开放,无需购买课程,优秀的小伙伴还有奖励,参赛方式在文末会介绍,欢迎大家一起来玩. 举办这次CTF比赛,是为了检验大家从零 ...
- C240817D. 模拟赛:树上dp(以i为起点)+set操作
C240817D. 模拟赛 比较显然的树上dp, 但是维护set比较烦 考场上其实自己是定义 \(f[i]\) 是以 \(i\) 结尾, 然后这样的话单次更新根本做不到 \(O(logN)\). 反应 ...
- 2.16 Linux挂载详解
前面讲过,Linux 系统中"一切皆文件",所有文件都放置在以根目录为树根的树形目录结构中.在 Linux 看来,任何硬件设备也都是文件,它们各有自己的一套文件系统(文件目录结构) ...
- 在 Github Action 管道内集成 Code Coverage Report
Github Actions 我们的开源项目 Host 在 Github,并且使用它强大的 Actions 功能在做 CICD.单看 Github Actions 可能不知道是啥.其实它就是我们常说的 ...