拉链表设计:

  在企业中,由于有些流水表每日有几千万条记录,数据仓库保存5年数据的话很容易不堪重负,因此可以使用拉链表的算法来节省存储空间。

 例子:

-- 用户信息表;  采集当日全量数据存储到 (当日) 表中
CREATE TABLE dwd.user_info(
id string,
name string,
sex string,
biz_date string -- 业务日期
) -- 用户信息整合表
CREATE TABLE dws.user_merge_info(
id string,
name string,
sex string,
start_date string,
end_date string
) -- 测试插入用户信息
INSERT INTO dwd.user_info
SELECT
'','YaoMing','boy',''
UNION ALL
SELECT
'','YaoLinlin','girl',''
UNION ALL
SELECT
'','CaiLili','girl',''
UNION ALL
SELECT
'','ZhangSan','girl',''
UNION ALL
SELECT
'','LiSi','girl','' -- 查看数据
SELECT * FROM dwd.user_info

-- 初始化用户信息整合表
INSERT overwrite TABLE dws.user_merge_info
SELECT
id,
name,
sex,
'' AS start_date,
'' AS end_date
FROM (
SELECT
id,
name,
sex,
row_number() over(PARTITION BY id ORDER BY biz_date) AS row_num -- 初始化时候根据主键id分组,取最新修改的数据
FROM dwd.user_info
) t
WHERE t.row_num = 1 -- 查看数据
SELECT * FROM dws.user_merge_info

-- 现在biz_date='20190702'这天,新跑了一条全新数据id=6,以及修改了一条id=2的数据
INSERT INTO dwd.user_info
SELECT
'','WangWu','boy',''
UNION ALL
SELECT
'','YaoLinlin','boy','' -- 查看数据
SELECT * FROM dwd.user_info ORDER BY id,biz_date

-- 新增修改以及完全新增
INSERT overwrite TABLE tmp.user_merge_info_new
-- 修改的数据
SELECT
b.id,
b.name,
b.sex,
'' AS start_date, -- ${bizdate} 业务日期
'' AS end_date -- 99991231代表有效数据
FROM dws.user_merge_info a,
dwd.user_info b
WHERE a.id = b.id
AND a.end_date = ''
AND b.biz_date = '' -- ${bizdate}只取当天数据
AND (
a.name!= b.name
OR a.sex != b.sex
) UNION ALL
-- 全新的数据
SELECT
b.id,
b.name,
b.sex,
''AS start_date,
''AS end_date
FROM dws.user_merge_info a
RIGHT JOIN dwd.user_info b
ON a.id = b.id
WHERE b.biz_date=''
AND a.id IS NULL;

-- 闭链
INSERT overwrite TABLE tmp.user_merge_info_upt
SELECT
a.id,
a.name,
a.sex,
a.start_date,
'' -- 闭链,${biz_date}业务时间
FROM dws.user_merge_info a
LEFT JOIN dwd.user_info b
ON a.id=b.id
WHERE a.end_date=''
AND b.biz_date=''
AND (
a.name != b.name
OR a.sex != b.sex
)

-- 历史数据
INSERT overwrite TABLE tmp.user_merge_info_new
SELECT
a.id,
a.name,
a.sex,
a.start_date,
a.end_date
FROM dws.user_merge_info a,
tmp.user_merge_info_upt b
WHERE a.id != b.id;

-- 整合数据
INSERT OVERWRITE TABLE dws.user_merge_info
SELECT
id,
name,
sex,
start_date,
end_date
FROM tmp.user_merge_info_new
UNION ALL
SELECT
id,
name,
sex,
start_date,
end_date
FROM tmp.user_merge_info_upt
UNION ALL
SELECT
id,
name,
sex,
start_date,
end_date
FROM tmp.user_merge_info_his -- 查看下数据
SELECT * FROM dws.user_merge_info ORDER BY id,start_date

以上拉链表就实现好了


以下是退链操作模板

#!/bin/bash

# 使用说明提示
if [ $# -ne 1 ]; then
echo "Usage : `basename $0` biz_date"
exit 1
fi #业务时间
biz_date=$1 # 判断是数据整合还是回退拉链表
isGoBack=`execHQL "select count(1) from dws.user_merge_info where (end_date>='$biz_date' or start_date>='$biz_date') and biz_date<>'';"` if [ $isGoBack -ne 0 ];then
# 回退模式
Log "\n## 【user_merge_info表回退】 执行开始 ##"
execHQL "
INSERT overwrite TABLE dws.user_merge_info
-- 完全不变的数据
SELECT
id
,name
,sex
,start_date
,end_date
FROM dws.user_merge_info
WHERE (start_date<'$biz_date' AND end_date='') OR end_date<'$biz_date' UNION ALL -- 重跑 重新开链的数据
SELECT
id
,name
,sex
,start_date
,'' AS end_date
FROM dws.user_merge_info
WHERE start_date<'$biz_date' AND end_date>='$biz_date' AND end_date<>'';
"
if [ $? -ne 0 ];then
Log "\n## 【user_merge_info表回退】 执行失败 ##"
exit 1
fi
Log "\n## 【user_merge_info表回退】 执行成功 ##" fi

hive拉链表以及退链例子笔记的更多相关文章

  1. hive拉链表

    前言 本文将会谈一谈在数据仓库中拉链表相关的内容,包括它的原理.设计.以及在我们大数据场景下的实现方式. 全文由下面几个部分组成:先分享一下拉链表的用途.什么是拉链表.通过一些小的使用场景来对拉链表做 ...

  2. hive拉链表取数

    例如,一个借款用户在hive上的拉链表.(end_dt存放逻辑与普通介绍的拉链表不一致) 需要拉去它在2019-05-01日的状态, 取数逻辑是: select * from tb where sta ...

  3. 漫谈数据仓库之拉链表(原理、设计以及在Hive中的实现)

    本文将会谈一谈在数据仓库中拉链表相关的内容,包括它的原理.设计.以及在我们大数据场景下的实现方式. 全文由下面几个部分组成: 先分享一下拉链表的用途.什么是拉链表. 通过一些小的使用场景来对拉链表做近 ...

  4. hive 汇率拉链表转日连续流水表

    1.什么是拉链表 拉链表是针对数据仓库设计中表存储数据的方式而定义的,顾名思义,所谓拉链,就是记录历史.记录一个事物从开始,一直到当前状态的所有变化的信息. 我们先看一个示例,这就是一张拉链表,存储的 ...

  5. hive中拉链表

    在有些情况下,为了保持历史的一些状态,需要用拉链表来做,这样做目的在可以保留所有状态的情况下可以节省空间. 拉链表适用于以下几种情况吧 数据量有点大,表中某些字段有变化,但是呢变化的频率也不是很高,业 ...

  6. 数仓1.4 |业务数仓搭建| 拉链表| Presto

    电商业务及数据结构 SKU库存量,剩余多少SPU商品聚集的最小单位,,,这类商品的抽象,提取公共的内容 订单表:周期性状态变化(order_info) id 订单编号 total_amount 订单金 ...

  7. DataBase 之 拉链表结构设计

    一.概念 拉链表是针对数据仓库设计中表存储数据的方式而定义的,顾名思义,所谓拉链,就是记录历史.记录一个事物从开始,一直到当前状态的所有变化的信息. 在历史表中对客户的一生的记录可能就这样几条记录,避 ...

  8. mysql执行拉链表操作

    拉链表需求: 1.数据量比较大 2.变化的比例和频率比较小,例如客户的住址信息,联系方式等,比如有1千万的用户数据,每天全量存储会存储很多不变的信息,对存储也是浪费,因此可以使用拉链表的算法来节省存储 ...

  9. xmake v2.5.2 发布, 支持自动拉取交叉工具链和依赖包集成

    xmake 是一个基于 Lua 的轻量级跨平台构建工具,使用 xmake.lua 维护项目构建,相比 makefile/CMakeLists.txt,配置语法更加简洁直观,对新手非常友好,短时间内就能 ...

随机推荐

  1. 如何在虚拟机VM安装windows 2008R2

    1.首先确保已经安装好VM软件后进行以下操作.首先点击"文件"->再点击新建虚拟机.如图 2.点击新建虚拟机后会弹出如图所示,可以点击"典型",这里建议选 ...

  2. 第三讲JdbcRealm及Authentication Strategy

    1.使用shiro框架来完成认证工作,默认情况下使用的是IniRealm.如果需要使用其他Realm,那么需要进行相关的配置. 2.ini配置文件讲解: [main] section是你配置应用程序的 ...

  3. css3 动画 Transition

      CSS Transition 1.1 基本用法 在CSS 3引入Transition(过渡)这个概念之前,CSS是没有时间轴的.也就是说,所有的状态变化,都是即时完成. 上面是一个演示,当鼠标放置 ...

  4. B2C自营商城的订单设计方案

    B2C自营商城的订单设计方案 2018年06月01日 17:19:00 lkx94 阅读数 1640   去年我们的美妆社区APP,上线了自有商城.之后经过多次版本迭代,商城系统的模块已经基本健全,值 ...

  5. LeetCode--057--插入区间(java)

    给出一个无重叠的 ,按照区间起始端点排序的区间列表. 在列表中插入一个新的区间,你需要确保列表中的区间仍然有序且不重叠(如果有必要的话,可以合并区间). 示例 1: 输入: intervals = [ ...

  6. tensorboard可视化(先写一点点)

    在tensorboard上显示运行图: import tensorflow as tf a = tf.constant(10,name="a") b = tf.constant(9 ...

  7. js事件循环机制

    本文参考链接:https://www.jianshu.com/p/cf47bc0bf2ab 一.先搞懂两个东西:堆和栈 栈由操作系统自动分配释放,用于存放函数的参数值.局部变量等一些基本的数据类型,其 ...

  8. 英语单词leading

    leading 来源——https://www.docker.com/products/docker-hub 翻译 a. 领导的,指导的:最主要的 词根词缀词源 leader汉语英译为了“领导”

  9. FastDFS整合SpringBoot(五)

    pom.xml <dependencies> <dependency> <groupId>org.springframework.boot</groupId& ...

  10. win7每天出现taskeng.exe进程的解决方案

    安装mysql数据库后电脑经常会出现taskeng.exe进程,这不是木马.病毒,是微软提供的任务计划程序引擎. 禁不禁止都差不多.下面说一下怎么禁止. -->打开控制面板 -->打开管理 ...