【Hadoop/Hive/mapreduce】系列之使用union all 命令之后如何对hive表格使用python进行去重

业务场景大概是这样的，这里由两个hive表格，tableA 和 tableB, 格式内容都是这样的:

uid cate1 cate2

在hive QL中，我们知道union有着自动去重的功能，但是那是真对几行内容完全一致的情况下才可以。现在我们要进行去重的情况是根据uid进行去重。

也就是说可能存在这种情况:

1234 老师唱歌

1234 老师跳舞

对于hive表格中的这两行数据我们只想要保留其中的一行。

针对这种情况，我们做的大致思路就是，取两个表格数据的时候同时人为加上一个flag，然后使用python代码根据flag进行区分保留。

为了进行去重，我们写了两个代码，一个是取得hive数据的shell脚本，一个是处理hive数据的python脚本

vim get_data.sh

function merge(){

cat <<EOF

add file ./process.py;

    select transform(a.*) using 'python tt.py' as uid,cate1,cate2 from

    (select * from

    (select uid,cate1,cate2,"0" as flag from tableA where dt='sth1'

    union all

    select uid,cate1,cate2,"1" as flag from tableB where dt='sth2'

    )ts

    distribute by uid sort by uid,flag asc

    )a

EOF

}

对于上面这个代码，我觉得有一点需要特别注意，就是

distribute by uid sort by uid,flag asc

为了了解这行代码，我特意去看了看这里的解释参考

简单来说就是说，distribute by uid代表的就是所有uid相同的数据会被送到同一个reducer中去处理。

vim process.py

#!/bin/env python

#-*- encoding:utf-8 -*-

import os

import sys

def set_values(value):

        if value.isdigit():

                return int(value)

        else :

                return 0

lastuid=""

cate1=""

cate2=""

flag=""

for line in sys.stdin :

        line=line.replace("\n","").replace(" ","")

        v=line.split("\t")

        try :

                uid=v[0]

                if not uid.isdigit() or len(v) != 4:

                        pass

                if lastuid!="" and lastuid!=uid:

                        print (lastuid+"\t"+str(cate1)+"\t"+str(cate2))

                        lastuid=""

                        cate1=""

                        cate2=""

                        flag=""

                cate1=v[1]

                cate2=v[2]

                flag=v[3]

                lastuid=uid

        except :

                pass

print (lastuid+"\t"+str(cate1)+"\t"+str(cate2)) #这行代码是为了输出最后一行，这行代码很类似于python word count中的示例代码

【Hadoop/Hive/mapreduce】系列之使用union all 命令之后如何对hive表格使用python进行去重的更多相关文章

使用union all 命令之后如何对hive表格进行去重
业务场景大概是这样的,这里由两个hive表格,tableA 和 tableB, 格式内容都是这样的: uid cate1 cate2 在hive QL中,我们知道union有着自动去重的功能,但是那是 ...
Hadoop Hive概念学习系列之hive里的JDBC编程入门（二十二）
Hive与JDBC示例在使用 JDBC 开发 Hive 程序时, 必须首先开启 Hive 的远程服务接口.在hive安装目录下的bin,使用下面命令进行开启: hive -service hives ...
Hadoop Hive概念学习系列之hive三种方式区别和搭建、HiveServer2环境搭建、HWI环境搭建和beeline环境搭建（五）
说在前面的话以下三种情况,最好是在3台集群里做,比如,master.slave1.slave2的master和slave1都安装了hive,将master作为服务端,将slave1作为服务端. 以 ...
Hadoop Hive概念学习系列之hive里的索引（十三）
Hive支持索引,但是Hive的索引与关系型数据库中的索引并不相同,比如,Hive不支持主键或者外键. Hive索引可以建立在表中的某些列上,以提升一些操作的效率,例如减少MapReduce任务中需要 ...
Hadoop Hive概念学习系列之hive的索引及案例（八）
hive里的索引是什么? 索引是标准的数据库技术,hive 0.7版本之后支持索引.Hive提供有限的索引功能,这不像传统的关系型数据库那样有“键(key)”的概念,用户可以在某些列上创建索引来加速某 ...
Hadoop Hive概念学习系列之hive里的优化和高级功能（十四）
在一些特定的业务场景下,使用hive默认的配置对数据进行分析,虽然默认的配置能够实现业务需求,但是分析效率可能会很低. Hive有针对性地对不同的查询进行了优化.在Hive里可以通过修改配置的方式进行 ...
从Hadoop骨架MapReduce在海量数据处理模式（包括淘宝技术架构）
从hadoop框架与MapReduce模式中谈海量数据处理前言几周前,当我最初听到,以致后来初次接触Hadoop与MapReduce这两个东西,我便稍显兴奋,认为它们非常是神奇.而神奇的东西常能勾 ...
【SQL系列】深入浅出数据仓库中SQL性能优化之Hive篇
公众号:SAP Technical 本文作者:matinal 原文出处:http://www.cnblogs.com/SAPmatinal/ 原文链接:[SQL系列]深入浅出数据仓库中SQL性能优化之 ...
Hadoop学习笔记系列
Hadoop学习笔记系列一.为何要学习Hadoop? 这是一个信息爆炸的时代.经过数十年的积累,很多企业都聚集了大量的数据.这些数据也是企业的核心财富之一,怎样从累积的数据里寻找价值,变废为宝炼 ...

随机推荐

【填坑】loj6159. 「美团 CodeM 初赛 Round A」最长树链
水一水枚举各个质数,把是这个数倍数的点留下,跑直径,没了 #include <bits/stdc++.h> using namespace std; int h,t,n,p,q,M,N; ...
转 v$session_longops视图
转http://www.dbdream.com.cn/2013/10/14/vsession_longops%E8%A7%86%E5%9B%BE/ 1.有的时候不准确 ,我看到 session wai ...
微服务实践分享(2)api网关
1.作用[http://chuansong.me/n/465796751848]: 一个完整的.「面向接入」的API GW需要包含以下功能: 面向运行期对客户端实现身份认证通信会话的秘钥协商,报文 ...
SpringMVC注解方式与文件上传
目录: springmvc的注解方式文件上传(上传图片,并显示) 一.注解在类前面加上@Controller 表示该类是一个控制器在方法handleRequest 前面加上 @RequestMap ...
intelliJ idea 激活和配置
1. 双击打开 Intellij IDEA 桌面快捷方式图标,如下图: 2. 点击 ok 按钮,进入激活页面: 3. 他提供的三种方式激活:账号激活,激活码激活,服务器地址激活,我们选择激活码激活,去 ...
Seven Deadly Sins: Gluttony, Greed, Sloth, Wrath, Pride, Lust, and Envy.
Seven Deadly Sins: Gluttony, Greed, Sloth, Wrath, Pride, Lust, and Envy.七宗罪:暴食.贪婪.懒惰.暴怒.傲慢.色欲.妒忌.
ajax在购物车中的应用
代码如下: 购物车页面: <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http: ...
python3发送邮件01（简单例子，不带附件）
# -*- coding:utf-8 -*-import smtplibfrom email.header import Headerfrom email.mime.text import MIMET ...
SPOJ BALNUM Balanced Numbers 平衡数（数位DP，状压）
题意: 平衡树定义为“一个整数的某个数位若是奇数,则该奇数必定出现偶数次:偶数位则必须出现奇数次”,比如 222,数位为偶数2,共出现3次,是奇数次,所以合法.给一个区间[L,R],问有多少个平衡数? ...
洛谷 P1001 A+B Problem
题目描述输入两个整数a,b,输出它们的和(|a|,|b|<=10^9). 注意 1.pascal使用integer会爆掉哦! 2.有负数哦! 3.c/c++的main函数必须是int类型,而且 ...

【Hadoop/Hive/mapreduce】系列之使用union all 命令之后如何对hive表格使用python进行去重

【Hadoop/Hive/mapreduce】系列之使用union all 命令之后如何对hive表格使用python进行去重的更多相关文章

随机推荐

热门专题