原创 Hive left join 技巧总结

根据工作中经验总结出来 left join 常用的使用注意点： A Left join B on A.id = B.id

第一种情况：

　　如果 A 表的 id 存在重复， B 表的 id 不存在重复，那么 select * from A Left join B on A.id = B.id, SQL 执行的结果数据条数和 A 表保持一致；

第二种情况：

　　如果 A 表的 id 不存在重复， B 表的 id 不存在重复，那么 select * from A Left join B on A.id = B.id, SQL 执行的结果数据条数和 A 表保持一致；

第三种情况：

　　如果 A 表的 id 不存在重复， B 表的 id 存在重复，那么 select * from A Left join B on A.id = B.id, SQL 执行的结果数据条数和 A 表不保持一致，SQL出来的条数比A表数据多；

总结： A Left join B on A.id = B.id

1：不管 A表 id 重复不重复，只要 B 表 id 不重复，使用 left join 结果准确；

2：如果B表 id 存在重复，使用 A left join B 之前，务必对 B 表进行 id 的 distinct 或者 group by 操作，保证 B 表的 id 在执行 left join 之前， id 保持唯一性；否则，left join 出来的结果是错误的。

原创 Hive left join 技巧总结的更多相关文章

Hive 基本语法操练（五）：Hive 的 JOIN 用法
Hive 的 JOIN 用法 hive只支持等连接,外连接,左半连接.hive不支持非相等的join条件(通过其他方式实现,如left outer join),因为它很难在map/reduce中实现这 ...
HIVE: Map Join Vs Common Join, and SMB
HIVE Map Join is nothing but the extended version of Hash Join of SQL Server - just extending Hash ...
hive：join操作
hive的多表连接,都会转换成多个MR job,每一个MR job在hive中均称为Join阶段.按照join程序最后一个表应该尽量是大表,因为join前一阶段生成的数据会存在于Reducer 的bu ...
Hive中Join的原理和机制
转自:http://lxw1234.com/archives/2015/06/313.htm 笼统的说,Hive中的Join可分为Common Join(Reduce阶段完成join)和Map Joi ...
Hive的join表连接查询的一些注意事项
Hive支持的表连接查询的语法: join_table: table_reference JOIN table_factor [join_condition] | table_reference {L ...
hive的join查询
hive的join查询语法 join_table: table_reference [INNER] JOIN table_factor [join_condition] | table_refere ...
Hive 中Join的专题---Join详解
1.什么是等值连接? 2.hive转换多表join时,如果每个表在join字句中,使用的都是同一个列,该如何处理? 3.LEFT,RIGHT,FULL OUTER连接的作用是什么? 4.LEFT或RI ...
Hive中Join的类型和用法
关键字:Hive Join.Hive LEFT|RIGTH|FULL OUTER JOIN.Hive LEFT SEMI JOIN.Hive Cross Join Hive中除了支持和传统数据库中一样 ...
hive的join优化
“国际大学生节”又称“世界大学生节”.“世界学生日”.“国际学生日”.1946年,世界各国学生代表于布拉格召开全世界学生大会,宣布把每年的11月17日定为“世界大学生节”,以加强全世界大学生的团结和友 ...

随机推荐

我的书籍《深入解析Java编译器：源码剖析与实例详解》就要出版了
一个十足的技术迷,2013年毕业,做过ERP.游戏.计算广告,在大公司呆过,但终究不满足仅对技术的应用,在2018年末离开了公司,全职写了一本书<深入解析Java编译器:源码剖析与实例详解> ...
Hadoop之HDFS文件系统
概念 HDFS,它是一个文件系统,用于存储文件,通过目录树来定位文件:其次,它是分布式的,由很多服务器联合起来实现其功能,集群中的服务器有各自的角色. HDFS的设计适合一次写入,多次读出的场景,且不 ...
github下载历史版本--xdd
第一步打开一个仓库,可以看到此时在主分支下,点击1位置查看历史版本第二步现在可以查看到所有的版本(提交)信息,单击2位置进入该版本第三步单击3位置浏览并打开该版本第四步进入该版本之后,可 ...
Oracle 分区表管理之组合分区（分区索引失效与性能比较）
整体结构如下: Oracle 分区表管理之组合分区(分区索引失效与性能比较) 虽然老早就使用了分区表,终于有时间写有关分区表的内容:不是所有的场景数据量变大需要用到分区表,一般单表数据超过2g可以考 ...
SQL语句总结基础篇
创建数据库 CREATE DATABASE 数据库名称; 删除数据库 DROP DATABASE 数据库名称; 创建新表 create table 表名(列类型 ,列类型 ,..); 根据已有的表 ...
python函数-函数对象
python函数-函数对象实验室当函数定义时,就类似a=1,以函数名为变量名 def zx(): pass print(zx) zx=21 print(zx) <function zx at ...
C语言Ⅰ博客作业04
问题回答这个作业属于哪个课程 c语言程序设计ll 这个作业要求在哪里 https://blog.csdn.net/qq_42264638/article/details/102381471 我在这 ...
FastAdmin的基本使用
FastAdmin是一款基于ThinkPHP5+Bootstrap的极速后台开发框架. 1.在线命名管理 (1)菜单的生成 (2)一键 crud 首先要安装在线命名在翡翠分类生成菜单,如下: 它的 ...
python3.6异步IO包asyncio部分核心源码思路梳理
关于python异步编程的演进过程,两篇文章阐述得妥妥当当,明明白白. 中文资料:https://mp.weixin.qq.com/s?__biz=MzIxMjY5NTE0MA==&mid=2 ...
POJ 1325 Machine schedine (二分图-最小点覆盖数=最大匹配边数)
As we all know, machine scheduling is a very classical problem in computer science and has been stud ...

原创 Hive left join 技巧总结

原创 Hive left join 技巧总结的更多相关文章

随机推荐

热门专题