Hive 的 map join

学习自 http://blog.csdn.net/xqy1522/article/details/6699740

1. Map Join 的使用场景：

关联操作中有一张表非常小
不等值的链接操作

2. 语法：

使用 hint 的方式指定join时使用mapjoin。

select   /*+ mapjoin(c)*/    -- hint

   c.tag,b.yemaozi_pre

from

(select

    row_number() over(partition by 1 order by yemaozi_pre)  yemaozi_rank,

    yemaozi_pre

 from  customer_purchase_time_pre

) b       -- 大表

join

(select

    count(buyer_nick) total_buyer,'yemaozi' as tag

 from customer_purchase_time_pre

) c        -- 小表，只有一行

where b.yemaozi_rank=round(c.total_buyer*0.9);

用时才发现了个细节：

/*+mapjoin( c ) */ 这个语法里面的c 是join的小表的名字！

3. 原理：

　MAPJION会把小表全部读入内存中，在map阶段直接拿另外一个表的数据和内存中表数据做匹配，由于在map是进行了join操作，省去了reduce，运行的效率也会高很多。　

4. 分析：

例子中的小表参与join，没使用map join时，会导致数据倾斜严重。某个reduce上落太多数据，reduce时内存会严重占用，甚至不足。
不等连接时，reduce会进行笛卡儿积，效率很低。
使用map join后 join操作会在map阶段完成。

如果join数据两大，加上如下参数避免内存溢出：

set mapreduce.reduce.shuffle.input.buffer.percent =0.6;

set mapreduce.reduce.shuffle.parallelcopies = 5;

Hive 的 map join的更多相关文章

HIVE: Map Join Vs Common Join, and SMB
HIVE Map Join is nothing but the extended version of Hash Join of SQL Server - just extending Hash ...
一起学Hive——总结各种Join连接的用法
Hive支持常用的SQL join语句,例如内连接.左外连接.右外连接以及HiVe独有的map端连接.其中map端连接是用于优化Hive连接查询的一个重要技巧. 在介绍各种连接之前,先准备好表和数据. ...
使用Spark进行搜狗日志分析实例——map join的使用
map join相对reduce join来说,可以减少在shuff阶段的网络传输,从而提高效率,所以大表与小表关联时,尽量将小表数据先用广播变量导入内存,后面各个executor都可以直接使用 pa ...
MapReduce编程之Map Join多种应用场景与使用
Map Join 实现方式一:分布式缓存 ● 使用场景:一张表十分小.一张表很大. ● 用法: 在提交作业的时候先将小表文件放到该作业的DistributedCache中,然后从DistributeC ...
MapReduce之Map Join
一介绍之所以存在Reduce Join,是因为在map阶段不能获取所有需要的join字段,即:同一个key对应的字段可能位于不同map中.Reduce side join是非常低效的,因为shuf ...
SQL join中级篇--hive中 mapreduce join方法分析
1. 概述. 本文主要介绍了mapreduce框架上如何实现两表JOIN. 2. 常见的join方法介绍假设要进行join的数据分别来自File1和File2. 2.1 reduce side jo ...
hive regex insert join group cli
1.insert Insert时,from子句既能够放在select子句后,也能够放在insert子句前,以下两句是等价的 hive> FROM invites a INSERT OVERWRI ...
hive left outer join的问题
最近BA用户反馈有两句看似很像的语句返回的结果数不一样,比较奇怪,怀疑是不是Hive的Bug Query 1 返回结果数6071 select count(distinct reviewid) as ...
hive 连接（join）查询
1.内连接 hive> select b.*,a.name from userinfo2 b,userinfo a where a.userid=b.userid; hive> selec ...

随机推荐

Navigator 对象
Navigator 对象 Navigator 对象包含有关浏览器的信息. 注意: 没有应用于 navigator 对象的公开标准,不过所有浏览器都支持该对象. Navigator 对象属性属性说明 ...
关于MyBatis mapper的insert, update, delete返回值
这里做了比较清晰的解释: http://mybatis.github.io/mybatis-3/java-api.html SqlSession As mentioned above, the Sql ...
Conherence Function
来源: 部分来自wiki:https://en.wikipedia.org/wiki/Coherence_(signal_processing): 部分来自网络其它内容. The coherence ...
解决Ehcache缓存警告问题
警告: Creating a new instance of CacheManager using the diskStorePath "D:\Apache Tomcat 6.0.18\te ...
C#并发编程经典实例--笔记
一.简介 --并发同时做多件事情 --多线程并发的一种形式,它采用多个线程来执行程序. **如非必要,代码里不要出现 "new ...
YII框架概念与安装
Yii概念: YII安装: 下载最版本http://www.framework.com 解压至访问目录下直接打开advanced/init.bat文件输入0之后输入yes 打不开 ...
用opencv的traincascade训练检测器
#1,准备正负样本正样本:可以一张图片上多个sample,也可以一张图片单独成一个sample,准备多个sample.生成描述文件如下所示: 负样本:只要不含正样本,任意图片都可以作为负样本,但是最 ...
canvas 2d 贴图技术实践
最近在公司内部的技术协会论坛里闲逛的时候,无意中发现了一篇手淘前端大牛岑安两年前写的博文,讲述了canvas的2d贴图技术.看到后觉得相当神奇.于是就自己实现了一下.不过岑安前辈的那篇博文也只是大概讲 ...
php缓存技术（减少数据库服务器压力）
静态缓存(保存在磁盘上的静态文件,用PHP生成数据放入静态文件中) a) php操作缓存 i. 生成缓存 ii. 获取缓存 iii. 删除缓存判断目录是否存在:is_dir() dirname ...
matlab 绘制条形图
Matlab使用bar和barh函数来绘制二维条形图.分别是绘制二维垂直条形图和二维水平条形图. 转自:http://jingyan.baidu.com/article/64d05a02524e63d ...