spark数据倾斜

数据倾斜的主要问题在于，某个分区数量很巨大，在做map运算的时候，将会发生别的分区task很快计算完成，但是某几个分区task的计算成为了系统的瓶颈，明显超过其他分区时间；

1.方案：Kafka的随机主题

如果kafka的topic和分区关联，而且kafka是专用的，那么其实kafka如果能够和随机主机，那么数据将会随机打入到各个分区中，这样可以解决数据热点问题；

2. 方案：将不可切割的文件转换为可切割文件

对于gzip这类文件最好转化为可切割文件；因为对于不可切割的压缩文件，将会作为一个单独分区来处理，比如8.5G压缩到了23.5M，但是因为数据量巨大，这个gzip文件所在的分区将会成为性能瓶颈。

3. 方案：调整并行度

大量的key分配到同一个分区/Task里面；spark在数据分区的时候，默认使用的HashPartition；通过增加/减少并行度，来对于热点key进行重新分区；

另外一种方式类似：自定义分区函数，将HashPartition中集中分配的key，通过自定义的方式进行分散处理；

4. 方案：Reduce侧的Join通过BroadCast转换为Map侧的Join

select... from t1 join t2 on t1.aa=t2.bb

这个sql语句spark正常的执行方式是t1表中map，t2表中数据map（t2表数据量表较小），然后reduce到一起进行关联操作；因为t1表返回的粒度和t2表返回数据粒度不一样，所以导致reduce侧分区可能出现倾斜；

对于这场场景处理，通常都是将t2表中的数据通过broadcast的方式广播到各个分区中；这样各个分区在map阶段就可以进行数据关联，避免了shuffle到reduce阶段再进行关联。

5. 方案：拆分热点key

如果倾斜发生在一张表A中（另外一张表数据B比较均匀），而且数据热点集中在少数几个key；

1. 把大表中这几个key单独拎出来：skewRDD，在拎出来的时候，对于key添加随机数，保证对这些（添加了前缀的）key进行合理分区；然后skewRDD和B表进行join；skewJoinedRDD；

2. 过滤A表中那几个key，形成unskewRDD，和B表做join，形成unskewJoinedRDD；

3. skewJoinedRDD和unskewJoinedRDD做union（联合）；

6. 方案：大表key全部进行添加随机数，小表扩大N倍

如果热点key太多了，那么就需要：

1. 把大表A所有的key都添加随机值，这样，对于大表数据进行数据重新分区，比如48取随机数，填充到key的前面，通过“，”分割；

2. 对于小表B里面所有的数据都扩充N倍，比如数据1，现在有48条数据1，48条记录value都是一样的，但是key为“1,key”,“2，key“... "48, key"

3. 然后A，B做join，这样小表B中必然有一条会和A表关联上（其余47条记录成为冗余记录）

4. A，Bjoin结果做mapToPair，去掉之前前缀，结果集OK；

看了这么多的方案，你会发现其实本质就是发现了数据倾斜，考虑怎么将热点数据进行分散（重新分区）；这里可以考虑kafka的随机分区；调整并行度；把倾斜的key对应数据单独拎出来进行分区，最后和不包含这些key的key做union；全体key添加随机数，导致全体数据重新分区，再对具有N倍冗余数据的小表进行join获取数据；

比较特殊两个方案一个是对于不可分割的数据的处理，尽量转化为可分割数据（比如压缩文件搞成非压缩文件）；另外一个是将join的表（小表）通过broadcast将数据进行广播，reduce阶段的join转化为map阶段的join。

参考（我觉得作者有些神人之感）

http://www.jasongj.com/spark/skew/

spark数据倾斜的更多相关文章

Spark性能优化之道——解决Spark数据倾斜（Data Skew）的N种姿势
原创文章,同步首发自作者个人博客转载请务必在文章开头处注明出处. 摘要本文结合实例详细阐明了Spark数据倾斜的几种场景以及对应的解决方案,包括避免数据源倾斜,调整并行度,使用自定义Partitio ...
Spark 数据倾斜
Spark 数据倾斜解决方案 2017年03月29日 17:09:58 阅读数:382 现象当你的应用程序发生以下情况时你该考虑下数据倾斜的问题了: 绝大多数task都可以愉快的执行,总 ...
spark 数据倾斜的一些表现
spark 数据倾斜的一些表现 https://yq.aliyun.com/articles/62541
Spark数据倾斜解决方案（转）
本文转发自技术世界,原文链接 http://www.jasongj.com/spark/skew/ Spark性能优化之道——解决Spark数据倾斜(Data Skew)的N种姿势发表于 2017 ...
spark数据倾斜处理
spark数据倾斜处理危害: 当出现数据倾斜时,小量任务耗时远高于其它任务,从而使得整体耗时过大,未能充分发挥分布式系统的并行计算优势. 当发生数据倾斜时,部分任务处理的数据量过大,可能造成内存不足 ...
最详细10招Spark数据倾斜调优
最详细10招Spark数据倾斜调优数据量大并不可怕,可怕的是数据倾斜 . 数据倾斜发生的现象绝大多数 task 执行得都非常快,但个别 task 执行极慢. 数据倾斜发生的原理在进行 shuff ...
Spark数据倾斜及解决方案
一.场景 1.绝大多数task执行得都非常快,但个别task执行极慢.比如,总共有100个task,97个task都在1s之内执行完了,但是剩余的task却要一两分钟.这种情况很常见. 2.原本能够正 ...
Spark 数据倾斜调优
一.what is a shuffle? 1.1 shuffle简介一个stage执行完后,下一个stage开始执行的每个task会从上一个stage执行的task所在的节点,通过网络传输获取tas ...
Spark数据倾斜解决方案及shuffle原理
数据倾斜调优与shuffle调优数据倾斜发生时的现象 1)个别task的执行速度明显慢于绝大多数task(常见情况) 2)spark作业突然报OOM异常(少见情况) 数据倾斜发生的原理在进行shu ...

随机推荐

splunk中mongodb作用——存用户相关数据如会话、搜索结果等
About the app key value store The app key value store (or KV store) provides a way to save and retri ...
zabbix的深入了解
一,Zabbix Web操作深入 1.1 Zabbix Web下的主机和模版以及监控项的添加方式 (1)创建一个模版我们所有的功能几乎都是在模版中定义的我们再点进新创建的模版查看模版里几乎可以设 ...
Nexcel的行列，和单元格坐标
book.Sheets[1].UsedRange.Rows.Count 行数从1开始 book.Sheets[1].UsedRange.LastCol 从0开始 book.Sheets[1].Cell ...
bacula备份终端操作bconsole指令
1.list命令列出各种备份状态信息 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 list Jobs #列出所有备份记录状态 list jobid= ...
玩转X-CTR100 l STM32F4 l W25Q64 SPI串行FLASH存储
我造轮子,你造车,创客一起造起来!塔克创新资讯[塔克社区 www.xtark.cn ][塔克博客 www.cnblogs.com/xtark/ ] 本文介绍X-CTR100控制器板载FLA ...
SQL 递归找查所有子节点及所有父节
在SQL的树型结构中,很多时候,知道某一节点的值,需要查找该节点的所有子节点(包括多级)的功能,这时就需要用到如下的用户自定义函数. 表结构如下: ID int Dep_Type int Dep_Co ...
CUDA ---- Memory Access
Memory Access Patterns 大部分device一开始从global Memory获取数据,而且,大部分GPU应用表现会被带宽限制.因此最大化应用对global Memory带宽的使用 ...
【笔记】《深入浅出MFC》第5章总观Application Framework
凝聚性强.组织化强的类库就是Application Framework.一组合作无间的对象,彼此藉消息的流动而沟通,并且互相调用对方的函数以求完成任务,这就是Application Framework ...
Excel根据人名匹配得到编号
操作步骤:输入公式 =IF(COUNTIF($E$2:$E2,$E2)>COUNTIF($B:$B,$E2),"",INDEX(C:C,SMALL(IF($B$1:$B$10 ...
算法训练 Multithreading
算法训练 Multithreading 时间限制:1.0s 内存限制:256.0MB 问题描述现有如下一个算法: repeat ni times yi := y y := yi+ ...

spark数据倾斜

spark数据倾斜的更多相关文章

随机推荐

热门专题