sample采样倾斜key并单独进行join代码

        /**

         * sample采样倾斜key单独进行join

         */

        JavaPairRDD<Long, String> sampledRDD = userid2PartAggrInfoRDD.sample(false, 0.1, 9);

        JavaPairRDD<Long, Long> mappedSampledRDD = sampledRDD.mapToPair(

                new PairFunction<Tuple2<Long,String>, Long, Long>() {

                    private static final long serialVersionUID = 1L;

                    @Override

                    public Tuple2<Long, Long> call(Tuple2<Long, String> tuple)

                            throws Exception {

                        return new Tuple2<Long, Long>(tuple._1, 1L);

                    }

                });

        JavaPairRDD<Long, Long> computedSampledRDD = mappedSampledRDD.reduceByKey(

                new Function2<Long, Long, Long>() {

                    private static final long serialVersionUID = 1L;

                    @Override

                    public Long call(Long v1, Long v2) throws Exception {

                        return v1 + v2;

                    }

                });

        JavaPairRDD<Long, Long> reversedSampledRDD = computedSampledRDD.mapToPair(

                new PairFunction<Tuple2<Long,Long>, Long, Long>() {

                    private static final long serialVersionUID = 1L;

                    @Override

                    public Tuple2<Long, Long> call(Tuple2<Long, Long> tuple)

                            throws Exception {

                        return new Tuple2<Long, Long>(tuple._2, tuple._1);

                    }

                });

        final Long skewedUserid = reversedSampledRDD.sortByKey(false).take(1).get(0)._2;  

        JavaPairRDD<Long, String> skewedRDD = userid2PartAggrInfoRDD.filter(

                new Function<Tuple2<Long,String>, Boolean>() {

                    private static final long serialVersionUID = 1L;

                    @Override

                    public Boolean call(Tuple2<Long, String> tuple) throws Exception {

                        return tuple._1.equals(skewedUserid);

                    }

                });

        JavaPairRDD<Long, String> commonRDD = userid2PartAggrInfoRDD.filter(

                new Function<Tuple2<Long,String>, Boolean>() {

                    private static final long serialVersionUID = 1L;

                    @Override

                    public Boolean call(Tuple2<Long, String> tuple) throws Exception {

                        return !tuple._1.equals(skewedUserid);

                    }

                });

        JavaPairRDD<String, Row> skewedUserid2infoRDD = userid2InfoRDD.filter(

                new Function<Tuple2<Long,Row>, Boolean>() {

                    private static final long serialVersionUID = 1L;

                    @Override

                    public Boolean call(Tuple2<Long, Row> tuple) throws Exception {

                        return tuple._1.equals(skewedUserid);

                    }

                }).flatMapToPair(new PairFlatMapFunction<Tuple2<Long,Row>, String, Row>() {

                    private static final long serialVersionUID = 1L;

                    @Override

                    public Iterable<Tuple2<String, Row>> call(

                            Tuple2<Long, Row> tuple) throws Exception {

                        Random random = new Random();

                        List<Tuple2<String, Row>> list = new ArrayList<Tuple2<String, Row>>();

                        for(int i = 0; i <; i++) {

                            int prefix = random.nextInt(100);

                            list.add(new Tuple2<String, Row>(prefix + "_" + tuple._1, tuple._2));

                        }

                        return list;

                    }

                });

        JavaPairRDD<Long, Tuple2<String, Row>> joinedRDD1 = skewedRDD.mapToPair(

                new PairFunction<Tuple2<Long,String>, String, String>() {

                    private static final long serialVersionUID = 1L;

                    @Override

                    public Tuple2<String, String> call(Tuple2<Long, String> tuple)

                            throws Exception {

                        Random random = new Random();

                        int prefix = random.nextInt(100);

                        return new Tuple2<String, String>(prefix + "_" + tuple._1, tuple._2);

                    }

                }).join(skewedUserid2infoRDD).mapToPair(

                        new PairFunction<Tuple2<String,Tuple2<String,Row>>, Long, Tuple2<String, Row>>() {

                            private static final long serialVersionUID = 1L;

                            @Override

                            public Tuple2<Long, Tuple2<String, Row>> call(

                                    Tuple2<String, Tuple2<String, Row>> tuple)

                                    throws Exception {

                                long userid = Long.valueOf(tuple._1.split("_")[1]);

                                return new Tuple2<Long, Tuple2<String, Row>>(userid, tuple._2);

                            }

                        });

        JavaPairRDD<Long, Tuple2<String, Row>> joinedRDD2 = commonRDD.join(userid2InfoRDD);

        JavaPairRDD<Long, Tuple2<String, Row>> joinedRDD = joinedRDD1.union(joinedRDD2);

        JavaPairRDD<String, String> sessionid2FullAggrInfoRDD = joinedRDD.mapToPair(

                new PairFunction<Tuple2<Long,Tuple2<String,Row>>, String, String>() {

                    private static final long serialVersionUID = 1L;

                    @Override

                    public Tuple2<String, String> call(

                            Tuple2<Long, Tuple2<String, Row>> tuple)

                            throws Exception {

                        String partAggrInfo = tuple._2._1;

                        Row userInfoRow = tuple._2._2;

                        String sessionid = StringUtils.getFieldFromConcatString(

                                partAggrInfo, "\\|", Constants.FIELD_SESSION_ID);

                        int age = userInfoRow.getInt(3);

                        String professional = userInfoRow.getString(4);

                        String city = userInfoRow.getString(5);

                        String sex = userInfoRow.getString(6);

                        String fullAggrInfo = partAggrInfo + "|"

                                + Constants.FIELD_AGE + "=" + age + "|"

                                + Constants.FIELD_PROFESSIONAL + "=" + professional + "|"

                                + Constants.FIELD_CITY + "=" + city + "|"

                                + Constants.FIELD_SEX + "=" + sex;

                        return new Tuple2<String, String>(sessionid, fullAggrInfo);

                    }

                });

sample采样倾斜key并单独进行join代码的更多相关文章

MongoDB With Spark遇到的2个错误，不能初始化和sample重复的key
1.$sample stage could not find a non-duplicate document while using a random cursor 这个问题比较难解决,因为我用mo ...
图片文档倾斜矫正算法附完整c代码
2年前在学习图像算法的时候看到一个文档倾斜矫正的算法. 也就是说能将一些文档图像进行旋转矫正, 当然这个算法一般用于一些文档扫描软件做后处理或者用于ocr 文字识别做前处理. 相关的关键词: 抗倾斜 ...
使用随机数以及扩容表进行join代码
/** * 使用随机数和扩容表进行join */ JavaPairRDD<String, Row> expandedRDD = userid2InfoRDD.flatMapToPair( ...
split().reverse().join()代码解析
split() 方法用于把一个字符串分割成字符串数组. reverse() 方法用于颠倒数组中元素的顺序. join() 方法用于把数组中的所有元素放入一个字符串.
git 设置 key 到服务器，同步代码不需要输入用户名和密码
1 ssh-keygen -t rsa 2 vim ~/.ssh/id_rsa.pub 3. 添加到git 服务器,这样同步代码就不需要输入密码
Spark实践 -- 性能优化基础
性能调优相关的原理讲解.经验总结: 掌握一整套Spark企业级性能调优解决方案:而不只是简单的一些性能调优技巧. 针对写好的spark作业,实施一整套数据倾斜解决方案:实际经验中积累的数据倾斜现象的表 ...
最完整的数据倾斜解决方案(spark)
一.了解数据倾斜数据倾斜的原理: 在执行shuffle操作的时候,按照key,来进行values的数据的输出,拉取和聚合.同一个key的values,一定是分配到一个Reduce task进行处理. ...
spark性能调优06-数据倾斜处理
1.数据倾斜 1.1 数据倾斜的现象现象一:大部分的task都能快速执行完,剩下几个task执行非常慢现象二:大部分的task都能快速执行完,但总是执行到某个task时就会报OOM,JVM out ...
Spark性能调优之解决数据倾斜
Spark性能调优之解决数据倾斜数据倾斜七种解决方案 shuffle的过程最容易引起数据倾斜 1.使用Hive ETL预处理数据 • 方案适用场景:如果导致数据倾斜的是Hive表.如果该Hiv ...

随机推荐

微软与Node.js的开源之旅
微软近年来在开源领域可谓是大刀阔斧的前进中,继2015年微软与红帽合作,微软智能云Azure与Linux进一步融合等举措之后,2016年,微软继续加大开源之举,大力推进Node.js的开发和开源社区的 ...
Microsoft Office ->> 完整卸载Office 2007
今天用GHOST安装了Windows 8.1,结果发现预装了Office 2007,而且这个GHOST系统的Office 2007还不是很正规的安装手法安装的.它没有在注册表中注册.在打开控制面板后发 ...
SQL Server 2014 聚集列存储
SQL Server 自2012以来引入了列存储的概念,至今2016对列存储的支持已经是非常友好了.由于我这边线上环境主要是2014,所以本文是以2014为基础的SQL Server 的列存储的介绍. ...
用WCAT进行IIS压力测试
用WCAT进行IIS压力测试分类: javascript专辑 IT信息化 2008-10-13 16:56 5754人阅读评论(1) 收藏举报 iis测试服务器microsoft脚本网络如何建 ...
捕获Task.WhenALl返回的Task的Exception
如果有一个任务抛出异常,则Task.WhenAll 会出错,并把这个异常放在返回的Task 中.如果多个任务抛出异常,则这些异常都会放在返回的Task 中.但是,如果这个Task 在被await 调用 ...
linux下 signal信号机制的透彻分析与各种实例讲解
转自:http://blog.sina.com.cn/s/blog_636a55070101vs2d.html 转自:http://blog.csdn.net/tiany524/article/det ...
Ios国际化翻译工具
IOS Translation Tool(IOS国际化翻译工具) 介绍当IOS项目国际化的时候,手工去翻译每一个字符串是一件非常痛苦的事情.尤其是当项目中存在N多种语言.而且又很难保证,手工翻译的准 ...
Intellij IDEA设置注释作者名字
方法一:File >> Settings >> Editor >>Code Style >> File and Code Templates>&g ...
Python中返回SQL字段名
def ReturnInfo(self, avalue, akey): cursor = connection.cursor() if type(avalue) == int: Sql = " ...
AtCoder Grand Contest
一句话题解 QwQ主要是因为这篇文章写的有点长……有时候要找某一个题可能不是很好找,所以写了这个东西. 具体的题意.题解和代码可以再往下翻._(:з」∠)_ AGC 001 C:枚举中点/中边. D: ...

sample采样倾斜key并单独进行join代码

sample采样倾斜key并单独进行join代码的更多相关文章

随机推荐

热门专题