MapReduce Partition解析

Map的结果，会通过partition分发到Reducer上，reducer操作过后会进行输出。输出的文件格式后缀000001就代表1分区。

Mapper处理过后的键值对，是需要送到Reducer那边进行合并，具有相同的key的键值对会送到同一个Reducer上面。哪个key到哪个Reducer的分配过程，是由Partition决定的

里面只有一个方法getPartition()

@Public

@Stable

public abstract class Partitioner<KEY, VALUE> {

    public Partitioner() {

    }

    public abstract int getPartition(KEY var1, VALUE var2, int var3);

}

输入（形参）是Map的结果对<key, value>和reducerTask的数目，输出（返回值）则是分配的Reducer（整数编号）。

就是指定某个Mapper输出的键值对到哪一个reducer上去。

系统缺省的Partitioner是HashPartitioner，它的实现是以key的hashcode对reducer的数值取模，得到对应的Reducer。这样就保证了相同的key值，分配到了同一个Reducer上。编号不大于指定的reducerTasks，0,1,2······（n-1）。

job.setPartitionerClass(JournalDataPartitioner.class);

job.setNumReduceTasks(CollectionUtils.isEmpty(branchIds) ? 3 : branchIds.size() + 1);

partition类

private static class JournalDataPartitioner extends Partitioner<Text, JournalTrxDataSet> {

        @Override

        public int getPartition(Text key, JournalTrxDataSet value, int arg2) {

            if (!CollectionUtils.isEmpty(branchIds)){

                for (int i = 0; i < branchIds.size(); i++) {

                    if (branchIds.get(i).equals(value.getBranchId())){

                        log.info(">>>>>> i = {}", i);

                        return i + 1;

                    }

                }

                return 0;

            }else {

                if ("706010101".equals(value.getBranchId())) {

                    return 1;

                } else if ("706010106".equals(value.getBranchId())) {

                    return 2;

                }

                return 0;

            }

        }

    }

MapReduce Partition解析的更多相关文章

Mapreduce 框架解析
MapReduce过程解析一.客户端 Map-Reduce的过程首先是由客户端提交一个任务开始的. public static RunningJob runJob(JobConf job) thro ...
Hadoop — MapReduce原理解析
1. 概述 Mapreduce是一个分布式运算程序的编程框架,是用户开发"基于hadoop的数据分析应用"的核心框架: Mapreduce核心功能是将用户编写的业务逻辑代码和自带默 ...
MapReduce编程解析
MapReduce编程模型之案例 wordcount 输入数据 atguigu atguiguss sscls clsjiaobanzhangxuehadoop 输出数据 atguigu 2banzh ...
Hadoop中Partition解析
1.解析Partition Map的结果,会通过partition分发到Reducer上,Reducer做完Reduce操作后,通过OutputFormat,进行输出,下面我们就来分析参与这个过程的类 ...
[转] hadoop MapReduce实例解析-非常不错，讲解清晰
来源:http://blog.csdn.net/liuxiaochen123/article/details/8786715?utm_source=tuicool 2013-04-11 10:15 4 ...
批处理引擎MapReduce程序设计
批处理引擎MapReduce程序设计作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.MapReduce API Hadoop同时提供了新旧两套MapReduce API,新AP ...
【Hadoop】mapreduce环形缓冲区
mapreduce过程解析数据在map中怎么写入磁盘? 数据:经过map逻辑处理过后的数据(key,value)- 磁盘:本地磁盘环形缓冲区 1.为什么要环形缓冲区? 答:使用环形缓冲区,便于写入 ...
hadoop jobhistory解析工具汇总
1. White Elephant是LinkedIn开源的一套Hadoop 作业日志收集器和展示器,使用mapreduce作业解析jobhistory日志,得到每个用户使用的资源情况,并通过网页展示. ...
hadoop下跑mapreduce程序报错
mapreduce真的是门学问,遇到的问题逼着我把它从MRv1摸索到MRv2,从年前就牵挂在心里,连过年回家的旅途上都是心情凝重,今天终于在eclipse控制台看到了job completed suc ...

随机推荐

SpringBoot使用JSP（官网Demo）
最开始接触java的时候,前端页面基本都是用jsp来写,最近公司项目要使用SpringBoot重构,查看SpringBoot文档,发现SpringBoot不建议使用JSP,因为jsp在使用内嵌serv ...
iOS开发基础篇-Button基础
一.简单介绍 UIButton 的功能:响应用户操作.显示文字.显示图片.调整内部图片和文字的位置. 二. UIButton 的状态 UIControlStateNormal :普通状态,为默认情 ...
visual studio 各版本激活码
visual studio 各版本激活码版本产品型号激活码 vs2019 Enterprise(企业版) BF8Y8-GN2QH-T84XB-QVY3B-RC4DF vs2019 Profes ...
First ServiceStack Service
博客1:ServiceStack Web Service 创建与调用简单示列博客2:Hbuilder+vs2017 web api开发app 官方文档:servicestack docs 1.手动下 ...
Static Sushi AtCoder - 4118 （技巧枚举）
Problem Statement "Teishi-zushi", a Japanese restaurant, is a plain restaurant with only o ...
Redisson 分布式锁
Redisson_百度百科https://baike.baidu.com/item/Redisson/20856570 redission 分布式锁 - 穆穆兔兔 - 博客园https://www.c ...
Java多线程-线程池ThreadPoolExecutor构造方法和规则
为什么用线程池原文地址 http://blog.csdn.net/qq_25806863/article/details/71126867 有时候,系统需要处理非常多的执行时间很短的请求,如果每一个 ...
jdk安装及配置
点击jdk文件运行安装完成后的目录: 2,在系统变量下面配置 JAVA_HOME:你自己的jdk的路径 CLASSPATH= .;%JAVA_HOME%\lib\dt.jar;%JAVA_HOME% ...
git 的简单实用
一. 安装 Git(git_for_windows.xp510.com.rar) 二. 使用 a) 进入到 git bash(命令行工具) b) 初始化user.name,user.email $ g ...
Mybatis的应用1 Mybatis和logback的应用配置
首先新建一个module, 然后,在pom文件里面添加一些引用的项. pom.xml <?xml version="1.0" encoding="UTF-8&quo ...

MapReduce Partition解析

MapReduce Partition解析的更多相关文章

随机推荐

热门专题