Partition和ReduceTask的关系

先看源码：

    numPartitions = conf.getNumReduceTasks();

      if (numPartitions > 1) {            //设置了ReduceTask个数后（大于1），默认通过下面的getPartition()对数据进行分区

        partitioner = (Partitioner<K,V>)

          ReflectionUtils.newInstance(conf.getPartitionerClass(), conf);

      } else {

        partitioner = new Partitioner<K,V>() {

          @Override

          public void configure(JobConf job) { }

          @Override

          public int getPartition(K key, V value, int numPartitions) {

            return numPartitions - 1;      //默认情况下，ReduceTask个数为1,此时只有一个分区 即partition 0

          }

      //默认分区是根据key的hashcode对ReduceTasks个数取余得到的，用户无法控制哪个key存储到哪个分区 


       public int getPartition(K key, V value,

                 int numReduceTasks) {

　　　　　　　　　　return (key.hashCode() & Integer.MAX_VALUE) % numReduceTasks;

 　　　　　　 }

结论：

1.ReduceTask的数量由job提交时的参数决定：job.setNumReduceTasks()。设置为多少，就开启多少个ReduceTask，默认为1。设置为0时，则表示没有Reduce阶段，只有Map阶段。生成文件数量由ReduceTask数量决定。

2.Partitioner的数量由ReduceTask的数量决定，Partitioner数量 =ReduceTask数量。

其中：　　1）若ReduceTask = 1 ，无论用户有没有自定义分区规则，都只有一个分区。

　　　　　2）若设置ReduceTask >1,则如果用户没有自定义Partitioner，则按照默认的HashPartitioner对数据进行划分。

　　　　　　　　　　　　　　　　　　如果用户自定义了Partitioner，则其中的分区的个数不能超过Partittion的数量，否则会 Exception。

Partition和ReduceTask的关系的更多相关文章

Spark中的partition和block的关系
hdfs中的block是分布式存储的最小单元,类似于盛放文件的盒子,一个文件可能要占多个盒子,但一个盒子里的内容只可能来自同一份文件.假设block设置为128M,你的文件是250M,那么这份文件占3 ...
深入了解Kafka【五】Partition和消费者的关系
1.消费者与Partition 以下来自<kafak权威指南>第4章. 假设主题T1有四个分区. 1.1.一个消费者组 1.1.1.消费者数量小于分区数量只有一个消费者时,消费者1将收到 ...
Spark RDD概念学习系列之rdd的依赖关系彻底解密（十九）
本期内容: 1.RDD依赖关系的本质内幕 2.依赖关系下的数据流视图 3.经典的RDD依赖关系解析 4.RDD依赖关系源码内幕 1.RDD依赖关系的本质内幕由于RDD是粗粒度的操作数据集,每个Tra ...
Spark名词解释及关系
随着对spark的业务更深入,对spark的了解也越多,然而目前还处于知道的越多,不知道的更多阶段,当然这也是成长最快的阶段.这篇文章用作总结最近收集及理解的spark相关概念及其关系. 名词 dri ...
Hadoop(17)-MapReduce框架原理-MapReduce流程,Shuffle机制,Partition分区
MapReduce工作流程 1.准备待处理文件 2.job提交前生成一个处理规划 3.将切片信息job.split,配置信息job.xml和我们自己写的jar包交给yarn 4.yarn根据切片规划计 ...
大数据学习笔记之Hadoop（三）：MapReduce&YARN
文章目录一 MapReduce概念 1.1 为什么要MapReduce 1.2 MapReduce核心思想 1.3 MapReduce进程 1.4 MapReduce编程规范(八股文) 1.5 Ma ...
大数据技术之Hadoop（MapReduce）
第1章 MapReduce概述 1.1 MapReduce定义 1.2 MapReduce优缺点 1.2.1 优点 1.2.2 缺点 1.3 MapReduce核心思想 MapReduce核心编程思想 ...
Mapreduce之排序&规约&实战案例
MapReduce 排序和序列化简单介绍 ①序列化 (Serialization) 是指把结构化对象转化为字节流②反序列化 (Deserialization) 是序列化的逆过程. 把字节流转为结构化 ...
Hadoop详解(05) – MapReduce
Hadoop详解(05) – MapReduce MapReduce概述定义 MapReduce是一个分布式运算程序的编程框架,是用户 "基于Hadoop的数据分析应用" 开发的 ...
kafka性能参数和压力测试揭秘
转自:http://blog.csdn.net/stark_summer/article/details/50203133 上一篇文章介绍了Kafka在设计上是如何来保证高时效.大吞吐量的,主要的内容 ...

随机推荐

如何用Flask中的Blueprints构建大型Web应用
本文分享自华为云社区<构建大型Web应用Flask中的Blueprints指南>,作者: 柠檬味拥抱. 什么是Blueprints? Blueprints是Flask中的一种模式,用于将应 ...
C# 获取QQ会话聊天信息
利用UIAutomation获取QQ会话聊天信息 AutomationElement window = AutomationElement.FromHandle(get.WindowHwnd); Au ...
linux xfce 在文件管理器里点击运行shell脚本文件
1.打开 Settings Editor 2.点击左边的 thunar 3.点击右边的添加 ,在属性中输入 /misc-exec-shell-scripts-by-default 在类型中选择布尔类 ...
Linux中JMeter的使用
Linux中JMeter的使用 Linux版本JMeter安装 # 1.下载.安装JMeter 如果有安装包直接上传即可 wget -c https://archive.apache.org/dist ...
记一次nginx服务异常-无法访问问题排查
上一秒还好好地,突然下一秒nginx服务器就访问不了啦. 这让人很是疑惑,到底是什么原因导致的呢?问题如下开始一步一步地排查问题. 尝试一:在windows电脑上使用telnet命令查看端口是否正常 ...
#KD-Tree#洛谷 3710 方方方的数据结构
题目区间加,区间乘,单点查询,撤销修改分析由于可以离线,不妨把下标看成第一维,时间看成第二维,那么修改操作相当于在一个矩形上加或者乘, 不妨把查询的节点看作是二维平面上的点,这样实际上就可以用 ...
#贪心，构造#AT2266 [AGC008D] K-th K
题目给你一个长度为 \(N\) 的整数序列 \(X\),请判断是否存在一个满足下列条件的整数序列 \(a\),如果存在,请构造一种方案条件如下: \(a\) 的长度为 \(N^2\),并且满足数字 ...
Health Kit接入资质要求详解，开发不迷路！
开发运动/健康应用过程中,需要使用Health Kit提供的数据能力,作为独立的个人开发者或是企业开发者,接入时分别需要满足什么样的条件呢? 个人开发者接入资质审核要求 •个人开发者应用需上架至华为应 ...
django项目部署到centos
服务器是使用的阿里云的centos 7.6 项目使用的是 Python3.9.5 + Django 3.2.4 目标:将django项目部署到centos上,centos + Python + dja ...
CSS 布局专题
0x01 浮动布局 (1)常见网页布局顶部商标栏(Logo):展示网站的标志.名称以及具有代表性的图片导航栏(Navigation):展示网站大概的分类左侧边栏(Left-side Bar):展 ...

Partition和ReduceTask的关系

Partition和ReduceTask的关系的更多相关文章

随机推荐

热门专题