关于MapReduce默认分区策略

MapReduce默认分区策略

mapreduce 默认的分区方式是hashPartition，在这种分区方式下，KV对根据key的hashcode值与reduceTask个数进行取模，决定该键值对该要访问哪个ReduceTask。

以下就是Hadoop MapReduce中对于默认分区的源码

public int getPartition(K2 key, V2 value,

                          int numReduceTasks) {

    return (key.hashCode() & Integer.MAX_VALUE) % numReduceTasks;

  }

其中key.hashCode()，是对map输出的key取hashCode值
& 是java中位运算符，在数据的二进制层面上按位与的意思

public class data13{

public static void main(String[] args){

	int a=129;

	int b=128;

	System.out.println("a 和b 与的结果是："+(a & b));

	}

}

运行结果：a 和b与的结果是：128

下面分析这个程序：

“a”的值是129，转换成二进制就是10000001，而“b”的值是128，转换成二进制就是10000000。

根据与运算符的运算规律，只有两个位都是1，结果才是1，可以知道结果就是10000000，即128。

综合而言，key.hashCode() & Integer.MAX_VALUE 是要保证任何map输出的key在numReduceTasks取模后决定的分区为正整数。

常见数据的hashcode值

int类型的数据

public void testInt() {

		for(int i = -3;i<=3; i++ ) {

			System.out.println(((Integer)i).hashCode());

		}

	}

结果：

由此可见，对于int数据而言，它的hashcode值就是其包装类型Integer本身，也有正负之分

解决int类型数据hashcode值取模出现负数而影响分区的方式

public void testIntMax() {

		for(int i = -3;i<=3; i++) {

			int n = ((Integer)i).hashCode();

			System.out.println(n & Integer.MAX_VALUE);

		}

	}

结果：

由此可见hashcode值如果为负数的话，可以对其与Integer.MAX_VALUE按位运算，之后其结果就成为了正数

3.字符类型的hashcode值

public void testChar(){

		for(int i = (int)'a'; i<=(int)'a'+25;i++ ) {

			String str = String.valueOf((char)i);

			System.out.print((char)i+"->"+str.hashCode()+"\n");

		}

	}

结果：

a->97

b->98

...

x->120

y->121

z->122

由此可见英文字幕a-z或者A-Z的hashcode值就是其对应的整形数值。

————————————————

原文链接：https://blog.csdn.net/gjf362/article/details/74496977

关于MapReduce默认分区策略的更多相关文章

Kafka生成消息时的3种分区策略
摘要:KafkaProducer在发送消息的时候,需要指定发送到哪个分区, 那么这个分区策略都有哪些呢? 本文分享自华为云社区<Kafka生产者3中分区分配策略>,作者:石臻臻的杂货铺. ...
HBase 的MOB压缩分区策略介绍
版权声明:本文为博主原创文章.未经博主同意不得转载. https://blog.csdn.net/zNZQhb07Nr/article/details/79832392 HBase应用场景很广泛.社区 ...
DART: a fast and accurate RNA-seq mapper with a partitioning strategy DART：使用分区策略的快速准确的RNA-seq映射器
DART: a fast and accurate RNA-seq mapper with a partitioning strategyDART:使用分区策略的快速准确的RNA-seq映射器 Abs ...
cassandra框架模型之一——Colum排序，分区策略 Token，Partitioner bloom-filter，HASH
转自:http://asyty.iteye.com/blog/1202072 一.Cassandra框架二.Cassandra数据模型 Colum / Colum Family, SuperColum ...
Spark GraphX图算法应用【分区策略、PageRank、ConnectedComponents，TriangleCount】
一.分区策略 GraphX采用顶点分割的方式进行分布式图分区.GraphX不会沿着边划分图形,而是沿着顶点划分图形,这可以减少通信和存储的开销.从逻辑上讲,这对应于为机器分配边并允许顶点跨越多台机器. ...
Kafka 消费者及消费者分区策略
消费方式: consumer 采用 pull(拉)模式从 broker 中读取数据. push(推)模式很难适应消费速率不同的消费者,因为消息发送速率是由 broker 决定的. 它的目标是尽可能以最 ...
Kafka分区策略
Kafka分区策略所谓分区策略是决定生产者将消息发送到哪个分区的算法.Kafka 为我们提供了默认的分区策略,同时它也支持你自定义分区策略. 常见的分区策略包含以下几种:轮询策略.随机策略 .按消息 ...
UEFI+GPT模式下的Windows系统中分区结构和默认分区大小及硬盘整数分区研究
内容摘要:本文主要讨论和分析在UEFI+GPT模式下的Windows系统(主要是最新的Win10X64)中默认的分区结构和默认的分区大小,硬盘整数分区.4K对齐.起始扇区.恢复分区.ESP分区.MSR ...
Hive 默认分区
在hive里面表可以创建成分区表,但是当分区字段的值是'' 或者 null时 hive会自动将分区命名为默认分区名称. 默认情况下,默认分区的名称为__HIVE_DEFAULT_PARTITION__ ...

随机推荐

jmeter接口测试 -- Base64加密（函数助手添加自定义函数）
图片转码 base64 致谢参考博客: https://www.cnblogs.com/qiaoyeye/p/7218770.html https://www.cnblogs.com/lasdaybg ...
Jmeter性能测试使用指南
图床如果失效,可以关注二维码,公众号查阅. JMeter安装 1.下载地址: https://downloads.apache.org//jmeter/binaries/apache-jmeter-5 ...
iPhone截长图的方法
iPhone手机暂没有长图截取功能,所以我们只能通过别的方式进行长图截取. (2020年4月10日更新) ios13目前可以截长图了,不过只能在Safari中进行长图截取,而且存储形式为pdf格式,下 ...
bootstrap-treeview 研究一下
一直以来都是拿来主义,现在正好有空,也正好用到,准备好好研究下bootstrap-treeview. 实现目标:可搜索,可复选选中的权限控制菜单项. 研究失败转 jstree
SpringCloud Bus 动态刷新全局广播和定点通知
全局广播前提: 先具备良好的 RabbitMQ 环境 1. 演示广播效果,增加复杂度,再以3355为模板再制做一个3366模块  <?xml versi ...
checkbox变成单选型
checkbox的特性是可以选中或者取消,有时需要利用这一点做一个类似radio的选项框: <input type="checkbox" class="aa&quo ...
Day12_搜索过滤
学于黑马和传智播客联合做的教学项目感谢黑马官网传智播客官网微信搜索"艺术行者",关注并回复关键词"乐优商城"获取视频和教程资料! b站在线视频 0.学习 ...
2019 HL SC day1
今天讲的是图论大体上分为:有向图的强连通分量,有向图的完全图:竞赛图,无向图的的割点,割边,点双联通分量,变双联通分量以及圆方树 2-sat问题支配树等等. 大体上都知道是些什么东西但是仍需要写一 ...
bzoj 2125 最短路点双圆方树
LINK:最短路一张仙人掌图求图中两点最短路. \(n<=10000,Q<=10000,w>=1\) 考虑边数是多少 m>=n-1 对于一张仙人掌图考虑先构建出来dfs树 ...
C++文件操作和模板
1.数据层次位 bit 字节 byte 域/记录将所有记录顺序地写入一个文件---->顺序文件:一个有限字符构成的顺序字符流 C++标准库中:ifsteam,ofstream,fstream ...

关于MapReduce默认分区策略

MapReduce默认分区策略

常见数据的hashcode值

关于MapReduce默认分区策略的更多相关文章

随机推荐

热门专题