MapReduce运行流程分析

研究MapReduce已经有一段时间了。起初是从分析WordCount程序开始，后来开始阅读Hadoop源码，自认为已经看清MapReduce的运行流程。现在把自己的理解贴出来，与大家分享，欢迎纠错。

还是以最经典的WordCount程序作为基础，来分析map阶段、reduce阶段和最复杂的shuffle阶段。

文本1：hello world 文本2：map reduce

hello hadoop java interface

abc qaz java hdfs

　　　　　java jvm spark storm

这样的2个小文本文件（不足64M），肯定会产生2个map任务，reduce任务默认是1个。当然，map任务和reduce任务的个数都可以在程序中或者配置文件中人为设置。为了说明partition的过程，我们把reduce任务的个数设为2。

1、map阶段

map1 map2

输入：<xxxx, hello world> <xxxx, map reduce>

<xxxx, hello hadoop> <xxxx, java interface>

　　　 <xxxx, abc qaz> <xxxx, java hdfs>

　　　 <xxxx, java jvm> <xxxx, spark storm>

切分：<hello, 1> <map, 1>

<word, 1> <reduce, 1>

　　　<hello, 1> <java, 1>

　　　<hadoop, 1> <interface, 1>

　　　<abc, 1> <java, 1>

　　　<qaz, 1> <hdfs, 1>

　　　<java, 1> <spark, 1>

　　　<jvm, 1> <storm, 1>

2、shuffle阶段

切分完毕后，每一组<key, value>都会不断地被collect到一个内存缓冲区中，对应代码中的数据结构MapOutputBuffer。

partition过程：每一组<key, value>在被收集的时候，就已经确定了分区（partition），即在这个时候就已经确定了要交给哪个reduce任务处理。分区会给<key, value>加上一个索引标识。假设分区后（分区算法可以设定，默认是hash值模运算），数据如下：reduce1的标识是0，reduce2的标识是1

<hello, 1> 0 <map, 1> 0

<word, 1> 1 <reduce, 1> 1

　　　 <hello, 1> 0 <java, 1> 0

　　　 <hadoop, 1> 1 <interface, 1> 1

　　　 <abc, 1> 0 <java, 1> 0

　　　 <qaz, 1> 1 <hdfs, 1> 1

　　　 <java, 1> 0 <spark, 1> 0

　　　 <jvm, 1> 1 <storm, 1> 1

spill过程：缓冲区默认是100M，每当里面的数据达到80M（比例80%，这个比例也可以人为设置），就会另起一个线程SpillThread往磁盘溢写，每次溢写都会产生一个数据文件和对应的索引文件。

sort过程：在溢写的过程中一直在排序，比较算法可以定制，默认排序算法是快速排序（可以人为设定），排序的过程就是一些位置的索引在不断的变化。

排序之后的数据：

<abc, 1> 0 <hdfs, 1> 1

<hello, 1> 0 <interface, 1> 1

<hello, 1> 0 <java, 1> 0

<hadoop, 1> 1 <java, 1> 0

　　　 <java, 1> 0 <map, 1> 0

　　　 <jvm, 1> 1 <reduce, 1> 1

　　　 <qaz, 1> 1 <spark, 1> 0

　　　 <word, 1> 1 <storm, 1> 1 　

combine过程：这个过程默认是没有的，需要明确指定combiner。combiner其实就是一个reducer，可以让数据交给reduce任务之前，进行一些计算、合并。它的意义在于，使数据进一步减少，减轻了 reduce任务通过网络获取数据的压力和reduce处理数据的压力。combiner也可以自己定制，每个溢写文件都会combine。

combiner会通过一个比较器对key进行比较，相同的key（比较结果为0，比较算法可以定制），会被放到一个集合的迭代器中，然后迭代进行一次reduce运算，产生一个输出。

combine之后的数据：

<abc, 1> 0 <hdfs, 1> 1

<hello, 1+1> 0 <interface, 1> 1

<hadoop, 1> 1 <java, 1+1> 0

　　　 <java, 1> 0 <map, 1> 0

　　　 <jvm, 1> 1 <reduce, 1> 1

　　　 <qaz, 1> 1 <spark, 1> 0

　　　 <word, 1> 1 <storm, 1> 1

merge过程：一个map所有的溢写文件都会进行合并，产生一个最终的溢写文件和一个索引文件。合并是针对于不同的溢写文件中相同分区的数据。在这个合并的过程中，也会进行combine操作（如果设置了的话），此处的combine过程同上，不再细说。

copy数据过程：每个reduce任务会远程copy属于自己的多个map输出数据文件，通过http传输，在本地会合并。另外，这个过程也会进行combine，此次不过多说明。

结果如下：

reduce0 reduce1

<abc, 1> <hadoop, 1>

　　　　　　　　　　　　　　　　　　　　　　<hello, 2> <jvm, 1>

<java, 1> <qaz, 1>

　　　　　　　　　　　　　　　　　　　　　　<java, 2> <word, 1>

<map, 1> <hdfs, 1>

<spark, 1> <interface, 1>

<reduce, 1>

<storm, 1>

sort过程：对上述结果进行排序，结果如下：

reduce0 reduce1

<abc, 1> <hadoop, 1>

　　　　　　　　　　　　　　　　　　　　　　　<hello, 2> <hdfs, 1>

<java, 1> <interface, 1>

　　　　　　　　　　　　　　　　　　　　　　　 <java, 2> <jvm, 1>

<map, 1> <qaz, 1>

<spark, 1> <reduce, 1>

<storm, 1>

<word, 1>

3、reduce阶段

通过一个GroupComparator对key进行比较，相同的key（比较结果为0，比较算法可以定制），会被放到一个集合的迭代器中，然后迭代进行一次reduce运算，产生一个输出。类似combine过程。

最终的输出： reduce0 reduce1

<abc, 1> <hadoop, 1>

　　　　　　　　　　　　　　　　　　　　　　　<hello, 2> <hdfs, 1>

<java, 3> <interface, 1>

　　　　　　　　　　　　　　　　　　　　　　　 <map, 1> <jvm, 1>

<spark, 1> <qaz, 1>

<reduce, 1>

<storm, 1>

<word, 1>

从上述过程的分析可以看出，合并和排序是核心！！！

PS：其实每个阶段没有这么分明，只不过是为了分析和理解的需要，才进行这样详细的划分，而且划分的还不一定正确，请大家及时纠错。另外，上述流程中涉及到好多的细节，没有一一说明。

MapReduce运行流程分析的更多相关文章

Struts2运行流程分析
一.Struts2运行流程图: 二.运行流程分析: 1. 请求发送给StrutsPrepareAndExecuteFilter 2.StrutsPrepareAndExecuteFilter询问Act ...
011-Spring Boot 运行流程分析SpringApplication.run
一.程序入口 1.1.静态方法 //直接调用run方法 ConfigurableApplicationContext context = SpringApplication.run(App.class ...
【逆向&编程实战】Metasploit安卓载荷运行流程分析_复现meterpreter模块接管shell
/QQ:3496925334 作者:MG193.7 CNBLOG博客号:ALDYS4 未经许可,禁止转载/ 关于metasploit的安卓模块,前几次的博客我已经写了相应的分析和工具 [Android ...
hadoop运行流程分析源代码级
前言: 最近一直在分析hadoop的运行流程,我们查阅了大量的资料,虽然从感性上对这个流程有了一个认识但是我总是感觉对mapreduce的运行还是没有一个全面的认识,所以决定从源代码级别对mapred ...
thttpd和cgilua安装与运行流程分析
安装参考如下博文安装thttpd软件 http://blog.csdn.net/21aspnet/article/details/7045845 http://blog.csdn.net/drago ...
springmvc的运行流程分析
前几篇文章对springmvc讲解的很清楚,大家看下,有问题,我们再一起讨论. 其实springmvc最为重要是它的运行流程,接着,我们来分析一下,其运行过程,废话不多说,看图说话: 分析如下: 1, ...
SparkSteaming运行流程分析以及CheckPoint操作
本文主要通过源码来了解SparkStreaming程序从任务生成到任务完成整个执行流程以及中间伴随的checkpoint操作注:下面源码只贴出跟分析内容有关的代码,其他省略 1 分析流程应用程序入 ...
8、Struts2 运行流程分析
1.流程分析: 请求发送给 StrutsPrepareAndExecuteFilter StrutsPrepareAndExecuteFilter 询问 ActionMapper: 该请求是否是一个 ...
yii框架详解之 CWebApplication 运行流程分析
在程序入口处,index.php 用一句 Yii::createWebApplication($config)->run(); 开始了app的运行. 那么,首先查看 CWebApplicat ...

随机推荐

编写你的第一个程序（HelloWorld）
1)安装. 2)打开我们的编译工具Xcode,会出现一些选项,我们只需要选中第2项(因为版本不同可能有些不同)“Create a new Xcode project ”如下图(其他的选项目前我们还没有 ...
【Egret】实现web页面操作PC端本地文件操作
Egret 实现web页面操作PC端本地文件操作: http://edn.egret.com/cn/book/page/pid/181 //------------------------------ ...
[原]android sdk更新的终极解决方案
由于众所周知的原因,国内更新Android SDK一直是个老大难的事情,一般都要到处找VPN之类的工具来曲线救国.不过其实谷歌已经帮我们想到这点了,我们自身就可以解决问题,步骤如下: 打开SDK Ma ...
4.Linux的文件搜索命令
1.文件搜索命令 which 语法:which [命令名称] 范例:$which ls 列出ls命令所在目录 [chanshuyi@localhost ~]$ which ls alias ls= ...
[讨论] Window XP 安装msxml6后，load xml时提示schema验证失败
现象:在windows XP x64下,使用用户安装的msxml6库加载xml文件时失败. 进一步说明: 该xml文档使用了W3C的名称空间 xmlns:xsi= "http://www.w ...
centos7安装nagios步骤
一.Nagios简介 Nagios是一款开源的电脑系统和网络监视工具,能有效监控Windows.Linux和Unix的主机状态,交换机路由器等网络设置,打印机等.在系统或服务状态异常时发出邮件或短信报 ...
CTF入门指南(0基础)
ctf入门指南如何入门?如何组队? capture the flag 夺旗比赛类型: Web 密码学 pwn 程序的逻辑分析,漏洞利用windows.linux.小型机等 misc 杂项,隐写,数 ...
JS实现轻量级计算器
想尝试做一个网页版计算器后,参考了很多博客大神的代码,综合归纳.总结修改,整理如下文. 附: Demo 源码一.HTML+CSS 具体结构样式如下图,基本参照手机计算器界面.按钮功能可以查 ...
关于ajax post请求跨域问题的解决心得
最近啊,公司有个项目,需要做一个手机端APP的后台管理系统.所以用到了度文本编辑框,经过了好好一番周折,终于弄好了,带到上线的时候发现啊,只能使用ip去访问网页的时候上能穿图片他不会报跨域的问题,而使 ...
MySQL关于Duplicate entry '1' for key 'PRIMARY'错误
今天复习MySQL遇到Duplicate entry '1' for key 'PRIMARY'错误. 原因是主键值为'1'的数据已经存在,主键是唯一的,不可重复.

MapReduce运行流程分析

MapReduce运行流程分析的更多相关文章

随机推荐

热门专题