Hadoop源码分析（MapReduce概论）

大家都熟悉文件系统，在对HDFS进行分析前，我们并没有花非常多的时间去介绍HDFS的背景。毕竟大家对文件系统的还是有一定的理解的，并且也有非常好的文档。在分析Hadoop的MapReduce部分前，我们还是先了解系统是怎样工作的，然后再进入我们的分析部分。

以下的图来自http://horicky.blogspot.com/2008/11/hadoop-mapreduce-implementation.html，是我看到的讲MapReduce最好的图。

以Hadoop带的wordcount为样例（以下是启动行）：

hadoop jar hadoop-0.19.0-examples.jar wordcount /usr/input/usr/output

用户提交一个任务以后，该任务由JobTracker协调，先运行Map阶段（图中M1，M2和M3），然后运行Reduce阶段（图中R1和R2）。

Map阶段和Reduce阶段动作都受TaskTracker监控。并运行在独立于TaskTracker的Java虚拟机中。

我们的输入和输出都是HDFS上的文件夹（如上图所看到的）。输入由InputFormat接口描写叙述，它的实现如ASCII文件，JDBC数据库等。分别处理对于的数据源，并提供了数据的一些特征。通过InputFormat实现，能够获取InputSplit接口的实现，这个实现用于对数据进行划分（图中的splite1到splite5。就是划分以后的结果）。同一时候从InputFormat也能够获取RecordReader接口的实现。并从输入中生成<k,v>对。有了<k,v>，就能够開始做map操作了。

map操作通过context.collect（终于通过OutputCollector. collect）将结果写到context中。当Mapper的输出被收集后，它们会被Partitioner类以指定的方式区分地写出到输出文件中。我们能够为Mapper提供Combiner，在Mapper输出它的<k,v>时，键值对不会被立即写到输出里。他们会被收集在list里（一个key值一个list）。当写入一定数量的键值对时。这部分缓冲会被Combiner中进行合并，然后再输出到Partitioner中（图中M1的黄颜色部分相应着Combiner和Partitioner）。

Map的动作做完以后。进入Reduce阶段。这个阶段分3个步骤：混洗（Shuffle），排序（sort）和reduce。

混洗阶段，Hadoop的MapReduce框架会依据Map结果中的key，将相关的结果传输到某一个Reducer上（多个Mapper产生的同一个key的中间结果分布在不同的机器上，这一步结束后，他们传输都到了处理这个key的Reducer的机器上）。这个步骤中的文件传输使用了HTTP协议。

排序和混洗是一块进行的，这个阶段将来自不同Mapper具有同样key值的<key,value>对合并到一起。

Reduce阶段。上面通过Shuffle和sort后得到的<key, (list of values)>会送到Reducer. reduce方法中处理，输出的结果通过OutputFormat。输出到DFS中。

很多其它精彩内容请关注：http://bbs.superwu.cn

关注超人学院微信二维码：

关注超人学院java免费学习交流群：

Hadoop源码分析（MapReduce概论）的更多相关文章

Hadoop源码分析之数据节点的握手，注册，上报数据块和心跳
转自:http://www.it165.net/admin/html/201402/2382.html 在上一篇文章Hadoop源码分析之DataNode的启动与停止中分析了DataNode节点的启动 ...
Hadoop源码分析之Configuration
转自:http://www.it165.net/admin/html/201312/2178.html org.apache.hadoop.conf.Configuration类是Hadoop所有功能 ...
hadoop自带例子SecondarySort源码分析MapReduce原理
这里分析MapReduce原理并没用WordCount,目前没用过hadoop也没接触过大数据,感觉,只是感觉,在项目中,如果真的用到了MapReduce那待排序的肯定会更加实用. 先贴上源码 pac ...
hadoop源码分析(2)：Map-Reduce的过程解析
一.客户端 Map-Reduce的过程首先是由客户端提交一个任务开始的. 提交任务主要是通过JobClient.runJob(JobConf)静态函数实现的: public static Runnin ...
Hadoop源码分析之产生InputSplit文件过程
用户提交 MapReduce 作业后,JobClient 会调用 InputFormat 的 getSplit方法生成 InputSplit 的信息. 一个 MapReduce 任务 ...
Hadoop源码分析之FileSystem抽象文件系统
Hadopo提供了一个抽象的文件系统模型FileSystem,HDFS是其中的一个实现. FileSystem是Hadoop中所有文件系统的抽象父类,它定义了文件系统所具有的基本特征和基本操作. Fi ...
hadoop源码分析
hadoop 源代码分析(一) Google 的核心竞争技术是它的计算平台.HadoopGoogle的大牛们用了下面5篇文章,介绍了它们的计算设施. GoogleCluster:http://rese ...
HADOOP源码分析之RPC（1）
源码位于Hadoop-common ipc包下 abstract class Server 构造Server protected Server(String bindAddress, int port ...
Hadoop源码分析（mapreduce.lib.partition/reduce/output）
Map的结果,会通过partition分发到Reducer上.Reducer做完Reduce操作后,通过OutputFormat,进行输出.以下我们就来分析參与这个过程的类. Mapper的结果, ...

随机推荐

ASP.NET MVC使用Ninject
Ninject是一个快如闪电的,轻量级的.....依赖注入框架,呃呃呃,貌似很少用到,Ninject就是一个DI容器,作用是对ASP.NET MVC程序中的组件进行解耦 ,说到解耦其实也有其他的方式可 ...
Event Serializers官网剖析（博主推荐）
不多说,直接上干货! Flume Sources官网剖析(博主推荐) Flume Channels官网剖析(博主推荐) Flume Channel Selectors官网剖析(博主推荐) Flume ...
ThinkPHP5.0的安装
ThinkPHP5.0的安装很简单: 1.下载“phpstudy”安装 2.下载thinkphp源文件 3.把thinkphp源文件解压并放到phpstudy目录下的“WWW”目录 4.然后开启服务并 ...
loadrunner监控apache服务
一.apache配置步骤(假设apache服务已安装) 1.使用find / -name httpd.conf命令查找httpd.conf文件 2.使用cd opt/lampp/apache2/con ...
js进阶 14-4 $.get()方法和$.post()方法如何使用
js进阶 14-4 $.get()方法和$.post()方法如何使用一.总结一句话总结:$.get(URL,callback); $.post(URL,data,callback); callba ...
Java核心技术卷Ⅰ 基础知识（7）
第13章集合集合接口具体的集合在表中,除了Map结尾的类之外,其他类都实现了Collection接口,而以Map结尾的类实现了Map接口. 链表数组列表散列集树集双端队列优先级队列 ...
__INLINE
VMware Ubuntu安装详细过程（详细图解）
说明:该篇博客是博主一字一码编写的,实属不易,请尊重原创,谢谢大家! 一.下载Ubuntu镜像文件下载地址:http://mirrors.aliyun.com/ubuntu-releases/16. ...
TransE论文剩余部分
4.3链接预測表3:链接预測结果.不同方法的性能. 整体结果表3显示了全部数据集全部方法的比較. 与预期结果一致,经过过滤设置的结果具有较低的平均排名和较高的hits@10,相信在链接预測方面对各 ...
mysql三种带事务批量插入
原文:mysql三种带事务批量插入 c#之mysql三种带事务批量插入前言对于像我这样的业务程序员开发一些表单内容是家常便饭的事情,说道表单我们都避免不了多行内容的提交,多行内容保存,自然要用到 ...

Hadoop源码分析（MapReduce概论）

Hadoop源码分析（MapReduce概论）的更多相关文章

随机推荐

热门专题