第2节 mapreduce深入学习：11、maptask运行机制（多看几遍）

mapTask运行机制详解以及mapTask的并行度
在mapTask当中，一个文件的切片大小使用默认值是128M，就是跟我们一个block块对应大小一样

MapTask运行的整个过程背下来
1、TextInputFormat读取数据
2、调用map逻辑，默认是一个切片（就是一个block块）对应一个mapTask
3、数据写入到环形缓冲区，默认环形缓冲区的大小是100M，换型缓冲区其实就是一个数组
4、数据一直往环形缓冲区当中写，数据在环形缓冲区当中实现分区，排序，规约，分组等
5、等到数据写到环形缓冲区的80%的时候，启动溢写线程，将内存当中80M的数据，溢写到磁盘上面去
6、等到maptask完成之后，磁盘上面可能存在很多的小文件，这些小文件已经做好了局部排序，分区，规约等步骤，再把这些小文件合并成一个大的文件
7、等待reduce阶段来拉取这个文件

mapTask的一些基础设置配置（mapred-site.xml中）：

设置一：设置环型缓冲区的内存值大小（默认设置如下）

mapreduce.task.io.sort.mb

100

设置二：设置溢写百分比（默认设置如下）

mapreduce.map.sort.spill.percent

0.80

设置三：设置溢写数据目录（默认设置）

mapreduce.cluster.local.dir

${hadoop.tmp.dir}/mapred/local

设置四：设置一次最多合并多少个溢写文件（默认设置如下）

mapreduce.task.io.sort.factor

第2节 mapreduce深入学习：11、maptask运行机制（多看几遍）的更多相关文章

第2节 mapreduce深入学习：7、MapReduce的规约过程combiner
第2节 mapreduce深入学习:7.MapReduce的规约过程combiner 每一个 map 都可能会产生大量的本地输出,Combiner 的作用就是对 map 端的输出先做一次合并,以减少在 ...
第2节 mapreduce深入学习：14、mapreduce数据压缩-使用snappy进行压缩
第2节 mapreduce深入学习:14.mapreduce数据压缩-使用snappy进行压缩文件压缩有两大好处,节约磁盘空间,加速数据在网络和磁盘上的传输. 方式一:在代码中进行设置压缩代码: ...
第2节 mapreduce深入学习：8、手机流量汇总求和
第2节 mapreduce深入学习:8.手机流量汇总求和例子:MapReduce综合练习之上网流量统计. 数据格式参见资料夹需求一:统计求和统计每个手机号的上行流量总和,下行流量总和,上行总流量 ...
第2节 mapreduce深入学习：6、MapReduce当中的计数器
第2节 mapreduce深入学习:6. MapReduce当中的计数器计数器是收集作业统计信息的有效手段之一,用于质量控制或应用级统计.计数器还可辅助诊断系统故障.如果需要将日志信息传输到map ...
第2节 mapreduce深入学习：4, 5
第2节 mapreduce深入学习:4.mapreduce的序列化以及自定义排序序列化(Serialization)是指把结构化对象转化为字节流. 反序列化(Deserialization)是序列化 ...
第2节 mapreduce深入学习：2、3
第2节 mapreduce深入学习:2.MapReduce的分区:3.分区案例的补充完成运行实现在MapReduce中,通过我们指定分区,会将同一个分区的数据发送到同一个reduce当中进行处理,例 ...
GAN︱生成模型学习笔记（运行机制、NLP结合难点、应用案例、相关Paper）
我对GAN"生成对抗网络"(Generative Adversarial Networks)的看法: 前几天在公开课听了新加坡国立大学[机器学习与视觉实验室]负责人冯佳时博士在[硬 ...
第2节 mapreduce深入学习：15、reduce端的join算法的实现
reduce端的join算法: 例子: 商品表数据 product: pidp0001,小米5,1000,2000p0002,锤子T1,1000,3000 订单表数据 order: pid ...
第2节 mapreduce深入学习：12、reducetask运行机制（多看几遍）
ReduceTask的运行的整个过程背下来1.启动线程到mapTask那里去拷贝数据,拉取属于每一个reducetask自己内部的数据2.数据的合并,拉取过来的数据进行合并,合并的过程,有可能在内存 ...

随机推荐

Macaca框架
收藏 http://www.cnblogs.com/jinjiangongzuoshi/p/6537795.html
从0开始学习Hadoop（2）安装JDK以及设置SSH
安装JDK 使用ppa/源方式安装 1.添加ppa sudo add-apt-repository ppa:webupd8team/java sudo apt-get update 2.安装oracl ...
jsDoc 使用及配置！
原文地址:http://www.cnblogs.com/hxling/archive/2012/11/27/2791067.html jsDoc 说白了就是帮助你生成JS的文档,但有个前提,就是你编写 ...
java.lang.NoSuchMethodError: org.springframework.web.context.ConfigurableWebApplicationContext.setId
运行spring报了这个错误,网上说是spring版本冲突,检查maven依赖,发现我依赖的是spring-core.3.0.5,但是spring-orm和spring-tx依赖了spring-bea ...
从事UNIX/LInux服务器编程最方便的代码编译工具------(eclipse for c/c++)、(FileZilla)、(Secure CRT) 这三种一定要一起使用之1
今天主要是将前几天搞的Linux学习的心得写出来,希望帮助更多的人进行,方便从事Unix和Linux编程的同行和刚入门者.主要介绍三种工具并给出安装过程,请大家不必怀疑这个博文,此博文是我自己原创.请 ...
【转载】Nginx 的工作原理和优化
1. Nginx的模块与工作原理 Nginx由内核和模块组成,其中,内核的设计非常微小和简洁,完成的工作也非常简单,仅仅通过查找配置文件将客户端请求映射到一个location block(locati ...
hdu4608 I-number
题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=4608 题意:给定一个数X,注意X是个大数,X的长度不超过1e5. 让你求出一个Y,满足三个条件,Y&g ...
Tomcat配置JVM运存
setenv.bat set "JAVA_OPTS=-server -Xms256M -Xmx1024M -XX:PermSize=256m -XX:MaxPermSize=1024m&qu ...
java翻译lua+c+openssl签名项目
原来项目中用openresty nginx+lua实现server,lua调用c动态链接库,来使用openss做签名,并生成130字节(128签名+2位自定义字节)长度的文件. nginx: loca ...
nginx下配置虚拟主机
linux 虚拟机下配置虚拟主机 nginx.conf 文件不动, 在 conf.d 或者 conf 目录下新建项目.conf server { listen 80; server_name loc ...

第2节 mapreduce深入学习：11、maptask运行机制（多看几遍）

第2节 mapreduce深入学习：11、maptask运行机制（多看几遍）的更多相关文章

随机推荐

热门专题