Mapperreduce的wordCount原理

wordcount原理：

1.mapper（Object key,Object value ,Context contex）阶段

2.从数据源读取一行数据传递给mapper函数的value

3.处理数据并将处理结果输出到reduce中去

String line = value.toString（）；

String[] words = line.split(" ");

context.write(word,1)

4.reduce（Object key ,List<value> values ,Context context）阶段

遍历values累加技术结果，并将数据输出

context.write(word,1)

代码示例：

Mapper类：

package com.hadoop.mr;

import java.io.IOException;

import org.apache.hadoop.io.LongWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Mapper;

/**

 * Mapper <Long, String, String, Long>

 * Mapper<LongWritable, Text, Text, LongWritable>//hadoop对上边的数据类型进行了封装

 *  LongWritable（Long）:偏移量

 *  Text（String）：输入数据的数据类型

 *  Text（String）:输出数据的key的数据类型

 *  LongWritable（Long）:输出数据的key的数据类型

 * @author shiwen

 */

public class WordCountMapper extends Mapper<LongWritable, Text, Text, LongWritable>{

    @Override

    protected void map(LongWritable key, Text value,

            Mapper<LongWritable, Text, Text, LongWritable>.Context context)

            throws IOException, InterruptedException {

        //1.读取一行

        String line = value.toString();

        //2.分割单词

        String[] words = line.split(" ");

        //3.统计单词

        for(String word : words){

            //4.输出统计

            context.write(new Text(word), new LongWritable(1));

        }

    }

}

reduce类

package com.hadoop.mr;

import java.io.IOException;

import org.apache.hadoop.io.LongWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Reducer;

public class WordCountReduce extends Reducer<Text, LongWritable, Text, LongWritable>{

    @Override

    protected void reduce(Text key, Iterable<LongWritable> values,

            Reducer<Text, LongWritable, Text, LongWritable>.Context context)

            throws IOException, InterruptedException {

        long count = 0;

        //1.遍历vlues统计数据

        for(LongWritable value : values){

            count += value.get();

        }

        //输出统计

        context.write(key, new LongWritable(count));

    }

}

运行类：

package com.hadoop.mr;

import java.io.IOException;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.LongWritable;

import org.apache.hadoop.mapreduce.Job;

import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;

import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

import com.sun.jersey.core.impl.provider.entity.XMLJAXBElementProvider.Text;

public class WordCountRunner {

    public static void main(String[] args) throws IOException, ClassNotFoundException, InterruptedException {

        //1.创建配置对象

        Configuration config = new Configuration();

        //2.Job对象

        Job job = new Job(config);

        //3.设置mapperreduce所在的jar包

        job.setJarByClass(WordCountRunner.class);

        //4.设置mapper的类

        job.setMapOutputKeyClass(WordCountMapper.class);

        //5.设置reduce的类

        job.setReducerClass(WordCountReduce.class);

        //6.设置reduce输入的key的数据类型

        job.setOutputKeyClass(Text.class);

        //7.设置reduce输出的value的数据类型

        job.setOutputValueClass(LongWritable.class);

        //8.设置输入的文件位置

        FileInputFormat.setInputPaths(job, new Path("hdfs://192.168.1.10:9000/input"));

        //9.设置输出的文件位置

        FileOutputFormat.setOutputPath(job, new Path("hdfs://192.168.1.10:9000/input"));

        //10.将任务提交给集群

        job.waitForCompletion(true);

    }

}

Mapperreduce的wordCount原理的更多相关文章

Hive实现WordCount详解
一.WordCount原理初学MapReduce编程,WordCount作为入门经典,类似于初学编程时的Hello World.WordCount的逻辑就是给定一个/多个文本,统计出文本中每次单词/ ...
4、wordcount程序原理剖析及Spark架构原理
一.wordcount程序原理深度剖析二.Spark架构原理 1.
MapReduce本地运行模式wordcount实例（附：MapReduce原理简析）
1. 环境配置 a) 配置系统环境变量HADOOP_HOME b) 把hadoop.dll文件放到c:/windows/System32目录下 c) ...
Hadoop WordCount单词计数原理
计算文件中出现每个单词的频数输入结果按照字母顺序进行排序编写WordCount.java 包含Mapper类和Reducer类编译WordCount.java javac -classpath ...
Spark入门实战系列--7.Spark Streaming（上）--实时流计算Spark Streaming原理介绍
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .Spark Streaming简介 1.1 概述 Spark Streaming 是Spa ...
hadoop运行原理之Job运行(二) Job提交及初始化
本篇主要介绍Job从客户端提交到JobTracker及其被初始化的过程. 以WordCount为例,以前的程序都是通过JobClient.runJob()方法来提交Job,但是现在大多用Job.wai ...
MapReduce编程job概念原理
在Hadoop中,每个MapReduce任务都被初始化为一个job,每个job又可分为两个阶段:map阶段和reduce阶段.这两个阶段分别用两个函数来表示.Map函数接收一个<key,valu ...
JStorm第一个程序WordCount详解
一.Strom基本知识(回顾) 1,首先明确Storm各个组件的作用,包括Nimbus,Supervisor,Spout,Bolt,Task,Worker,Tuple nimbus是整个storm任务 ...
开源分布式实时计算引擎 Iveely Computing 之 WordCount 详解(3)
WordCount是很多分布式计算中,最常用的例子,例如Hadoop.Storm,Iveely Computing也不例外.明白了WordCount在Iveely Computing上的运行原理,就很 ...

随机推荐

搜索引擎（lucene及周边）涉及的一些算法总结
一)分词 1)正向/逆向最大匹配算法典型:IKAnalyzer采用的是正向迭代最细粒度切分算法 IKAnalyzer源码简单分析: http://www.cnblogs.com/huangfox/p ...
[ZZ]Appium 文档翻译
http://testerhome.com/topics/150 Appium 是一个开源的,适用于原生或混合移动应用应用( hybrid mobile apps )的自动化测试平台. Appium ...
mac brew 安装 nginx fpm mysql 教程
一. 安装brew 要求:OS X 10.6以上系统,并且安装有XCode命令行工具对于10.11的系统需要设置下local的权限为当前用户 $ sudo chown -R $(whoami):ad ...
关于requests的session方法保持不了cookie的问题。(seesion的意思是保持一个会话，比如登陆后继续操作(记录身份信息) 而requests是单次请求的请求，身份信息不会被记录)
最近在做爬虫的时候遇到了一个问题,在用requests的session方法保持cookie的时候发现requests不能保持手动构建的cookie.起初以为requests只能自动保持由服务器返回的s ...
在 Vue 项目中引入 tinymce 富文本编辑器
项目中原本使用的富文本编辑器是 wangEditor,这是一个很轻量.简洁编辑器但是公司的业务升级,想要一个功能更全面的编辑器,我找了好久,目前常见的编辑器有这些: UEditor:百度前端的开源项 ...
[UE4]增加观察者
角色死亡以后,让控制器控制另外一个只能移动,没有实体的Character角色使用“Possess”函数让控制器控制新生成的观察者对象.如上图所示要使用Delay延迟1秒再生成观察者,是因为死亡的时候 ...
[UE4]通过使用Set TimerByFunctionName来实现反射机制
Linux开机自动挂载windows网络共享
yum install samba-client yum install cifs.utils yum install samba-common 命令: mount -v -t cifs // ...
linux下的进程信息管理
[VS工具]远程在IIS附加调试代码
1.首先在服务器以管理员的方式打开msvsmon.exe(一般这个文件路径:C:\Program Files (x86)\Microsoft Visual Studio 14.0\Common7\ID ...

Mapperreduce的wordCount原理

Mapperreduce的wordCount原理的更多相关文章

随机推荐

热门专题