Hadoop 4 MapReduce

对单词个数统计的MapReduce的案例

Mapper类：

package main.java.worldClient;

import java.io.IOException;

import org.apache.hadoop.io.LongWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Mapper;

/**

 * <KEYIN,VALUEIN,KEYOUT,VALUEOUT>

 * 分别对应map输入和输出的key和value对应的数据类型

 * 默认map的输入，key是改行在文件中的偏移量，value是文件中一行的内容

 * @author Lenovo

 *

 */

public class WCMapper extends Mapper<LongWritable, Text, Text, LongWritable>{

	/**

	 * 切分单词，然后输出

	 */

	@Override

	protected void map(LongWritable key, Text value,Mapper<LongWritable, Text, Text, LongWritable>.Context context)

			throws IOException, InterruptedException {

		//获取一行信息

		String line = value.toString();

		String words[] = line.split(" ");

		LongWritable writable = new LongWritable(1);

		for(String word:words){

			//将输出写入context

			//write(a,b)中a与mapper(keyin,valuein,keyout,valueout)的keyout与valueout对应

			context.write(new Text(word), writable);

		}

	}

}

　　Reduce类：

package main.java.worldClient;

import java.io.IOException;

import java.util.Iterator;

import org.apache.hadoop.io.LongWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Reducer;

/**

 * <KEYIN,VALUEIN,KEYOUT,VALUEOUT>

 * reduce的输入和输出的key和value

 * 输入的key和value肯定和map输出的key和value一致

 * @author Lenovo

 *

 */

public class WCReducer extends Reducer<Text, LongWritable, Text, LongWritable>{

	@Override

	protected void reduce(Text key, Iterable<LongWritable> values,

			Reducer<Text,LongWritable,Text,LongWritable>.Context context)

			throws IOException, InterruptedException {

		int sum = 0;

		Iterator<LongWritable> iter = values.iterator();

		while(iter.hasNext()){

			LongWritable value = iter.next();

			sum += value.get();

		}

		context.write(key, new LongWritable(sum));

	}

}

　　Runner类：

package main.java.worldClient;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.LongWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Job;

import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;

import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

public class WCRunner {

	public static void main(String[] args) {

		Configuration conf = new Configuration();

		try{

			Job job = Job.getInstance(conf);

			job.setJobName("wc MR");

			job.setJarByClass(WCRunner.class);

			job.setMapperClass(WCMapper.class);

			job.setReducerClass(WCReducer.class);

			/*

			 * 如果map和reduce的输出类型一致可以不设置map的输出

			 */

			//map输出的key,value

			job.setMapOutputKeyClass(Text.class);

			job.setMapOutputValueClass(LongWritable.class);

			//reduce输出的key,value

			job.setOutputKeyClass(Text.class);

			job.setOutputValueClass(LongWritable.class);

			FileInputFormat.addInputPath(job, new Path(args[0]));

			//输出目录必须不存在

			FileOutputFormat.setOutputPath(job, new Path(args[1]));

			job.waitForCompletion(true);

		}catch (Exception e) {

			// TODO: handle exception

			e.printStackTrace();

		}

	}

}

　　在windows环境下运行会报控指针错误,目前我正在查找解决方法，所以通过Xshell与Xftp将写好的java导出jar包以及程序需要的文件传到linux虚拟机内(用linux命令将输入文件导入到hadoop的目录下这样会在接下来方便写命令)，在linux下运行测试。hadoop jar找到的jar包为本地jar包无法找hdfs上的jar文件(我自己的理解不知道对不对)

主要步骤：

1：bin/hadoop fs -mkdir -p /MRTest/input 在hdfs下创建目录

2：bin/hadoop fs -put ~/WCTest.txt.txt /MRTest/input 将程序需要执行的文件放到input文件夹下

3：bin/hadoop jar ~/wctest.jar main.java.worldClient.WCRunner /MRTest/input /MRTest/output 运行jar包其中output必须时不存在的文件目录

Hadoop 4 MapReduce的更多相关文章

Hadoop 新 MapReduce 框架 Yarn 详解
Hadoop 新 MapReduce 框架 Yarn 详解: http://www.ibm.com/developerworks/cn/opensource/os-cn-hadoop-yarn/ Ap ...
用PHP编写Hadoop的MapReduce程序
用PHP编写Hadoop的MapReduce程序 Hadoop流虽然Hadoop是用Java写的,但是Hadoop提供了Hadoop流,Hadoop流提供一个API, 允许用户使用任何语言编 ...
Hadoop之MapReduce程序应用三
摘要:MapReduce程序进行数据去重. 关键词:MapReduce 数据去重数据源:人工构造日志数据集log-file1.txt和log-file2.txt. log-file1.txt内容 ...
从Hadoop骨架MapReduce在海量数据处理模式（包括淘宝技术架构）
从hadoop框架与MapReduce模式中谈海量数据处理前言几周前,当我最初听到,以致后来初次接触Hadoop与MapReduce这两个东西,我便稍显兴奋,认为它们非常是神奇.而神奇的东西常能勾 ...
对于Hadoop的MapReduce编程makefile
根据近期需要hadoop的MapReduce程序集成到一个大的应用C/C++书面框架.在需求make当自己主动MapReduce编译和打包的应用. 在这里,一个简单的WordCount1一个例子详细的 ...
Hadoop基础-MapReduce入门篇之编写简单的Wordcount测试代码
Hadoop基础-MapReduce入门篇之编写简单的Wordcount测试代码作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 本文主要是记录一写我在学习MapReduce时的一些 ...
Hadoop基础-MapReduce的常用文件格式介绍
Hadoop基础-MapReduce的常用文件格式介绍作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.MR文件格式-SequenceFile 1>.生成SequenceF ...
Hadoop基础-MapReduce的Join操作
Hadoop基础-MapReduce的Join操作作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.连接操作Map端Join(适合处理小表+大表的情况) no001 no002 ...
Hadoop基础-MapReduce的排序
Hadoop基础-MapReduce的排序作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.MapReduce的排序分类 1>.部分排序部分排序是对单个分区进行排序,举个 ...
Hadoop基础-MapReduce的数据倾斜解决方案
Hadoop基础-MapReduce的数据倾斜解决方案作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.数据倾斜简介 1>.什么是数据倾斜答:大量数据涌入到某一节点,导致 ...

随机推荐

kudu基础入门
1.kudu介绍 1.1 背景介绍在KUDU之前,大数据主要以两种方式存储: (1)静态数据: 以 HDFS 引擎作为存储引擎,适用于高吞吐量的离线大数据分析场景.这类存储的局限性是数据无法进行随机 ...
python闭包，看不懂请揍我
什么是闭包? 闭包就是一个个内嵌函数+内嵌函数里面引用了外部变量+返回这个内嵌函数(一般是这样) 为什么使用闭包? 有点类似与函数模板?.. 举一个实际的例子: class people: name ...
Codding.net 与 Visual Studio 项目的创建和上传 push 403错误
1.在codding项目里创建一个项目,记住http 箭头的链接 2.克隆-----第一个框放入上面保存的链接, 下面的框选择一个空文件夹,选好后克隆就OK 3.在第2步NewRepo2 文件夹里 ...
Ecstore Linux服务器环境基本配置
Nginx基本配置(另存为nginx.conf直接可以使用): #user nobody; worker_processes 1; error_log logs/error.log; #error_l ...
Mac上Hive环境搭建
本文介绍在Mac上搭建Hive环境. 建议首先配置好Hadoop,搭建与配置可以参考我之前的博文Mac Hadoop的安装与配置. 当然你也可以选择使用Docker搭建环境,本文不作介绍. 安装对于 ...
loli的搜索测试-我真不知道是第多少次了
搜索测试又到了....并不激动人心的搜索测试时间. 今天和以前还是有一点不一样的,新高二的学长们也参加了(也就是说我们又要被吊打了) 话不多说,看题: fz:填一个5*5的质数方阵,要求每行,每列, ...
Spring 事务回滚代码
在事务中实行的方法:org.springframework.transaction.interceptor.TransactionAspectSupport#invokeWithinTransacti ...
thinkphp5整合 gatewaywork实现聊天
1:将下载的gatewaywork下的\vendor 下的workman文件夹,整个复制到tp5下的vendor目录下 2:tp5\application\push 新键push文件夹,将下载的 ...
shiro实战系列(十)之Subject
毫无疑问,在 Apache Shiro 中最重要的概念就是 Subject.'Subject'仅仅是一个安全术语,是指应用程序用户的特定安全的“视图”.一个 Shiro Subject 实例代表了一 ...
leetcode717—1-bit and 2-bit Characters
We have two special characters. The first character can be represented by one bit 0. The second char ...

Hadoop 4 MapReduce

Hadoop 4 MapReduce的更多相关文章

随机推荐

热门专题