hadoop2.2.0的WordCount程序

package com.my.hadoop.mapreduce.wordcount;

import java.io.IOException;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.Reducer;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
import org.apache.hadoop.util.GenericOptionsParser;

/**
* MapReduce中的WordCount
* @author yao
*
*/
public class WordCount {

/**
   * MapReduce中的map函数的泛型
   * KEYIN       map函数读取文件行内容的偏移量为key
   * VALUEIN        map函数读取文件行内容
   * KEYOUT       map函数处理后输出到reduce函数的key
   * VALUEOUT       map函数处理后输出到reduce函数的value
   * @author yao
   *
   */
   static class WcMap extends Mapper<LongWritable, Text, Text, LongWritable>{
       private static final LongWritable ONE = new LongWritable(1l);
       private Text word = new Text();
       public void map(LongWritable key, Text value, Context context) throws IOException ,InterruptedException {
           String[] words = value.toString().split(" ");
           for (String w : words) {
               word.set(w);
               context.write(word, ONE);
           }
       }
   }

   /**
   * MapReduce中的reduce函数的泛型
   * KEYIN       reduce函数读取map函数输出的key
   * VALUEIN       reduce函数读取map函数输出的value
   * KEYOUT       reduce函数处理后输出到hdfs上文件的key
   * VALUEOUT       reduce函数处理后输出到hdfs上文件的value
   * @author yao
   *
   */
   static class WcReduce extends Reducer<Text, LongWritable, Text, LongWritable>{
       public void reduce(Text key, Iterable<LongWritable> value, Context context) throws java.io.IOException ,InterruptedException {
           long count = 0;
           for (LongWritable i : value) {
               count += i.get();
           }
           context.write(key, new LongWritable(count));
       }
   }

   public static void main(String[] args) throws IOException, InterruptedException, ClassNotFoundException {
       Configuration conf = new Configuration();                                           //new配置对象，默认读取顺序是default-site.xml<core-site.xml

       String[] paths = new GenericOptionsParser(conf, args).getRemainingArgs();
       if (paths.length != 2) {
           System.err.println("Usage: " + WordCount.class.getName() + " <in> <out>");
           System.exit(2);
       }

       Job job = Job.getInstance(conf, WordCount.class.getSimpleName());                   //1.x是new Job，2.x为Job.getInstance
       job.setJarByClass(WordCount.class);                                                   //设置main方法所在的类

       FileInputFormat.setInputPaths(job, new Path(args[0]));                               //设置当前作业的输入路径（可有多个输入路径）
       job.setMapperClass(WcMap.class);                                                   //指定自定义的map函数
       job.setMapOutputKeyClass(Text.class);                                               //指定自定义map函数的输出到reduce函数的key类型
       job.setMapOutputValueClass(LongWritable.class);                                       //指定自定义map函数的输出到reduce函数的value类型

       job.setCombinerClass(WcReduce.class);                                               //在map函数输出到reduce函数进行本地合并以减少网络传输的带宽资源（根据需求使用，并不适用所有业务）

       job.setReducerClass(WcReduce.class);                                               //指定自定义的reduce函数
       job.setOutputKeyClass(Text.class);                                                   //指定自定义的reduce函数输出到hdfs的key类型
       job.setOutputValueClass(LongWritable.class);                                       //指定自定义的reduce函数输出到hdfs的value类型
       FileOutputFormat.setOutputPath(job, new Path(args[1]));                               //设置当前作业的输出到hdfs的路径（只有一个输出路径且该路径必须不存在）

       int status = job.waitForCompletion(true) ? 0 : 1;                                   //提交作业：true是打印作业进度详情，false则是不打印
       System.exit(status);
   }

}

hadoop2.2.0的WordCount程序的更多相关文章

hadoop2.7.0实践- WordCount
环境要求说明:本文档为wordcount的mapreduce job编写及执行文档. 操作系统:Ubuntu14 x64位 Hadoop:Hadoop 2.7.0 Hadoop官网:http://h ...
hadoop2.7.x运行wordcount程序卡住在INFO mapreduce.Job: Running job:job _1469603958907_0002
一.抛出问题 Hadoop集群(全分布式)配置好后,运行wordcount程序测试,发现每次运行都会卡住在Running job处,然后程序就呈现出卡死的状态. wordcount运行命令:[hado ...
搭建Hadoop2.6.0+Eclipse开发调试环境(以及log4j.properties的配置)
上一篇在win7虚拟机下搭建了hadoop2.6.0伪分布式环境.为了开发调试方便,本文介绍在eclipse下搭建开发环境,连接和提交任务到hadoop集群. 1. 环境 Eclipse版本Luna ...
搭建Hadoop2.6.0+Eclipse开发调试环境
上一篇在win7虚拟机下搭建了hadoop2.6.0伪分布式环境.为了开发调试方便,本文介绍在eclipse下搭建开发环境,连接和提交任务到hadoop集群. 1. 环境 Eclipse版本Luna ...
Hadoop2.2.0 第一步完成MapReduce wordcount计算文本数量
1.完成Hadoop2.2.0单机版环境搭建之后需要利用一个例子程序来检验hadoop2 的mapreduce的功能 //启动hdfs和yarn sbin/start-dfs.sh sbin/star ...
使用命令行编译打包运行自己的MapReduce程序 Hadoop2.6.0
使用命令行编译打包运行自己的MapReduce程序 Hadoop2.6.0 网上的 MapReduce WordCount 教程对于如何编译 WordCount.java 几乎是一笔带过… 而有写到的 ...
eclipse开发hadoop2.2.0程序
在 Eclipse 环境下可以方便地进行 Hadoop 并行程序的开发和调试.前提是安装hadoop-eclipse-plugin,利用这个 plugin, 可以在 Eclipse 中创建一个 Had ...
编写简单的Mapreduce程序并部署在Hadoop2.2.0上运行
今天主要来说说怎么在Hadoop2.2.0分布式上面运行写好的 Mapreduce 程序. 可以在eclipse写好程序,export或用fatjar打包成jar文件. 先给出这个程序所依赖的Mave ...
Hadoop-2.4.0安装和wordcount执行验证
Hadoop-2.4.0安装和wordcount执行验证下面描写叙述了64位centos6.5机器下,安装32位hadoop-2.4.0,并通过执行系统自带的WordCount样例来验证服务正确性 ...

随机推荐

unity3d 版本问题
version: 4.2.1f4 1. 安装以后,不要启动,把exe拷贝覆盖. 2. 断网(重点,不断的话你试试就知道了) 3. 打开unity3d, 点击load License 4. 把ulf导入 ...
[转] 看懂UML类图和时序图
PS: 组合关系:实心,一个类A属于另一个类,或多个类,但是类A不能单独存在去使用,A一般是一种抽象的东西聚合关系:空心,一个类A可以单独存在使用不论组合聚合,A的方法都会被直接调用. 看懂UML ...
css03复合选择器
<!DOCTYPE html> <html> <head lang="en"> <meta charset="UTF-8&quo ...
css01入门小例子
<!DOCTYPE html> <html> <head lang="en"> <meta charset="UTF-8&quo ...
C#总结项目《影院售票系统》编写总结三
昨天总结了动态绘制控件.票类型的切换以及数据在窗体中的展现.今天继续总结,自己喜欢的就去做吧,让别人说去吧,省的自己再留下什么后悔遗憾,噢耶,加油! 今天总结项目中最核心的部分--购票.座位颜色状态的 ...
ASP.NET-FineUI开发实践-6
FineUI4.1.0更新,传说的V4版稳定版,很多人也从3.0+升级了,接着又连续更新了几次,现在是V4.1.3 2014-09-09日更新的.更新的挺快,感觉跟不上节奏,我很欣慰,看来开原版还是靠 ...
ASP.NET-FineUI开发实践-9
用了FineUI有一段时间了,还是分享下我咋改的吧,没想的那么难,我也是从小白来的. 基础是要懂JQ和EXTJS,主要是要懂JQ和EXTJS能干啥,这里有两个网站 http://www.w3schoo ...
hdu 2106
#include <iostream> #include <cmath> #include <string.h> using namespace std; int ...
nyoj 214
//nyoj 214 这个题目和字符串的问题类似,都是给出一组数据,寻找最长的单调递增字符这一题一开始我用dp做,发现超时,看了下时间,n*n的复杂度,换过一种思路用类似于栈的方式,来存储每次更新 ...
mdf导入sqlServer
导入mdf有两种方法: (需要mdf和ldf两个文件) 1. 在SQL企业管理器中,选择左边树型列表,根节点即"数据库"的文件夹图标,右键"所有任务"→ ...

hadoop2.2.0的WordCount程序

hadoop2.2.0的WordCount程序的更多相关文章

随机推荐

热门专题