前面我们学习了MapReduce编程思想和编程示例,那么本节课程同学们一起操练操练,动手完成下面的项目。

项目需求

一本英文书籍包含成千上万个单词或者短语,现在我们需要在大量的单词中,找出相同字母组成的所有anagrams(字谜)。

数据集

下面是一本英文书籍截取的一部分单词内容。猛戳此链接下载数据集

initiate
initiated
initiates
initiating
initiation
initiations
initiative
initiatives
initiator
initiators
initiatory
inject
injectant
injected
injecting
injection
injections
injector
injectors
injects

思路分析

基于以上需求,我们通过以下几步完成:

1、在 Map 阶段,对每个word(单词)按字母进行排序生成sortedWord,然后输出key/value键值对(sortedWord,word)。

2、在 Reduce 阶段,统计出每组相同字母组成的所有anagrams(字谜)。

数据处理示意流程

在下面单词中,找出相同字母组成的字谜。

cat
tar
bar
act
rat

第一步:经过 map 阶段处理

< act	cat >
< art tar>
< abr bar>
< act act>
< art rat>

第二步:经过 reduce 阶段处理

< abr	bar>
< act cat,act>
< art tar,rat>

程序开发

1、编写程序执行主类:AnagramMain

package com.hadoop.test;
import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.conf.Configured;
import org.apache.hadoop.fs.FileSystem;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
import org.apache.hadoop.util.Tool;
import org.apache.hadoop.util.ToolRunner;
public class AnagramMain extends Configured implements Tool{ @SuppressWarnings( "deprecation")
@Override
public int run(String[] args) throws Exception {
Configuration conf = new Configuration(); //删除已经存在的输出目录
Path mypath = new Path(args[1]);
FileSystem hdfs = mypath.getFileSystem(conf);
if (hdfs.isDirectory(mypath)) {
hdfs.delete(mypath, true);
}
Job job = new Job(conf, "testAnagram");
job.setJarByClass(AnagramMain. class); //设置主类 job.setMapperClass(AnagramMapper. class); //Mapper
job.setMapOutputKeyClass(Text. class);
job.setMapOutputValueClass(Text. class);
job.setReducerClass(AnagramReducer. class); //Reducer
job.setOutputKeyClass(Text. class);
job.setOutputValueClass(Text. class);
FileInputFormat.addInputPath(job, new Path(args[0])); //设置输入路径
FileOutputFormat. setOutputPath(job, new Path(args[1])); //设置输出路径
job.waitForCompletion( true);
return 0; } public static void main(String[] args) throws Exception{
String[] args0 = { "hdfs://cloud004:9000/anagram/anagram.txt" ,
"hdfs://cloud004:9000/anagram/output"};
int ec = ToolRunner.run( new Configuration(), new AnagramMain(), args0);
System. exit(ec);
}
}

2、编写Mapper:AnagramMapper

package com.hadoop.test;
import java.io.IOException;
import java.util.Arrays;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Mapper; public class AnagramMapper extends Mapper< Object, Text, Text, Text> { private Text sortedText = new Text();
private Text orginalText = new Text(); public void map(Object key, Text value, Context context) throws IOException, InterruptedException { String word = value.toString();
char[] wordChars = word.toCharArray();//单词转化为字符数组
Arrays.sort(wordChars);//对字符数组按字母排序
String sortedWord = new String(wordChars);//字符数组转化为字符串
sortedText.set(sortedWord);//设置输出key的值
orginalText.set(word);//设置输出value的值
context.write( sortedText, orginalText );//map输出
} }

3、编写Reducer:AnagramReducer

package com.hadoop.test;
import java.io.IOException;
import java.util.StringTokenizer;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Reducer; public class AnagramReducer extends Reducer< Text, Text, Text, Text> { private Text outputKey = new Text();
private Text outputValue = new Text(); public void reduce(Text anagramKey, Iterable< Text> anagramValues,
Context context) throws IOException, InterruptedException {
String output = "";
//对相同字母组成的单词,使用 ~ 符号进行拼接
for(Text anagam:anagramValues){
if(!output.equals("")){
output = output + "~" ;
}
output = output + anagam.toString() ;
}
StringTokenizer outputTokenizer = new StringTokenizer(output,"~" );
//输出anagrams(字谜)大于2的结果
if(outputTokenizer.countTokens()>=2)
{
output = output.replace( "~", ",");
outputKey.set(anagramKey.toString());//设置key的值
outputValue.set(output);//设置value的值
context.write( outputKey, outputValue);//reduce
}
} }

编译和执行MapReduce作业

1、将项目编译和打包为anagram.jar,使用 SSH 客户端将 anagram.jar上传至hadoop的/home/hadoop/djt目录下。

2、使用cd /home/hadoop/djt 切换到当前目录,通过命令行执行任务。

hadoop jar anagram.jar com.hadoop.test.AnagramMain

查看运行结果

任务的最终结果输出到 HDFS ,使用如下命令查看结果。

[hadoop@cloud004 hadoop-2.2.0-x64]$ hadoop fs -cat /anagram/output/part-r-00000

部分结果集如下所示。

cehors    cosher,chores,ochres,ochers
cehorst troches,hectors,torches
cehort troche,hector
cehortu toucher,couther,retouch
cehoss coshes,choses
cehrt chert,retch
cehstu chutes,tusche
cehsty chesty,scythe
ceht etch,tech
ceiijstu jesuitic,juiciest
ceiikst ickiest,ekistic
ceiilnos isocline,silicone
ceiilnoss isoclines,silicones
ceiimmnoorss commissioner,recommission
ceiimmnoorsss recommissions,commissioners
ceiimorst isometric,eroticism
ceiimost semiotic,comities
ceiinnopst inceptions,inspection
ceiinrsstu scrutinies,scrutinise
ceiinrst citrines,crinites,inciters
ceiinrt citrine,inciter
ceiinss iciness,incises
ceiintz citizen,zincite
ceiist iciest,cities
ceikln nickel,nickle
ceiklnr crinkle,clinker
ceiklnrs clinkers,crinkles
ceiklns nickels,nickles
ceiklrs slicker,lickers
ceiklrsst sticklers,strickles
ceiklrst trickles,ticklers,stickler
ceiklrt tickler,trickle
ceiklsst slickest,stickles
ceiklst keltics,stickle,tickles
ceiklt tickle,keltic
ceiknrs nickers,snicker
ceikorr rockier,corkier
ceikorst stockier,corkiest,rockiest
ceikpst skeptic,pickets
ceikrst rickets,tickers,sticker
ceil lice,ceil
ceilmop compile,polemic
ceilmopr compiler,complier
ceilmoprs compliers,compilers
ceilmops polemics,complies,compiles
ceilnoos colonise,colonies
ceilnors incloser,licensor
ceilnorss inclosers,licensors
 

hadoop实战项目:查找相同字母组成的字谜的更多相关文章

  1. MapReduce实战项目:查找相同字母组成的字谜

    实战项目:查找相同字母组成的字谜 项目需求:一本英文书籍中包含有成千上万个单词或者短语,现在我们要从中找出相同字母组成的所有单词. 数据集和期望结果举例: 思路分析: 1)在Map阶段,对每个word ...

  2. MapReduce实战:查找相同字母组成的单词

    1.项目需求 一本英文书籍包含成千上万个单词,现在我们需要在大量的单词中,找出相同字母组成的所有单词 2.数据集 下面是一本英文书籍截取的一部分单词内容(书籍内容是随意写的,主要目的是实现这种需求) ...

  3. Hadoop实战项目:小文件合并

    项目背景 在实际项目中,输入数据往往是由许多小文件组成,这里的小文件是指小于HDFS系统Block大小的文件(默认128M),早期的版本所定义的小文件是64M,这里的hadoop-2.2.0所定义的小 ...

  4. Hadoop实战实例

    Hadoop实战实例        Hadoop实战实例        Hadoop 是Google MapReduce的一个Java实现.MapReduce是一种简化的分布式编程模式,让程序自动分布 ...

  5. 升级版:深入浅出Hadoop实战开发(云存储、MapReduce、HBase实战微博、Hive应用、Storm应用)

          Hadoop是一个分布式系统基础架构,由Apache基金会开发.用户可以在不了解分布式底层细节的情况下,开发分布式程序.充分利用集群的威力高速运算和存储.Hadoop实现了一个分布式文件系 ...

  6. .NET Core实战项目之CMS 第九章 设计篇-白话架构设计

    前面两篇文章给大家介绍了我们实战的CMS系统的数据库设计,源码也已经上传到服务器上了.今天我们就好聊聊架构设计,在开始之前先给大家分享一下这几天我一直在听的<从零开始学架构>里面关于架构设 ...

  7. .NET Core实战项目之CMS 第十六章 用户登录及验证码功能实现

    前面为了方便我们只是简单实现了基本业务功能的增删改查,但是登录功能还没有实现,而登录又是系统所必须的,得益于 ASP.NET Core的可扩展性因此我们很容易实现我们的登录功能.今天我将带着大家一起来 ...

  8. Vue2.5开发去哪儿网App 从零基础入门到实战项目

    第1章 课程介绍本章主要介绍课程的知识大纲,学习前提,讲授方式及预期收获. 1-1 课程简介 试看第2章 Vue 起步本章将快速讲解部分 Vue 基础语法,通过 TodoList 功能的编写,在熟悉基 ...

  9. Hadoop实战之三~ Hello World

    本文介绍的是在Ubuntu下安装用三台PC安装完成Hadoop集群并运行好第一个Hello World的过程,软硬件信息如下: Ubuntu:12.04 LTS Master: 1.5G RAM,奔腾 ...

随机推荐

  1. Windows之建立C++开发环境

    下载:https://yun.baidu.com/s/1pK7j4Fp 解压得到 把myMingw文件夹复制系统根目录下. 添加C:\myMingw\bin到系统环境变量 双击make-3.81.ex ...

  2. Eclipse 透视图(Perspective)

    什么是透视图? 透视图是一个包含一系列视图和内容编辑器的可视容器.默认的透视图叫 java. Eclipse 窗口可以打开多个透视图,但在同一时间只能有一个透视图处于激活状态. 用户可以在两个透视图之 ...

  3. react手记(componentWillMount,componentDidMount等)

    生命周期componentWillMount 组件出现前 就是dom还没有渲染到html文档里面componentDidMount 组件渲染完成 已经出现在dom文档里可以再各个周期实现特定的操作 生 ...

  4. odata配置控制器方法路由1

    查看edmx:http://localhost:12769/odata/$metadata 1.配置 ODataConventionModelBuilder builder = new ODataCo ...

  5. std::condition_variable(2)复习

    #include <iostream> // std::cout #include <thread> // std::thread, std::this_thread::yie ...

  6. mysql小知识点汇总

    附录:(更新于2013-11-21) sql必知必会学习笔记:http://www.cnblogs.com/IPrograming/category/509859.html mysql 基本命令学习: ...

  7. 【BZOJ2044】三维导弹拦截 DP+(有上下界的)网络流

    [BZOJ2044]三维导弹拦截 Description 一场战争正在A国与B国之间如火如荼的展开. B国凭借其强大的经济实力开发出了无数的远程攻击导弹,B国的领导人希望,通过这些导弹直接毁灭A国的指 ...

  8. 【BZOJ4898】[Apio2017]商旅 分数规划+SPFA

    [BZOJ4898][Apio2017]商旅 Description 在广阔的澳大利亚内陆地区长途跋涉后,你孤身一人带着一个背包来到了科巴.你被这个城市发达而美丽的市场所深深吸引,决定定居于此,做一个 ...

  9. 【BZOJ4974】字符串大师 KMP

    [BZOJ4974]字符串大师 Description 一个串T是S的循环节,当且仅当存在正整数k,使得S是T^k(即T重复k次)的前缀,比如abcd是abcdabcdab的循环节.给定一个长度为n的 ...

  10. 巨蟒python全栈开发django9:一些知识点的汇总

    回顾上周内容: 题目: 1.人民出版社出版过的所有书籍的名字以及作者的姓名(三种写法,笔记中有两种写法) 2.手机以2开头的作者出版过的所有书籍名称以及出版社名称(三种写法,笔记中有1种写法) 1.聚 ...