MapReduce应用案例--简单的数据去重

1. 设计思路

　　去重，重点就是无论某个数据在文件中出现多少次，最后只是输出一次就可以。根据这一点，我们联想到在reduce阶段数据输入形式是 <key, value list>,只要是key相同的，在shuffle阶段都会聚合在一起，所以只要在map阶段将要去重的数据作为key值就可以达到目的。

2. 具体实现

package moverepeat;

import java.io.IOException;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.LongWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Job;

import org.apache.hadoop.mapreduce.Mapper;

import org.apache.hadoop.mapreduce.Reducer;

import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;

import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

/**

 *

 * @author Amei 去除重复的数据项

 */

public class Remove {

    public static class Map extends Mapper<LongWritable, Text, Text, Text> {

        protected void map(LongWritable key, Text value, Context output)

                throws java.io.IOException, InterruptedException {

            //将每一行的数据作为map输出的key

            output.write(value, new Text(""));

        };

    }

    public static class Reduce extends Reducer<Text, Text, Text, Text> {

        protected void reduce(Text key, Iterable<Text> values, Context output)

                throws java.io.IOException, InterruptedException {

            //经过shuffle阶段后，Reduce的输入数据格式为<key, value list>,此时key没有相同的值

            output.write(key, new Text(""));

        };

    }

    public static void main(String[] args) throws IOException,

            ClassNotFoundException, InterruptedException {

        Configuration configuration = new Configuration();

        Job job = new Job(configuration, "remove");

        job.setJarByClass(Remove.class);

        job.setMapperClass(Map.class);

        job.setReducerClass(Reduce.class);

        job.setOutputKeyClass(Text.class);

        job.setOutputValueClass(Text.class);

        FileInputFormat.addInputPath(job, new Path(

                "/user/hadoop_admin/removein"));

        FileOutputFormat.setOutputPath(job, new Path(

                "/user/hadoop_admin/removeout"));

        System.exit((job.waitForCompletion(true) ? 0 : 1));

    }

}

　　测试用例

　　file01

wangkun

wangkun

wangkun

amei

amei

　　file02

wangkun

wangkun

wangkun

amei

amei

　去重结果：

amei

amei

wangkun

wangkun

wangkun

wangkun

wangkun

MapReduce应用案例--简单的数据去重的更多相关文章

MapReduce应用案例--简单排序
1. 设计思路在MapReduce过程中自带有排序,可以使用这个默认的排序达到我们的目的. MapReduce 是按照key值进行排序的,我们在Map过程中将读入的数据转化成IntWritable类 ...
MapReduce编程系列 — 3：数据去重
1.项目名称: 2.程序代码: package com.dedup; import java.io.IOException; import org.apache.hadoop.conf.Configu ...
[Hadoop]-从数据去重认识MapReduce
这学期刚好开了一门大数据的课,就是完完全全简简单单的介绍的那种,然后就接触到这里面最被人熟知的Hadoop了.看了官网的教程[吐槽一下,果然英语还是很重要!],嗯啊,一知半解地搭建了本地和伪分布式的, ...
MapReduce实例(数据去重)
数据去重: 原理(理解):Mapreduce程序首先应该确认<k3,v3>,根据<k3,v3>确定<k2,v2>,原始数据中出现次数超过一次的数据在输出文件中只出现 ...
利用MapReduce实现数据去重
数据去重主要是为了利用并行化的思想对数据进行有意义的筛选. 统计大数据集上的数据种类个数.从网站日志中计算访问地等这些看似庞杂的任务都会涉及数据去重. 示例文件内容: 此处应有示例文件设计思路数据 ...
hadoop mapreduce实现数据去重
实现原理分析: map函数数将输入的文本按照行读取, 并将Key--每一行的内容输出 value--空. reduce 会自动统计所有的key,我们让reduce输出key-> ...
hadoop —— MapReduce例子（数据去重）
参考:http://eric-gcm.iteye.com/blog/1807468 例子1: 概要:数据去重描述:将file1.txt.file2.txt中的数据合并到一个文件中的同时去掉重复的内容 ...
js 对只包含简单类型数据的对象为元素组成的数组进行去重
/** * 对于由简单类型数据组成的对象为元素组成的数组进行去重操作 * @params {Array} 需要去重的对象数组 * @returns {Array} 去重后的对象数组 */ functi ...
大数据笔记（十）——Shuffle与MapReduce编程案例（A）
一.什么是Shuffle yarn-site.xml文件配置的时候有这个参数:yarn.nodemanage.aux-services:mapreduce_shuffle 因为mapreduce程序运 ...

随机推荐

Spring面向切面编程(AOP)方式二
使用注解进行实现:减少xml文件的配置. 1 建立切面类不需要实现任何特定接口,按照需要自己定义通知. package org.guangsoft.utils; import java.util.D ...
解决svn迁移过程中出现：SVN Error: is not the same repository as的问题
一.背景由于公司业务的需要,新购买了一批机器,那么面临着的就是svn等一系列东西进行迁移的问题,在svn迁移以后,本地的svn代码在切换时出现了SVN Error: 旧服务器地址 is not th ...
eclipse svn设置忽略文件
Javascript 封装方法
基本封装方法请看下面的例子: var Person = function(name,age){ this.name = name; this.age = age || "未填写" ...
分布式缓存系统Memcached简介与实践
缘起: 在数据驱动的web开发中,经常要重复从数据库中取出相同的数据,这种重复极大的增加了数据库负载.缓存是解决这个问题的好办法.但是ASP.NET中的虽然已经可以实现对页面局部进行缓存,但还是不够灵 ...
项目配置laungchImage
linux eclipse3.6.1 maven安装
linux maven安装及 eclipse maven插件安装,有需要的朋友可以参考下. 1. maven的安装(apache-maven-3.0.5为例): a.官网地址:http://mave ...
route 一个很奇怪的现象：我的主机能ping通同一网段的其它主机，并也能xshell 远程其它的主机，而其它的主机不能ping通我的ip,也不能远程我和主机
一个很奇怪的现象:我的主机能ping通同一网段的其它主机,并也能xshell 远程其它的主机,而其它的主机不能ping通我的ip,也不能远程我和主机. [root@NB Desktop]# route ...
[Nodejs]十分钟快速编写简单静态文件服务器
学了几天Nodejs 后我又干上了前端的活.这次遇到的问题是,我想在不同的设备上方便的查看我编写的网页,很自然的就想到要是能在本地搭建一个简单的http服务器的话,那局域网内的所有设备都可以访问了,这 ...
算法系列：XXX
转载自http://www.cnblogs.com/skynet/p/3372855.html 这次分享的宗旨是——让大家学会创建与使用静态库.动态库,知道静态库与动态库的区别,知道使用的时候如何选择 ...

MapReduce应用案例--简单的数据去重

MapReduce应用案例--简单的数据去重的更多相关文章

随机推荐

热门专题