【大数据系列】MapReduce示例好友推荐

package org.slp;

import org.apache.hadoop.io.LongWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Mapper;

import java.io.IOException;

import java.util.StringTokenizer;

/**

 * Created by sanglp on 2017/7/17.

 */

public class Test2Mapper extends Mapper<LongWritable ,Text,Text,Text> {

    @Override

    protected void map(LongWritable key, Text value, Context context) throws IOException, InterruptedException {

        //super.map(key, value, context);

        String line = value.toString();//一行数据代表一组好友关系

        String[] ss = line.split("\t");

        context.write(new Text(ss[0]),new Text(ss[1]));//主从分成两行输出

        context.write(new Text(ss[1]),new Text(ss[0]));

    }

}

package org.slp;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Reducer;

import java.io.IOException;

import java.util.HashSet;

import java.util.Iterator;

import java.util.Set;

/**

 * Created by sanglp on 2017/7/17.

 */

public class Test2Reduce extends Reducer<Text,Text,Text,Text> {

    @Override

    protected void reduce(Text key, Iterable<Text> values, Context context) throws IOException, InterruptedException {

        //super.reduce(key, values, context);

        Set<String> set = new HashSet<String>();

        for(Text t :values ){

            set.add(t.toString());

        }

        if (set.size()>1){

            for(Iterator j = set.iterator();j.hasNext();){

                String name = (String)j.next();

                for(Iterator k = set.iterator();k.hasNext();){

                    String other = (String)k.next();

                    if(!name.equals(other)){

                        context.write(new Text(name),new Text(other));

                    }

                }

            }

        }

    }

}

package org.slp;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.IntWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Job;

import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;

import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

import java.io.IOException;

/**

 * Created by sanglp on 2017/7/17.

 */

public class JobRun2 {

    public static void main(String[] args){

        Configuration conf = new Configuration();

        conf.set("mapred.job.tracker","node1:9001");

        conf.set("mapred.job.tracker","node1:9001");

        conf.set("mapred.jar","C:\\Users\\sanglp\\qq.jar");

        try {

            Job job = new Job(conf);

            job.setJobName("qq");

            job.setJarByClass(JobRun2.class);

            job.setMapperClass(Test2Mapper.class);

            job.setReducerClass(Test2Reduce.class);

            job.setMapOutputKeyClass(Text.class);

            job.setMapOutputValueClass(Text.class);

            job.setNumReduceTasks(1);//设置reduce任务的个数

            //mapreduce输入数据所在目录或文件

            FileInputFormat.addInputPath(job,new Path("/usr/input/qq"));

            //mr执行之后的输出数据的目录

            FileOutputFormat.setOutputPath(job,new Path("/usr/out/qq"));

            try {

                System.exit(job.waitForCompletion(true)?0:1);

            } catch (InterruptedException e) {

                e.printStackTrace();

            } catch (ClassNotFoundException e) {

                e.printStackTrace();

            }

        } catch (IOException e) {

            e.printStackTrace();

        }

    }

}

文件内容例如：

小明小李

小花小白

【大数据系列】MapReduce示例好友推荐的更多相关文章

大数据学习——mapreduce共同好友
数据 commonfriends.txt A:B,C,D,F,E,O B:A,C,E,K C:F,A,D,I D:A,E,F,L E:B,C,D,M,L F:A,B,C,D,E,O,M G:A,C,D ...
大数据系列之分布式计算批处理引擎MapReduce实践-排序
清明刚过,该来学习点新的知识点了. 上次说到关于MapReduce对于文本中词频的统计使用WordCount.如果还有同学不熟悉的可以参考博文大数据系列之分布式计算批处理引擎MapReduce实践. ...
大数据系列4：Yarn以及MapReduce 2
系列文章: 大数据系列:一文初识Hdfs 大数据系列2:Hdfs的读写操作大数据谢列3:Hdfs的HA实现通过前文,我们对Hdfs的已经有了一定的了解,本文将继续之前的内容,介绍Yarn与Yarn ...
大数据系列之分布式计算批处理引擎MapReduce实践
关于MR的工作原理不做过多叙述,本文将对MapReduce的实例WordCount(单词计数程序)做实践,从而理解MapReduce的工作机制. WordCount: 1.应用场景,在大量文件中存储了 ...
大数据系列之并行计算引擎Spark介绍
相关博文:大数据系列之并行计算引擎Spark部署及应用 Spark: Apache Spark 是专为大规模数据处理而设计的快速通用的计算引擎. Spark是UC Berkeley AMP lab ( ...
大数据系列（2）——Hadoop集群坏境CentOS安装
前言前面我们主要分析了搭建Hadoop集群所需要准备的内容和一些提前规划好的项,本篇我们主要来分析如何安装CentOS操作系统,以及一些基础的设置,闲言少叙,我们进入本篇的正题. 技术准备 VMwa ...
大数据系列之数据仓库Hive命令使用及JDBC连接
Hive系列博文,持续更新~~~ 大数据系列之数据仓库Hive原理大数据系列之数据仓库Hive安装大数据系列之数据仓库Hive中分区Partition如何使用大数据系列之数据仓库Hive命令使用 ...
大数据系列（5）——Hadoop集群MYSQL的安装
前言有一段时间没写文章了,最近事情挺多的,现在咱们回归正题,经过前面四篇文章的介绍,已经通过VMware安装了Hadoop的集群环境,相关的两款软件VSFTP和SecureCRT也已经正常安装了. ...
大数据系列（4）——Hadoop集群VSFTP和SecureCRT安装配置
前言经过前三篇文章的介绍,已经通过VMware安装了Hadoop的集群环境,当然,我相信安装的过程肯定遇到或多或少的问题,这些都需要自己解决,解决的过程就是学习的过程,本篇的来介绍几个Hadoop环 ...

随机推荐

FunGene 功能基因数据库
背景:16SrRNA 基因通常作为分子标记进行微生物群落结构的研究,但是它有一些明显的限制,比如16S rRNA基因在物种中会有多个拷贝,而且,由于16S rRNA基因的进化速率较慢,在物种间保守,会 ...
Linux 下 Nginx + JDK + Tomcat + MySQL 安装指南
转载请注明出处:http://blog.csdn.net/smartbetter/article/details/52026342 Nginx 是一款高性能的 http 服务器/反向代理服务器/电子邮 ...
Vue文件跳转$router传参数
<button @click = "func()">跳转</button> //js <script> export default{ meth ...
PHP文本操作
1. 用PHP获取文件指定行或者随机行 <?php /*** * 功能: 随机获取一个文件里的某一行 * 实现: 先将文件读进一个数组: 随机获取0~数组长度-1之间的一个随机数:以这个随机数做 ...
站长常用的200个js代码站长常用js代码大全站长常用js代码集合
站长常用的200个js代码 1.文本框焦点问题 onBlur:当失去输入焦点后产生该事件 onFocus:当输入获得焦点后,产生该文件 Onchange:当文字值改变时,产生该事件 Onselect: ...
Centos7以上的版本 mysql 无法启动，无法停止问题
service mysqld start 始终提示如下: Failed to issue method call: Unit mysqld.service failed to load: No suc ...
linux环境变量的概述
https://blog.csdn.net/u010533843/article/details/54986646 https://www.linuxidc.com/Linux/2017-08/146 ...
登陆时验证码的制作（asp.net）
登陆时验证码的制作(asp.net) 1.显示样式: 2.新建一个页,Default2.aspx 3.在Page_load事件拷入如下代码 stringtmp = RndNum(4); HttpCoo ...
AngularJS------命令行
如下:(‘$’符号不需要输入哦) $ ng build --发布项目
【PHP】phpstudy vhosts.conf 配置
#Listen 876 <VirtualHost *:876> ServerName localhost DocumentRoot "D:\phpStudy\PHPTutoria ...

【大数据系列】MapReduce示例好友推荐

【大数据系列】MapReduce示例好友推荐的更多相关文章

随机推荐

热门专题