Hbase篇--Hbase和MapReduce结合Api

一.前述

Mapreduce可以自定义Inputforma对象和OutPutformat对象，所以原理上Mapreduce可以和任意输入源结合。

二.步骤

将结果写会到hbase中去。

2.1 Main函数

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.hbase.mapreduce.TableMapReduceUtil;

import org.apache.hadoop.io.IntWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Job;

import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;

/**

 * 分析hdfs 文本  统计单词数量

 * 结果输出到 hbase表

 * create 'wc','cf'

 * rowkey: 单词        cf:count=单词数量

 * @author root

 *

 */

public class WCDemo {

    /**

     *

     * wc

     * 数据hbase表    rowkey  cell存放文本

     * 结果输出到 hbase表

     *

     */

    public static void main(String[] args) throws Exception {

        Configuration conf = new Configuration();

        conf.set("fs.defaultFS", "hdfs://node1:8020");//设置hdfs集群nameservices名称

        conf.set("hbase.zookeeper.quorum", "node4");

        Job job = Job.getInstance(conf);

        job.setJarByClass(WCDemo.class);

        job.setMapperClass(WCMapper.class);

        job.setMapOutputKeyClass(Text.class);

        job.setMapOutputValueClass(IntWritable.class);

//        job.setReducerClass();

        //addDependencyJars  本地方式运行： 设置为false

//        TableMapReduceUtil.initTableReducerJob("wc", WCReducer.class, job);

        TableMapReduceUtil.initTableReducerJob("wc",WCReducer.class, job,

                null, null, null, null, false);

        Path path = new Path("/user/wc");

        FileInputFormat.addInputPath(job, path);

        boolean flag = job.waitForCompletion(true);

        if(flag) {

            System.out.println("success~~");

        }

    }

}

2.2 Mapper函数（和正常的Mapper没啥区别）

import java.io.IOException;

import org.apache.hadoop.io.IntWritable;

import org.apache.hadoop.io.LongWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Mapper;

public class WCMapper extends Mapper<LongWritable, Text, Text, IntWritable> {

    @Override

    protected void map(LongWritable key, Text value, Context context)

            throws IOException, InterruptedException {

        String[] words = value.toString().split(" ");

        for (String w : words) {

            context.write(new Text(w), new IntWritable(1));

        }

    }

}

2.3 Reduce函数（主要是把Put对象写出去）

import java.io.IOException;

import org.apache.hadoop.hbase.client.Put;

import org.apache.hadoop.hbase.io.ImmutableBytesWritable;

import org.apache.hadoop.hbase.mapreduce.TableReducer;

import org.apache.hadoop.io.IntWritable;

import org.apache.hadoop.io.Text;

public class WCReducer extends

        TableReducer<Text, IntWritable, ImmutableBytesWritable> {

    @Override

    protected void reduce(Text text, Iterable<IntWritable> iterable,

            Context context) throws IOException, InterruptedException {

        int sum = 0;

        for (IntWritable i : iterable) {

            sum += i.get();

        }

        Put put = new Put(text.toString().getBytes());

        put.add("cf".getBytes(), "count".getBytes(), (sum+"").getBytes());

        context.write(null, put);

    }

}

Hbase篇--Hbase和MapReduce结合Api的更多相关文章

HBase篇--HBase常用优化
一.前述 HBase优化能够让我们对调优有一定的理解,当然企业并不是所有的优化全都用,优化还要根据业务具体实施. 二.具体优化 1.表的设计 1.1 预分区默认情况下,在创建HBase表的时候会自 ...
HBase篇--HBase操作Api和Java操作Hbase相关Api
一.前述. Hbase shell启动命令窗口,然后再Hbase shell中对应的api命令如下. 二.说明 Hbase shell中删除键是空格+Ctrl键. 三.代码 1.封装所有的API pa ...
Hbase篇--HBase中一对多和多对多的表设计
一.前述今天分享一篇关于HBase的一对多和多对多的案例的分析. 二.具体案例案例一.多对多人员-角色人员有多个角色角色优先级角色有多个人员人员删除添加角色角 ...
Hbase理论&&hbase shell&&python操作hbase&&python通过mapreduce操作hbase
一.Hbase搭建: 二.理论知识介绍: 1Hbase介绍: Hbase是分布式.面向列的开源数据库(其实准确的说是面向列族).HDFS为Hbase提供可靠的底层数据存储服务,MapReduce为Hb ...
HBase、HDFS和MapReduce架构异同简解
HBase.HDFS和MapReduce架构异同 .. HBase(公司架构模型) HDFS2.0(公司架构模型) MR2.0(公司架构模型) MR1.0(公司架构模型) 中央 HMaster Nam ...
HBase操作（Shell与Java API）
版权声明:本文为博主原创文章,未经博主允许不得转载. 转: http://blog.csdn.net/u013980127/article/details/52443155 下面代码在Hado ...
Hbase总结（一）-hbase命令,hbase安装,与Hive的区别,与传统数据库的区别,Hbase数据模型
Hbase总结(一)-hbase命令下面我们看看HBase Shell的一些基本操作命令,我列出了几个常用的HBase Shell命令,如下: 名称命令表达式创建表 create '表名称', ...
Hbase系列-Hbase简介
自1970年以来,关系数据库用于数据存储和维护有关问题的解决方案.大数据的出现后,好多公司实现处理大数据并从中受益,并开始选择像 Hadoop 的解决方案.Hadoop使用分布式文件系统,用于存储大数 ...
大数据技术之_11_HBase学习_01_HBase 简介+HBase 安装+HBase Shell 操作+HBase 数据结构+HBase 原理
第1章 HBase 简介1.1 什么是 HBase1.2 HBase 特点1.3 HBase 架构1.3 HBase 中的角色1.3.1 HMaster1.3.2 RegionServer1.3.3 ...

随机推荐

python正则表达式判断素数【厉害了】
参考: https://www.cnblogs.com/imjustice/p/check_prime_by_using_regular_expression.html for i in range( ...
Python实现RSA无填充加密，兼容BouncyCastle
场景某系统登录时密码经过前台rsa加密传给后端,为实现模拟登录需要原样生成加密串. 分析前台通过RSA.js.BigInt.js.Barrett.js三个js文件实现加密,公钥通过ajax请求获得 ...
微软开源大规模数据处理项目 Data Accelerator
微软开源了一个原为内部使用的大规模数据处理项目 Data Accelerator.自 2017 年开发以来,该项目已经大规模应用在各种微软产品工作管道上. 据微软官方开源博客介绍,Data Accel ...
学习随笔:Vue.js与Django交互以及Ajax和axios
1. Vue.js地址 Staticfile CDN(国内): https://cdn.staticfile.org/vue/2.2.2/vue.min.js unpkg:会保持和npm发布的最新的版 ...
【转发】如何使用NPM？CNPM又是什么？
转发:https://www.jianshu.com/p/f581cf9360a2 背景介绍什么是npm? npm(node package manager)是nodejs的包管理器,用于node插 ...
sql基本语法
sql基本语法 sql server 查询多表查询直接多表查询 select * from st_profiles,st_score_report 上面的语句将会产生两个表的笛卡尔乘积,其中大部分 ...
python爬虫实践（二）——爬取张艺谋导演的电影《影》的豆瓣影评并进行简单分析
学了爬虫之后,都只是爬取一些简单的小页面,觉得没意思,所以我现在准备爬取一下豆瓣上张艺谋导演的“影”的短评,存入数据库,并进行简单的分析和数据可视化,因为用到的只是比较多,所以写一篇博客当做笔记. 第 ...
.Net Core 部署 CentOs7+Nginx
先爆图由于是初学者,部署出来这个界面也不容易,此前第一步弄了个这个出来动态的没问题,然后静态资源死活就是不出来,弄了两个小时没有结果,带着遗憾睡了个觉试验1: server { listen ; ...
VUE-利用OSS BrowserJS-SDK实现阿里OSS前端上传
项目中遇到利用阿里OSS上传文件,线上很多示例用到了各种SDK,却没有看到OSS BrowserJS-SDK相关示例,鉴于脑子不好使,记一下. 封装upload相关组件使用npm安装SDK的开发 ...
Java当中的IO二
1.大文件的读写方法由于文件很大,我们不能一下子把文件内的所有内容都读取出来,所以只能一段一段的读取注意:在关闭read()和write()的时候可能会产生IOException,需要对其进行处理 ...

Hbase篇--Hbase和MapReduce结合Api

Hbase篇--Hbase和MapReduce结合Api的更多相关文章

随机推荐

热门专题