hbase的wordcount

package com.neworigin.HBaseMR;

import java.io.IOException;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.hbase.Cell;

import org.apache.hadoop.hbase.CellUtil;

import org.apache.hadoop.hbase.HBaseConfiguration;

import org.apache.hadoop.hbase.client.Mutation;

import org.apache.hadoop.hbase.client.Put;

import org.apache.hadoop.hbase.client.Result;

import org.apache.hadoop.hbase.client.Scan;

import org.apache.hadoop.hbase.io.ImmutableBytesWritable;

import org.apache.hadoop.hbase.mapreduce.TableMapReduceUtil;

import org.apache.hadoop.hbase.mapreduce.TableMapper;

import org.apache.hadoop.hbase.mapreduce.TableReducer;

import org.apache.hadoop.hbase.util.Bytes;

import org.apache.hadoop.io.IntWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Job;

import org.apache.hadoop.mapreduce.Mapper;

import org.apache.hadoop.mapreduce.Reducer;

public class HbaseMRTest {

    static Configuration conf=null;

    static{

//        配置configuration的三种方法

//        ①直接将hbase-site.xml拿来放到src下面

        conf=HBaseConfiguration.create();

//        ②设置服务器和端口

//        conf.set("hbase.zookeeper.quorum", "s100:2181,s101:2181,s102:2181");

//        ③扥开设置服务器和端口

        conf.set("hbase.zookeeper.quorum", "s100,s101,s102");

        conf.set("hbase.zookeeper.property.clientPort", "2181");

    }

////    表信息

//    public static final String tablename="wordtest";//表一

//    public static final String colf="content";//表列族

//    public static final String col="info";//列

//

//    public static final String tablename2="stat";//表二

//

//public static void initTB(){

//

//}

public static class HBmapper extends TableMapper<Text,IntWritable>/*输出类型*/{

    private static IntWritable one=new IntWritable(1);

    private static Text word =new Text();

//    输入类型，key：row key  value：一行数据的结果集 result

    protected void map(ImmutableBytesWritable key, Result value,

            Mapper<ImmutableBytesWritable, Result, Text, IntWritable>.Context context)

            throws IOException, InterruptedException {

        for(Cell cell:value.rawCells())

        {

            word.set(CellUtil.cloneValue(cell));//读取值

            context.write(word, one);//输出：单词----1

        }

    }

}

public static class HBreducer extends TableReducer<Text,IntWritable,ImmutableBytesWritable>{

    @Override

    protected void reduce(Text key, Iterable<IntWritable> values,

            Reducer<Text, IntWritable, ImmutableBytesWritable, Mutation>.Context context)

            throws IOException, InterruptedException {

        int sum=0;

        //叠加单词个数

        for(IntWritable value:values)

        {

            sum+=value.get();

        }

        Put put = new Put(Bytes.toBytes(key.toString()));//设置row key为单词

        put.add(Bytes.toBytes("content"), Bytes.toBytes("info"), Bytes.toBytes(String.valueOf(sum)));

        //写到hbase中的需要指定rowkey和put

        context.write(new ImmutableBytesWritable(Bytes.toBytes(key.toString())), put);

    }

}

public static void main(String[] args) throws IOException, ClassNotFoundException, InterruptedException {

    Job job=new Job(conf,"HBaseMR");

    Scan scan =new Scan();

    TableMapReduceUtil.initTableMapperJob("wordtest",scan, HBmapper.class, Text.class, IntWritable.class, job);

    TableMapReduceUtil.initTableReducerJob("stat", HBreducer.class, job);

    job.waitForCompletion(true);

    System.out.println("finished");

}

}

hbase的wordcount的更多相关文章

Storm 学习之路（八）—— Storm集成HDFS和HBase
一.Storm集成HDFS 1.1 项目结构本用例源码下载地址:storm-hdfs-integration 1.2 项目主要依赖项目主要依赖如下,有两个地方需要注意: 这里由于我服务器上安装的是 ...
Storm 系列（八）—— Storm 集成 HDFS 和 HBase
一.Storm集成HDFS 1.1 项目结构本用例源码下载地址:storm-hdfs-integration 1.2 项目主要依赖项目主要依赖如下,有两个地方需要注意: 这里由于我服务器上安装的是 ...
spark ---词频统计(二)
利用python来操作spark的词频统计,现将过程分享如下: 1.新建项目:(这里是在已有的项目中创建的,可单独创建wordcount项目) ①新建txt文件: wordcount.txt (文件内 ...
hbase和mapreduce开发 WordCount
代码: /** * hello world by world 测试数据 * @author a * */ public class DefinedMapper extends Mapper<Lo ...
大数据平台架构（flume＋kafka＋hbase＋ELK+storm+redis+mysql）
上次实现了flume+kafka+hbase+ELK:http://www.cnblogs.com/super-d2/p/5486739.html 这次我们可以加上storm: storm-0.9.5 ...
MapReduce剖析笔记之一：从WordCount理解MapReduce的几个阶段
WordCount是一个入门的MapReduce程序(从src\examples\org\apache\hadoop\examples粘贴过来的): package org.apache.hadoop ...
【hbase】——HBase 写优化之 BulkLoad 实现数据快速入库
1.为何要 BulkLoad 导入?传统的 HTableOutputFormat 写 HBase 有什么问题? 我们先看下 HBase 的写流程: 通常 MapReduce 在写HBase时使用的是 ...
WordCount示例深度学习MapReduce过程（1）
我们都安装完Hadoop之后,按照一些案例先要跑一个WourdCount程序,来测试Hadoop安装是否成功.在终端中用命令创建一个文件夹,简单的向两个文件中各写入一段话,然后运行Hadoop,Wou ...
JStorm第一个程序WordCount详解
一.Strom基本知识(回顾) 1,首先明确Storm各个组件的作用,包括Nimbus,Supervisor,Spout,Bolt,Task,Worker,Tuple nimbus是整个storm任务 ...

随机推荐

p4168 [Violet]蒲公英（分块）
区间众数的重题和数列分块入门9双倍经验还是挺好的然后开O2水过好像有不带log的写法啊之后在补就是咕咕咕 // luogu-judger-enable-o2 #include <cstd ...
利用Python 脚本生成 .h5 文件代码
利用Python 脚本生成 .h5 文件 import os, json, argparse from threading import Thread from Queue import Queue ...
[转载]undefined reference to `memcpy@GLIBC_2.14'
转自:http://blog.sina.com.cn/s/blog_6c5a47d30102wfw9.html undefined reference to `memcpy@GLIBC_2.14' ( ...
POJ 2718 Smallest Difference（最小差）
Smallest Difference(最小差) Time Limit: 1000MS Memory Limit: 65536K Description - 题目描述 Given a numb ...
Codeforces Round #107 (Div. 1) B. Quantity of Strings（推算）
http://codeforces.com/problemset/problem/150/B 题意: 给出n,m,k,n表示字符串的长度为n,m表示字符种类个数,k表示每k个数都必须是回文串,求满足要 ...
线性判别分析（Linear Discriminant Analysis-LDA）
Linear Discriminant Analysis(LDA线性判别分析) 用途:数据预处理中的降维,分类任务目标:LDA关心的是能够最大化类间区分度的坐标轴成分,将特征空间(数据集中的多维样本 ...
snakemake使用笔记
snakemake是一个用来编写任务流程的工具,用python编写的,因此其执行的流程脚本也比较通俗易懂,易于理解. 一.从一个简单的例子开始 1.安装snakemake 安装snakemake的方法 ...
当面试官问你GET和POST区别的时候,请这么回答.......
文章内容转载于微信公众号WebTechGarden 一.GET和POST的'普通'区别 GET和POST是HTTP请求的两种基本方法,要说它们的区别,接触过WEB开发的人都能说出一二. 最直观的区别就 ...
理解 Redis(6) - List 值
list 值就是一组根据插入顺序排列的字符串, 从左向右排列, 左边为头(head), 右侧为尾(tail). 左边为顶部, 右边为底部. 下图为 list 值的示意图: 从左侧开始向键为 num 的 ...
OpenModelica Debug
assertion只触发一次 The gdb process has not responded to a command within 40 second(s).This could mean it ...

hbase的wordcount

hbase的wordcount的更多相关文章

随机推荐

热门专题