Hbase调用JavaAPI实现批量导入操作
将手机上网日志文件批量导入到Hbase中。操作步骤:
1、将日志文件(请下载附件)上传到HDFS中,利用hadoop的操作命令上传:hadoop fs -put input /

2、创建Hbase表,通过Java操作
- package com.jiewen.hbase;
- import java.io.IOException;
- import org.apache.hadoop.conf.Configuration;
- import org.apache.hadoop.hbase.HBaseConfiguration;
- import org.apache.hadoop.hbase.HColumnDescriptor;
- import org.apache.hadoop.hbase.HTableDescriptor;
- import org.apache.hadoop.hbase.client.Get;
- import org.apache.hadoop.hbase.client.HBaseAdmin;
- import org.apache.hadoop.hbase.client.HTable;
- import org.apache.hadoop.hbase.client.Put;
- import org.apache.hadoop.hbase.client.Result;
- import org.apache.hadoop.hbase.client.ResultScanner;
- import org.apache.hadoop.hbase.client.Scan;
- import org.apache.hadoop.hbase.util.Bytes;
- public class HbaseDemo {
- public static void main(String[] args) throws IOException {
- String tableName = "wlan_log";
- String columnFamily = "cf";
- HbaseDemo.create(tableName, columnFamily);
- // HbaseDemo.put(tableName, "row1", columnFamily, "cl1", "data");
- // HbaseDemo.get(tableName, "row1");
- // HbaseDemo.scan(tableName);
- // HbaseDemo.delete(tableName);
- }
- // hbase操作必备
- private static Configuration getConfiguration() {
- Configuration conf = HBaseConfiguration.create();
- conf.set("hbase.rootdir", "hdfs://hadoop1:9000/hbase");
- // 使用eclipse时必须加入这个,否则无法定位
- conf.set("hbase.zookeeper.quorum", "hadoop1");
- return conf;
- }
- // 创建一张表
- public static void create(String tableName, String columnFamily)
- throws IOException {
- HBaseAdmin admin = new HBaseAdmin(getConfiguration());
- if (admin.tableExists(tableName)) {
- System.out.println("table exists!");
- } else {
- HTableDescriptor tableDesc = new HTableDescriptor(tableName);
- tableDesc.addFamily(new HColumnDescriptor(columnFamily));
- admin.createTable(tableDesc);
- System.out.println("create table success!");
- }
- }
- // 加入一条记录
- public static void put(String tableName, String row, String columnFamily,
- String column, String data) throws IOException {
- HTable table = new HTable(getConfiguration(), tableName);
- Put p1 = new Put(Bytes.toBytes(row));
- p1.add(Bytes.toBytes(columnFamily), Bytes.toBytes(column), Bytes
- .toBytes(data));
- table.put(p1);
- System.out.println("put'" + row + "'," + columnFamily + ":" + column
- + "','" + data + "'");
- }
- // 读取一条记录
- public static void get(String tableName, String row) throws IOException {
- HTable table = new HTable(getConfiguration(), tableName);
- Get get = new Get(Bytes.toBytes(row));
- Result result = table.get(get);
- System.out.println("Get: " + result);
- }
- // 显示全部数据
- public static void scan(String tableName) throws IOException {
- HTable table = new HTable(getConfiguration(), tableName);
- Scan scan = new Scan();
- ResultScanner scanner = table.getScanner(scan);
- for (Result result : scanner) {
- System.out.println("Scan: " + result);
- }
- }
- // 删除表
- public static void delete(String tableName) throws IOException {
- HBaseAdmin admin = new HBaseAdmin(getConfiguration());
- if (admin.tableExists(tableName)) {
- try {
- admin.disableTable(tableName);
- admin.deleteTable(tableName);
- } catch (IOException e) {
- e.printStackTrace();
- System.out.println("Delete " + tableName + " 失败");
- }
- }
- System.out.println("Delete " + tableName + " 成功");
- }
- }
3、将日志文件导入Hbase表wlan_log中:
- import java.text.SimpleDateFormat;
- import java.util.Date;
- import org.apache.hadoop.conf.Configuration;
- import org.apache.hadoop.hbase.client.Put;
- import org.apache.hadoop.hbase.mapreduce.TableOutputFormat;
- import org.apache.hadoop.hbase.mapreduce.TableReducer;
- import org.apache.hadoop.hbase.util.Bytes;
- import org.apache.hadoop.io.LongWritable;
- import org.apache.hadoop.io.NullWritable;
- import org.apache.hadoop.io.Text;
- import org.apache.hadoop.mapreduce.Counter;
- import org.apache.hadoop.mapreduce.Job;
- import org.apache.hadoop.mapreduce.Mapper;
- import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
- import org.apache.hadoop.mapreduce.lib.input.TextInputFormat;
- public class HbaseBatchImport {
- public static void main(String[] args) throws Exception {
- final Configuration configuration = new Configuration();
- // 设置zookeeper
- configuration.set("hbase.zookeeper.quorum", "hadoop1");
- // 设置hbase表名称
- configuration.set(TableOutputFormat.OUTPUT_TABLE, "wlan_log");
- // 将该值改大,防止hbase超时退出
- configuration.set("dfs.socket.timeout", "180000");
- final Job job = new Job(configuration, "HBaseBatchImport");
- job.setMapperClass(BatchImportMapper.class);
- job.setReducerClass(BatchImportReducer.class);
- // 设置map的输出,不设置reduce的输出类型
- job.setMapOutputKeyClass(LongWritable.class);
- job.setMapOutputValueClass(Text.class);
- job.setInputFormatClass(TextInputFormat.class);
- // 不再设置输出路径。而是设置输出格式类型
- job.setOutputFormatClass(TableOutputFormat.class);
- FileInputFormat.setInputPaths(job, "hdfs://hadoop1:9000/input");
- job.waitForCompletion(true);
- }
- static class BatchImportMapper extends
- Mapper<LongWritable, Text, LongWritable, Text> {
- SimpleDateFormat dateformat1 = new SimpleDateFormat("yyyyMMddHHmmss");
- Text v2 = new Text();
- protected void map(LongWritable key, Text value, Context context)
- throws java.io.IOException, InterruptedException {
- final String[] splited = value.toString().split("\t");
- try {
- final Date date = new Date(Long.parseLong(splited[0].trim()));
- final String dateFormat = dateformat1.format(date);
- String rowKey = splited[1] + ":" + dateFormat;
- v2.set(rowKey + "\t" + value.toString());
- context.write(key, v2);
- } catch (NumberFormatException e) {
- final Counter counter = context.getCounter("BatchImport",
- "ErrorFormat");
- counter.increment(1L);
- System.out.println("出错了" + splited[0] + " " + e.getMessage());
- }
- };
- }
- static class BatchImportReducer extends
- TableReducer<LongWritable, Text, NullWritable> {
- protected void reduce(LongWritable key,
- java.lang.Iterable<Text> values, Context context)
- throws java.io.IOException, InterruptedException {
- for (Text text : values) {
- final String[] splited = text.toString().split("\t");
- final Put put = new Put(Bytes.toBytes(splited[0]));
- put.add(Bytes.toBytes("cf"), Bytes.toBytes("date"), Bytes
- .toBytes(splited[1]));
- // 省略其它字段,调用put.add(....)就可以
- context.write(NullWritable.get(), put);
- }
- };
- }
- }
4、查看导入结果:

Hbase调用JavaAPI实现批量导入操作的更多相关文章
- 批量导入数据到HBase
hbase一般用于大数据的批量分析,所以在很多情况下需要将大量数据从外部导入到hbase中,hbase提供了一种导入数据的方式,主要用于批量导入大量数据,即importtsv工具,用法如下: Us ...
- 吴裕雄--天生自然HADOOP操作实验学习笔记:hbase的javaAPI应用
实验目的 进一步了解hbase的操作 熟悉使用IDEA进行java开发 熟悉hbase的javaAPI 实验原理 前面已经了解通过hbase的shell操作hbase,确实比较难以使用,另外通过hiv ...
- python操作数据库之批量导入
python操作数据库之批量导入 Python语法简洁清晰,特色之一是强制用空白符(white space)作为语句缩进. Python具有丰富和强大的库.它常被昵称为胶水语言,能够把用其他语言制作的 ...
- HBase结合MapReduce批量导入(HDFS中的数据导入到HBase)
HBase结合MapReduce批量导入 package hbase; import java.text.SimpleDateFormat; import java.util.Date; import ...
- Hbase笔记:批量导入
工作中可能会有对HBase的复杂操作,我们现在对HBase的操作太简单了.复杂操作一般用HBaseScan操作,还有用框架对HBase进行复杂操作,iparler,sharker.我们说HBase是数 ...
- ADO.NET 对数据操作 以及如何通过C# 事务批量导入数据
ADO.NET 对数据操作 以及如何通过C# 事务批量导入数据 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 ...
- Hadoop之——HBASE结合MapReduce批量导入数据
转载请注明出处:http://blog.csdn.net/l1028386804/article/details/46463889 废话不多说.直接上代码,你懂得 package hbase; imp ...
- Spark:DataFrame批量导入Hbase的两种方式(HFile、Hive)
Spark处理后的结果数据resultDataFrame可以有多种存储介质,比较常见是存储为文件.关系型数据库,非关系行数据库. 各种方式有各自的特点,对于海量数据而言,如果想要达到实时查询的目的,使 ...
- 数据批量导入HBase
测试数据: datas 1001 lilei 17 13800001111 1002 lily 16 13800001112 1003 lucy 16 13800001113 1004 meimei ...
随机推荐
- datetime模块,random模块
6.10自我总结 1.datetime模块(用于修改日期) import datetime print(datetime.datetime.now(),type(datetime.datetime.n ...
- MySQL 之视图、 触发器、事务、存储过程、内置函数、流程控制、索引
本文内容: 视图 触发器 事务 存储过程 内置函数 流程控制 索引 ------------------------------------------------------------------ ...
- C语言文件操作 FILE结构体
内存中的数据都是暂时的,当程序结束时,它们都将丢失.为了永久性的保存大量的数据,C语言提供了对文件的操作. 1.文件和流 C将每个文件简单地作为顺序字节流(如下图).每个文件用文件结束符结束,或者在特 ...
- python中set()函数的用法
set顾名思义是集合,里面不能包含重复的元素,接收一个list作为参数 list1=[1,2,3,4] s=set(list1) print(s) #逐个遍历 for i in s: print(i) ...
- CentOS 7.0:搭建SVN服务器
1. 通过 yum install subversion来安装 2. 提示已经安装.查看svn版本 第二步: 创建svn版本库 第三步: 配置svn信息 2. 配置权限配置文件authz 3. 配置用 ...
- hadoop学习爬坑记录
1. Q: hdfs管理界面50070端口设置后,无法访问情况. A: 1)停止当前所有服务./stop-all.sh 2)在hdfs-site.xml中,更改开放端口的绑定IP: <prope ...
- 关于requirejs和grunt压缩合并是否矛盾
requirejs主要是为了模块化开发,这样带来的好处不言而喻.但是分成多个js文件增加了请求数,那么就要用到合并压缩.合并压缩了原来的许多独立的js模块,那requirejs又是怎么冲压缩的文件中找 ...
- CentOS6.5的安装及忘记root密码的措施
CentOS6.5的安装及忘记root密码的措施 VMware虚拟机的配置 1.文件->新建->自定义->下一步 2.选择稍后安装操作系统 我们将采用自定义安装,杜绝VMware的一 ...
- HDU 3271 SNIBB
SNIBB Time Limit: 1000ms Memory Limit: 32768KB This problem will be judged on HDU. Original ID: 3271 ...
- 分析Tapjoy的模式—分发用于ios设备的企业级应用程序
下面简单介绍下Tapjoy的模式,供大家参考: Tapjoy最初的合作模式:“按安装奖励”(pay-per-install) Tapjoy利用非常成功的奖励性下载模式影响了App Store的免费游戏 ...