【原创】MapReduce备份Elasticsearch数据到HDFS(JAVA)

一、环境：JAVA8，Elasticsearch-5.6.2，Hadoop-2.8.1
二、实现功能：mapreduce读elasticsearch数据、输出parquet文件、多输出路径
三、主要依赖

<dependency>

    <groupId>org.elasticsearch.client</groupId>

    <artifactId>transport</artifactId>

    <version></version>

</dependency>

<dependency>

    <groupId>org.apache.logging.log4j</groupId>

    <artifactId>log4j-to-slf4j</artifactId>

    <version></version>

</dependency>

<dependency>

    <groupId>ch.qos.logback</groupId>

    <artifactId>logback-classic</artifactId>

    <version></version>

</dependency>

<dependency>

    <groupId>org.apache.hadoop</groupId>

    <artifactId>hadoop-client</artifactId>

    <version></version>

</dependency>

<dependency>

    <groupId>org.apache.parquet</groupId>

    <artifactId>parquet-avro</artifactId>

    <version></version>

</dependency>

<dependency>

    <groupId>org.elasticsearch</groupId>

    <artifactId>elasticsearch-hadoop-mr</artifactId>

    <version></version>

</dependency>

<dependency>

    <groupId>org.apache.avro</groupId>

    <artifactId>avro-mapred</artifactId>

    <version></version>

</dependency>

四、主要代码
1.public class Job extends Configured implements Tool

 Configuration conf = getConf();

 conf.set(ConfigurationOptions.ES_NODES,"127.0.0.1");

 conf.set(ConfigurationOptions.ES_PORT,"9200");

 conf.set(ConfigurationOptions.ES_RESOURCE, "index/type");

 conf.set(ConfigurationOptions.ES_QUERY, "?q=*");

 Job job = Job.getInstance(conf);

 // ...（其他不重要的设置）

 // set input

 job.setInputFormatClass(EsInputFormat.class);

 // set output

 job.setOutputFormatClass(AvroParquetOutputFormat.class);

 AvroParquetOutputFormat.setOutputPath(job, ${outputDir});

 AvroParquetOutputFormat.setSchema(job, ${schema});

 AvroParquetOutputFormat.setCompression(job, CompressionCodecName.SNAPPY);

 AvroParquetOutputFormat.setCompressOutput(job, true);

 AvroParquetOutputFormat.setBlockSize(job, ${size});

 for(String name: ${list}){

 　　MultipleOutputs.addNamedOutput(job, name, AvroParquetOutputFormat.class, Void.class, GenericRecord.class);

 }

2.public class Mapper extends Mapper<Text, MapWritable, ${KeyType}, ${ValueType}>

// 代码一般，略

3.public class Reducer extends Reducer<${KeyType}, ${ValueType}, Void, GenericRecord>

 private MultipleOutputs<Void, GenericRecord> multipleOutputs;

 @Override

 protected void setup(Context context) throws IOException, InterruptedException {

     multipleOutputs = new MultipleOutputs<>(context);

 }

 @Override

 public void reduce(${KeyType} key, Iterable<${ValueType}> values, Context context) throws IOException, InterruptedException {

     for(${ValueType} value:values){

     　　GenericData.Record avroRecord = new GenericData.Record(ReflectData.get().getSchema(${实体类}.class));// value转实体类

         avroRecord.put(${字段名}, ${字段值});

     　　// ... n多字段   　　　　　　　　

         multipleOutputs.write(${Job中的name}, null, avroRecord, ${输出hdfs的绝对路径});

     }

 }

 @Override

 protected void cleanup(Context context) throws IOException, InterruptedException {

     multipleOutputs.close();

 }

五、遇到的问题
1.查询字符串scroll失败
ConfigurationOptions.ES_QUERY，不需要urlEncode，否则反而会解析失败
例如查询带时间范围：?q=event_time:>=1509465600 AND event_time:<1512057600

2.多输出路径重复跑job，根路径冲突
Job中的输出路径不能存在否则会抛异常“org.apache.hadoop.mapred.FileAlreadyExistsException”，所以在创建Job时需要判断输出路径是否存在，存在则删除。
当时用MultipleOutputs时，Job中的${outputDir}和Reducer中的${输出hdfs的绝对路径}可以是完全不同的目录，Job中的输出路径会保存_matadata等不是很重要的数据（parquet本身包含这些信息），Reducer中的输出路径为想要的输出路径，路径下只保存parquet文件。
重复执行相同的Job时删除Job中的输出路径，主要数据没有影响，另外如果Reducer的输出路径有冲突可以在Job中循环删除。

【原创】MapReduce备份Elasticsearch数据到HDFS(JAVA)的更多相关文章

使用MapReduce将mysql数据导入HDFS
package com.zhen.mysqlToHDFS; import java.io.DataInput; import java.io.DataOutput; import java.io.IO ...
kafka消费者实时消费数据存入hdfs java scalca 代码
hadoop-client依赖很乱调试很多次cdh版本好多jar没有用hadoop2.7.3可以自定义输出流的池子进行流管理 public void writeLog2HDFS(String p ...
Hbase使用MapReduce编程导出数据到HDFS
废话少说,直接上代码! package cn.com.oozie.demo; import java.io.IOException; import org.apache.hadoop.conf.C ...
elasticsearch数据备份还原
elasticsearch数据备份还原 1.在浏览器中运行http://XXX.XXX.XXX.XXX:9200/_flush,确保索引数据能保存到硬盘中. 2.原数据的备份.主要是elasticse ...
实际使用Elasticdump工具对Elasticsearch集群进行数据备份和数据还原
文/朱季谦目录一.Elasticdump工具介绍二.Elasticdump工具安装三.Elasticdump工具使用最近在开发当中做了一些涉及到Elasticsearch映射结构及数据导出导 ...
【原创】大叔经验分享（26）hive通过外部表读写elasticsearch数据
hive通过外部表读写elasticsearch数据,和读写hbase数据差不多,差别是需要下载elasticsearch-hadoop-hive-6.6.2.jar,然后使用其中的EsStorage ...
Hadoop 中利用 mapreduce 读写 mysql 数据
Hadoop 中利用 mapreduce 读写 mysql 数据有时候我们在项目中会遇到输入结果集很大,但是输出结果很小,比如一些 pv.uv 数据,然后为了实时查询的需求,或者一些 OLAP ...
HDFS Java API的使用举例
HDFS是Hadoop应用程序使用的主要分布式存储.HDFS集群主要由管理文件系统元数据的NameNode和存储实际数据的DataNodes组成,HDFS架构图描述了NameNode,DataNode ...
hadoop2的mapreduce操作hbase数据
1.从hbase中取数据,再把计算结果插入hbase中 package com.yeliang; import java.io.IOException; import org.apache.hadoo ...

随机推荐

hdu2157：How many ways??
n<=20个点m<=100条边有向图不带权,t个询问问Ai到Bi的经过k<=20条边方案数多少. f[i][j]--i到j的方案数,,初始化成初邻接矩阵,这样做一次就得到2条路最短路 ...
C#特性入门《详解》
原文发布时间为:2008-11-22 -- 来源于本人的百度文章 [由搬家工具导入] <转>http://www.bccn.net/Article/net/cs/jszl/200709/6 ...
积累js中的一些问题及解决方案
一.取字符串的第i位不兼容的问题 1.问题:对于字符串str来说,要获取第i位,常见的是str[i],但是在低版本的浏览器中不兼容,例如ie7. 2.解决:使用str.charAt(i); 二.使用定 ...
UOJ 58 （树上带修改的莫队）
UOJ 58 糖果公园 Problem : 给一棵n个点的树,每个点上有一种颜色,对于一条路径上的点,若 i 颜色第 j 次出现对该路径权值的贡献为 w[i] * c[j], 每次询问一条路径的权值, ...
vs2010 静态使用 opencv 2.46 库
下载opencv2.46的库,假设解压到OpenCV246,设置如下: 在工程的c++的include目录下添加:OpenCV246\opencv\build\include 在工程的c++的lib目 ...
jquery制作图片瀑布流点击按钮加载更多内容
<script type="text/javascript" src="js/jquery-1.9.1.min.js"></script> ...
SQL SERVER 2012 第四章连接 JOIN の INNER JOIN
所有JOIN语句的共同点是:将一个记录与另外一个或多个记录匹配,从而生成一个新记录,这个记录是由两个记录的合并列所产生的一个超集. 内部连接: 内部连接语法结构:SELECT <select l ...
[Bzoj3631][JLOI2014]松鼠的新家（树上前缀和）
3631: [JLOI2014]松鼠的新家 Time Limit: 10 Sec Memory Limit: 128 MBSubmit: 2350 Solved: 1212[Submit][Sta ...
SpringMVC+Hibernate+Junit4+json基本框架近乎0配置
公司是做APP开发的,须要后台来提供接口,于是乎,这个任务就交给我,经过重复的尝试,学习和參考别人的demo,最终搭出自己还算惬意的框架.SpringMVC+Sping3+Hibernate4+Jun ...
cocos2dx 制作单机麻将(五)
cocos2dx 制作单机麻将(五) 麻将逻辑6 最基础的4人麻将逻辑(轮流循环出牌, 之前学的都能用上跑起来了!!!) 最基础的麻将逻辑依据自己须要设置麻将人数GAME_PLAYER 基本流 ...

【原创】MapReduce备份Elasticsearch数据到HDFS(JAVA)

【原创】MapReduce备份Elasticsearch数据到HDFS(JAVA)的更多相关文章

随机推荐

热门专题