elasticsearch-hadoop 扩展定制官方包以支持 update upsert doc

官方源码地址https://github.com/elastic/elasticsearch-hadoop

spark to es

4种操作方式
index
update
upsert
create

只支持四种操作，看文档描述，目前的需求只能用 upsert 实现，但官方的包对 upsert 支持不完整

upsert 现支持
/*
* {
* "script":{
* "inline": "...",
* "lang": "...",
* "params": ...,
* },
* "upsert": {...}
* }
*/

及
/*
* {
* "doc_as_upsert": true,
* "doc": {...}
* }
*/

并不支持
/*
* {
* "upsert": {},
* "doc": {...}
* }
*/

无奈只好自已动手了

代码量太大，找到相关的部分，理顺操作逻辑后，改起来就容易多了，最主要的部分在这里

source code

把rdd json 化并拼接http 请求

两种思路

1传入完整的对像，然后修改 json 解析部分，拼接出请求
2修改对象结构，json 解析部分不变，拼接出请求

1的实现相对复杂，工作量很大，且要求对代码项目很熟悉，实现的成本很高
2的实现很简单

修改的地方很少,可以参照着自已改,需重新编译

具体看 commit，也提交到了官方，但代码比较粗暴，很可能通不过，功能优先，官方不采用，可以用的时候再个人修改。

之后打包，引用打包后的文件。

另外，程序也要作并要的修改

写入部分，对比下就知道要改的地方，很容易

case class ES_Upsert(kw_index: String, kw_type: String, id: String, date_idate: String, date_udate: String)

case class ES_Doc(date_udate: String)

case class ES_UpsertDoc(upsert: ES_Upsert, doc: ES_Doc)

.saveToEs(Map[String, String](

"es.resource" -> "{upsert.kw_index}/{upsert.kw_type}",

"es.nodes" -> es,

"es.input.json" -> "false",

"es.nodes.discovery" -> "false",

"es.update.doc" -> "true",

"es.nodes.wan.only" -> "true",

"es.write.operation" -> "upsert",

"es.mapping.exclude" -> "upsert.kw_index,upsert.kw_type,upsert.id",

"es.mapping.id" -> "upsert.id"

))

外套一层对象ES_UpsertDoc 字段名称分别为upsert，doc熟悉es的就不用解释吧
"es.update.doc" -> "true"为 true 才生效。

"es.resource" -> "{upsert.kw_index}/{upsert.kw_type}",
"es.mapping.exclude" -> "upsert.kw_index,upsert.kw_type,upsert.id"
index type field mapping 也要多套一层

项目示例

kafka spark streaming elasticsearch

https://github.com/cclient/elasticsearch-spark-upsert-from-kafka

——官方已经拒掉了，主要原因是这个包要在各种数据平台上保证可用，按官方的说法是

'whether using Map/Reduce or libraries built upon it such as Hive, Pig or Cascading or new upcoming libraries like Apache Spark'

现在的case只是基于 Spark的，即使在spark上可用，没有在其他平台的测试，不会通过，也没有精力去挨个试，等用的时候自已改吧

elasticsearch-hadoop 扩展定制官方包以支持 update upsert doc的更多相关文章

自动化部署必备技能—部署yum仓库、定制rpm包
部署yum仓库.定制rpm包目录第1章扩展 - yum缓存 1.1 yum缓存使用步骤... 1 1.1.1 导言... 1 1.1.2 修改配置文件... 1 1.1.3 使用缓存... 1 ...
【大数据系列】hadoop命令指导官方文档翻译
Hadoop Commands Guide Overview Shell Options Generic Options User Commands archive checknative class ...
FPM定制RPM包实践
1.1 快速部署方案 ✔ 问题:当领导给你 100 台已经安装好系统的服务器,然后让优化,让你提出一个快速部署方案. 解答: 1.tar 打包先编译安装打包-->分发-->解包(比如 ...
Go 语言官方包函数中文翻译
Go官方包函数中文翻译 *** import "strings" func Join(a []string, sep string) string Join concatenate ...
FPM工具实战定制nginx包
FPM主要特点: 把一种包打包成另一种包的格式支持的源类型包 DIR 将目录打包成所需要的类型,可以用于源码编译的安装包. RPM 对rpm进行转换 gem 对rubygem包进行转换. ...
react-native 的微信SDK辅助包，支持微信登录、微信分享、微信支付
微信SDK集成示例,现已完成微信授权登录,之后将陆续包装分享等其他功能. ReactNative高级交流群 127482131 或访问 http://blog.1ygowu.com ReactNat ...
Datagrid扩展方法onClickCell{easyui-datagrid-扩充-支持单元格编辑}
//-----------------------------------------------------------------/******************************** ...
搭建yum仓库与定制rpm包
笔者Q:972581034 交流群:605799367.有任何疑问可与笔者或加群交流当我们自动化部署集群的时候,想要快速的安装所有服务,搭建yum仓库与定制rpm包是我们首先要做的原创作品,转载请 ...
hadoop之定制自己的sort过程
Key排序 1. 继承WritableComparator 在hadoop之Shuffle和Sort中,可以看到mapper的输出文件spill文件需要在内存中排序,并且在输入reducer之前,不同 ...

随机推荐

大二暑假第七周总结--开始学习Hadoop基础（六）
复习关于Hadoop的操作语句以及重点 Shell版跳转目录到Hadoop: cd /usr/local/hadoop 启动Hadoop: ./sbin/start-dfs.sh 注意:Hadoop ...
java课程之团队开发冲刺阶段2.3
一.总结昨天进度 1.完成整合功能二.遇到的问题 1.在整合的过程中,总是发现在switch开关提醒了两次,后来发现是因为我使用了setChecked方法,而这个方法触发onCheckedChang ...
python格式字符
redis常用命令--基础
redis默认有个数据库,下标从开始,不支持自定义数据库名字. 使用select index 切换数据库 : select 7 (切换到第八个数据库) dbsize:求当前数据库中键值对的数量. ...
CSS样式实现两个图片平分三角
<div class='pageOption'> <a href='#' class='option' > <img src='http://imgsrc.hubbles ...
JavaScript 之数据在内存中的存储和引用
栈和堆大家都知道,JS中的数据类型包括两种:简单数据类型(String.Number.Boolean.undefined.null)和复杂数据类型(object). 在内存中分为栈区(stack)和 ...
js.console携程近期低价机票信息
!function(){var city = {"SHA":"上海虹桥","PVG":"上海浦东","YIW& ...
洛谷P1002 过河卒（动态规划）
题目描述棋盘上 AA 点有一个过河卒,需要走到目标 BB 点.卒行走的规则:可以向下.或者向右.同时在棋盘上 CC 点有一个对方的马,该马所在的点和所有跳跃一步可达的点称为对方马的控制点.因此称之为 ...
Python笔记_第四篇_高阶编程_进程、线程、协程_2.线程
1. 线程概述: 在一个进程的内部,要同时干多件事情,就需要同时运行“多个子任务”,我们把进程内的这些“子任务”叫做线程.也就说线程是进程成的子任务. 线程通常叫做情景的进程.线程是通过向内侧控件的并 ...
题解 P1630 【求和】
题目发现题解都不够优雅,就自己来一篇 ( 以下除[代码]处代码,其余均为现场手打,如有误请与本蒟蒻联系 ) [分析] 首先,看清楚了,题目是 \(\sum_{i=1}^ai^b\) 的余数 ,而不是 ...

elasticsearch-hadoop 扩展定制 官方包以支持 update upsert doc

elasticsearch-hadoop 扩展定制 官方包以支持 update upsert doc的更多相关文章

随机推荐

热门专题

elasticsearch-hadoop 扩展定制官方包以支持 update upsert doc

elasticsearch-hadoop 扩展定制官方包以支持 update upsert doc的更多相关文章