Flink的序列化与flink-hadoop-compatibility

最近用户提交了一个问题说他的jar包里明明包含相关的类型但是在提交Flink作业的时候却报出classnotfound的错误

查看之后发现这里是flink的一个没有说的太明白的地方

用户的代码之所以报错是因为在代码中引用了mapreduce相关的东西

我们知道 flink会在生成jobGraph的时候就解析所有需要序列化的类型这里就涉及需要解析mapReduce的类型比如Text

但是用户明明打进去了呀怎么还是找不到

这就涉及flink的类加载机制 flink对于自己的代码采用默认的java的类加载机制但是对于用户的代码使用了自定义的FlinkClassLoader

好吧这就是问题所在因为在解析序列化类型的时候 flink会传入默认的类加载器这个类加载器不包含用户代码所以在寻找的时候显然是找不到

知道了问题的症结所在解决起来却不完美

方案1：将相关的依赖放入lib目录，即加入flink的类加载器

方案2：用户提交作业的时候，动态的将用户的类加入默认的类加载器

以上两个方法都可以解决问题，但缺点也是明显的：

方案1的缺点在于需要频繁的更新flink的lib目录，方案2的缺点在于打破了Flink的类加载机制，使得用户不能独立的使用不同版本的依赖。

至于最终的选择的方案，就需要根据平台具体的情况判断了，目前我们选择的是放入lib包，避免classpath热加载导致不可预知的问题。

不过也简单实验了下热加载的方案。

import org.slf4j.Logger;

import org.slf4j.LoggerFactory;

import java.io.File;

import java.lang.reflect.Method;

import java.net.URL;

import java.net.URLClassLoader;

import java.util.List;

/**

 * to add the jar to this jvm classpath dynamically, but no need to unload the class because jvm will decide when

 * to unload the class

 */

public class ClassloaderUtil {

    private static final Logger LOG = LoggerFactory.getLogger(ClassloaderUtil.class);

    private static Method addURL;

    private static URLClassLoader system;

    static {

        try {

            addURL = URLClassLoader.class.getDeclaredMethod("addURL",

                    new Class[]{URL.class});

            addURL.setAccessible(true);

            system = (URLClassLoader) ClassLoader.getSystemClassLoader();

        } catch (Exception ex) {

            LOG.error("Fail to load classloader staff.", ex);

        }

    }

    public static void addToClasspath(File file, List<URL> classpath) {

        addToClasspath(file);

        for (URL url : classpath) {

            addToClasspath(url);

        }

    }

    public static void addToClasspath(String file) {

        addToClasspath(new File(file));

    }

    public static void addToClasspath(File file) {

        try {

            addToClasspath(file.toURL());

        } catch (Exception ex) {

            LOG.error("Fail to dynamically add classpath.", ex);

        }

    }

    public static void addToClasspath(URL url) {

        try {

            addURL.invoke(system, new Object[]{url});

            LOG.info("Dynamically add classpath [{}]", url);

        } catch (Exception ex) {

            LOG.error("Fail to dynamically add classpath.", ex);

        }

    }

}

参考了https://blog.csdn.net/treeroot/article/details/631490

Flink的序列化与flink-hadoop-compatibility的更多相关文章

Hadoop Compatibility in Flink
18 Nov 2014 by Fabian Hüske (@fhueske) Apache Hadoop is an industry standard for scalable analytical ...
Flink（三）Flink开发IDEA环境搭建与测试
一.IDEA开发环境 1.pom文件设置 <properties> <maven.compiler.source>1.8</maven.compiler.source&g ...
Flink学习笔记：Flink API 通用基本概念
本文为<Flink大数据项目实战>学习笔记,想通过视频系统学习Flink这个最火爆的大数据计算框架的同学,推荐学习课程: Flink大数据项目实战:http://t.cn/EJtKhaz ...
Flink（一）Flink的入门简介
一. Flink的引入这几年大数据的飞速发展,出现了很多热门的开源社区,其中著名的有 Hadoop.Storm,以及后来的 Spark,他们都有着各自专注的应用场景.Spark 掀开了内存计算的先河 ...
Flink学习笔记-新一代Flink计算引擎
说明:本文为<Flink大数据项目实战>学习笔记,想通过视频系统学习Flink这个最火爆的大数据计算框架的同学,推荐学习课程: Flink大数据项目实战:http://t.cn/EJtKh ...
Flink 源码解析 —— Flink JobManager 有什么作用？
JobManager 的作用 https://t.zsxq.com/2VRrbuf 博客 1.Flink 从0到1学习 -- Apache Flink 介绍 2.Flink 从0到1学习 -- Mac ...
Flink 源码解析 —— Flink TaskManager 有什么作用？
TaskManager 有什么作用 https://t.zsxq.com/RZbu7yN 博客 1.Flink 从0到1学习 -- Apache Flink 介绍 2.Flink 从0到1学习 -- ...
[转帖]Flink（一）Flink的入门简介
Flink(一)Flink的入门简介 https://www.cnblogs.com/frankdeng/p/9400622.html 一. Flink的引入这几年大数据的飞速发展,出现了很多热门的 ...
flink初识及安装flink standalone集群
flink architecture 1.可以看出,flink可以运行在本地,也可以类似spark一样on yarn或者standalone模式(与spark standalone也很相似),此外fl ...

随机推荐

rsync同步常用命令
转载源地址http://blog.csdn.net/niushuai666/article/details/16880061 如果你是一位运维工程师,你很可能会面对几十台.几百台甚至上千台服务器,除了 ...
spring作用
在SSH框假中spring充当了管理容器的角色.我们都知道hibernate用来做持久层,因为它将JDBC做了一个良好的封装,程序员在与数据库进行交互时可以不用书写大量的SQL语句.Struts是用来 ...
上海Uber优步司机奖励政策（1月11日~1月17日）
滴快车单单2.5倍,注册地址:http://www.udache.com/ 如何注册Uber司机(全国版最新最详细注册流程)/月入2万/不用抢单:http://www.cnblogs.com/mfry ...
springboot 配置二级缓存
springBoot中配置mybatis的二级缓存 2018年01月22日 11:45:37 Ting.Xue(Martin.Xue) 阅读数:5604更多个人分类: SSM的Spring框架Myb ...
dota2交换物品
改成.bat 因为文件就可以 echo/>>c:/windows/system32/drivers/etc/hostsecho 111.230.82.224 steamcommunity. ...
MongoDB之我是怎么成为Primary节点的
此文已由作者温正湖授权网易云社区发布. 欢迎访问网易云社区,了解更多网易技术产品运营经验. Primary(主)是MongoDB复制集中的最重要的角色,是能够接受客户端/Driver写请求的节点,(读 ...
windows安装logstash-input-jdbc并使用其导入MMSQL数据
1.安装logstash 2.修改logstash 文件夹下Gemfile文件将source改为:https://gems.ruby-china.org 3.进入bin目录执行logstash-p ...
关于自学C语言开始时应该注意的问题分享—未完待续......
---恢复内容开始--- 自学C语言编程总结第1章C语言概述 1. 如果用户将主函数的返回值类型定义为了void,则不需要返回任何值: 2. C语言的基本结构包括主函数和程序体两部分 ...
BehaviorDesigner学习
行为树: 行为树设计师插件是一个专门为unity设计的AI插件. 学习用!!!插件地址:链接:http://pan.baidu.com/s/1dF2okPN 密码:b43m 通过继承Behavior中 ...
为什么Python在列表和元组的末尾允许使用逗号？
Python 允许您在列表,元组和字典的末尾添加一个尾随逗号: [1, 2, 3,] ('a', 'b', 'c',) d = { "A": [1, 5], "B&quo ...

Flink的序列化与flink-hadoop-compatibility

Flink的序列化与flink-hadoop-compatibility的更多相关文章

随机推荐

热门专题