Spark ZooKeeper数据恢复

Spark使用ZooKeeper进行数据恢复的逻辑过程如下：

1.初始化：创建<CuratorFramwork,LeaderLatch,LeaderLatchListener>用于选举

创建CuratorFramework用于数据恢复。

2.选举：启动LeaderLatch，Curator开始接管选举工作了。

3.恢复：当某个Master被选举为Leader后，就会调用LeaderLatchListener的isLeader()方法，这个方法内部开始进行逻辑上的数据恢复工作，具体细节是这样的，向Master发送ElectedLeader消息，Master从ZooKeeperPersistenceEngine中读取数据到内存缓存中，ZooKeeperPersistenceEngine从ZooKeeper的/spark/master_status/目录下读取storedApps，storedDrivers，storedWorkers。

下面来进行一下源码的走读，方便日后回忆。

1.初始化：Master启动时创建ZooKeeperLeaderElectionAgent和 ZooKeeperPersistenceEngine，前者用于选举，后者用于数据恢复。

Master初始化源码如下：

 case "ZOOKEEPER" =>

        logInfo("Persisting recovery state to ZooKeeper")

        val zkFactory =

          new ZooKeeperRecoveryModeFactory(conf, SerializationExtension(context.system))

        (zkFactory.createPersistenceEngine(), zkFactory.createLeaderElectionAgent(this))

private[master] class ZooKeeperRecoveryModeFactory(conf: SparkConf, serializer: Serialization)

  extends StandaloneRecoveryModeFactory(conf, serializer) {

  def createPersistenceEngine(): PersistenceEngine = {

    new ZooKeeperPersistenceEngine(conf, serializer)

  }

  def createLeaderElectionAgent(master: LeaderElectable): LeaderElectionAgent = {

    new ZooKeeperLeaderElectionAgent(master, conf)

  }

}

private[master] class ZooKeeperPersistenceEngine(conf: SparkConf, val serialization: Serialization)

  extends PersistenceEngine

  with Logging {

  private val WORKING_DIR = conf.get("spark.deploy.zookeeper.dir", "/spark") + "/master_status"

  //创建zookeeper客户端

  private val zk: CuratorFramework = SparkCuratorUtil.newClient(conf)

  //创建WORKING_DIR目录

  SparkCuratorUtil.mkdir(zk, WORKING_DIR)

}

创建ZooKeeperLeaderElectionAgent时会创建用于选举的CuratorFramwork，LeaderLatch，LeaderLatchListener。其中的LeaderLatch用于选举Leader，当某个LeaderLatch被选举为Leader之后，就会调用对应的LeaderLatchListener的isLeader()，如下：

private[master] class ZooKeeperLeaderElectionAgent(val masterActor: LeaderElectable,

    conf: SparkConf) extends LeaderLatchListener with LeaderElectionAgent with Logging  {

  val WORKING_DIR = conf.get("spark.deploy.zookeeper.dir", "/spark") + "/leader_election"

  private var zk: CuratorFramework = _

  private var leaderLatch: LeaderLatch = _

  private var status = LeadershipStatus.NOT_LEADER

  start()

  private def start() {

    logInfo("Starting ZooKeeper LeaderElection agent")

    zk = SparkCuratorUtil.newClient(conf)

    leaderLatch = new LeaderLatch(zk, WORKING_DIR)

    leaderLatch.addListener(this)

    leaderLatch.start()

  }

2.选举，调用LeaderLatch的start开始进行选举

3.数据恢复：如果某个master被成功选举为alive master，那么会调用isLeader()。这个方法内部会向Master发送ElectedLeader消息，然后Master会从ZookeeperPersistenceEngin中也就是ZooKeeper中读取storedApps，storedDrivers，storedWorkers并将他们恢复到内存缓存中去。

  override def isLeader() {

    synchronized {

      // could have lost leadership by now.

      if (!leaderLatch.hasLeadership) {

        return

      }

      logInfo("We have gained leadership")

      updateLeadershipStatus(true)

    }

  }

  private def updateLeadershipStatus(isLeader: Boolean) {

    if (isLeader && status == LeadershipStatus.NOT_LEADER) {

      status = LeadershipStatus.LEADER

      masterActor.electedLeader()

    } else if (!isLeader && status == LeadershipStatus.LEADER) {

      status = LeadershipStatus.NOT_LEADER

      masterActor.revokedLeadership()

    }

  }

开始真正的数据恢复工作：

  case ElectedLeader => {

      val (storedApps, storedDrivers, storedWorkers) = persistenceEngine.readPersistedData()

      state = if (storedApps.isEmpty && storedDrivers.isEmpty && storedWorkers.isEmpty) {

        RecoveryState.ALIVE

      } else {

        RecoveryState.RECOVERING

      }

      logInfo("I have been elected leader! New state: " + state)

      if (state == RecoveryState.RECOVERING) {

        beginRecovery(storedApps, storedDrivers, storedWorkers)

        recoveryCompletionTask = context.system.scheduler.scheduleOnce(WORKER_TIMEOUT millis, self,

          CompleteRecovery)

      }

    }

持久化数据存储在ZooKeeper中的/spark/master_status目录下。以app为例，当向ZooKeeperPersistenceEngine中写入app时，假设这个appId是1，那么就会创建一个/spark/master_status/app_1的持久化节点，节点数据内容就是序列化的app对象。

/spark/master_status

/app_appid

/worker_workerId

/driver_driverId

Spark ZooKeeper数据恢复的更多相关文章

hadoop+yarn+hbase+storm+kafka+spark+zookeeper)高可用集群详细配置
配置 hadoop+yarn+hbase+storm+kafka+spark+zookeeper 高可用集群,同时安装相关组建:JDK,MySQL,Hive,Flume 文章目录环境介绍节点介绍 ...
最新hadoop+hbase+spark+zookeeper环境安装（vmmare下）
说明:我这里安装的版本是hadoop2.7.3,hbase1.2.4,spark2.0.2,zookeeper3.4.9 (安装包:链接:http://pan.baidu.com/s/1c25hI4g ...
大数据学习系列之七 ----- Hadoop+Spark+Zookeeper+HBase+Hive集群搭建图文详解
引言在之前的大数据学习系列中,搭建了Hadoop+Spark+HBase+Hive 环境以及一些测试.其实要说的话,我开始学习大数据的时候,搭建的就是集群,并不是单机模式和伪分布式.至于为什么先写单 ...
HADOOP+SPARK+ZOOKEEPER+HBASE+HIVE集群搭建(转)
原文地址:https://www.cnblogs.com/hanzhi/articles/8794984.html 目录引言目录一环境选择 1集群机器安装图 2配置说明 3下载地址二集群的相关 ...
阿里云ECS hadoop+spark+zookeeper+hive code-server 集群搭建
懒得重新排版然后发到博客了.用在线文档看吧 https://www.kdocs.cn/l/srV6o8rABW9V 用线上IDE(code-server)写scala的时候,出现BUG可以参考下面两篇 ...
Spark技术内幕：Master基于ZooKeeper的High Availability（HA）源码实现
如果Spark的部署方式选择Standalone,一个采用Master/Slaves的典型架构,那么Master是有SPOF(单点故障,Single Point of Failure).Spark可以 ...
Spark技术内幕：Master基于ZooKeeper的High Availability（HA）源代码实现
假设Spark的部署方式选择Standalone,一个採用Master/Slaves的典型架构,那么Master是有SPOF(单点故障,Single Point of Failure).Spark能够 ...
【分布式】Zookeeper数据与存储
一.前言前面分析了Zookeeper对请求的处理,本篇博文接着分析Zookeeper中如何对底层数据进行存储,数据存储被分为内存数据存储于磁盘数据存储. 二.数据与存储 2.1 内存数据 Zooke ...
spark HA 安装配置和使用（spark1.2-cdh5.3）
安装环境如下: 操作系统:CentOs 6.6 Hadoop 版本:CDH-5.3.0 Spark 版本:1.2 集群5个节点 node01~05 node01~03 为worker. node04. ...

随机推荐

Android控制ScrollView滚动
有两种办法,第一种,使用scrollTo(),这个方法不需要handler,直接调用就行第二种方式,使用fullScrol() 下面我们看一下这个函数: scrollView.fullScroll( ...
word20161221
S/MIME, Secure Multipurpose Internet Mail Extensions / 安全多用途网际邮件扩展协议 SACL, system access control lis ...
算法练习_图的连通性问题（JAVA）
一.问题 1.问题描述: 有n个点(1...n),输入整数对(8,9),表示8,9点之间存在相互的连接关系. 动态连通性问题--编写一段程序过滤掉所以无意义的整数对,即为在不破坏图连通性的前提下,以最 ...
python class metaclass instance
>>> class CObj(object):... pass...>>> dir()['CObj', '__builtins__', '__doc__', '__ ...
点击页面判断是否安装app并打开，否则跳转app store的方法
常常有这样的场景,咱们开发出来的APP需要进行推广,比如在页面顶部来一张大Banner图片,亦或一张二维码.但往往我们都是直接给推广图片加了一个下载链接(App Store中的).所以咱们来模拟一下用 ...
firefox插件HTTP-Tool的使用方法
2016年11月3日 14:32:01 星期四 chrome 有postman很强大我比较懒, 不想FQ, 经常用firefox, 试了几款模拟post请求的插件, 觉得http-tool挺简洁的 ...
【Django】--Form组件
Django的Form主要具有一下几大功能: 生成HTML标签验证用户数据(显示错误信息) HTML Form提交保留上次提交数据初始化页面显示内容例子: 1.创建Form类 from djan ...
基础拾遗------webservice详解
基础拾遗基础拾遗------特性详解基础拾遗------webservice详解基础拾遗------redis详解基础拾遗------反射详解基础拾遗------委托详解基础拾遗----- ...
design包 TabLayout使用
类似"网易新闻"UI设计就很好,顶部是导航,下面是各个页面.如图这种效果使用design包中的TabLayout可以轻松的实现. 一.分析TabLayout 常见 UI 上图 ...
hosts文件权限导致监听无法启动
1.所属系统:2.问题描述:3.解决4.参考???疑点:为什么修改主机名会使hosts文件权限发生改变 1.所属系统: ZHJS2#[/]uname -a HP-UX ZHJS2 B.11.31 U ...

Spark ZooKeeper数据恢复

Spark ZooKeeper数据恢复的更多相关文章

随机推荐

热门专题