在KafkaServer启动过程的入口中，会启动Replica Manager，众所周知，这是一个副本管理器。replica在Kafka中扮演的角色很重要，是保证消息不丢失的一个重要概念。

replica的个人理解概念如下：producer发送的消息给broker，broker是分为多个partition的，对于同一个partition中的broker，这些机器是有主从的概念的。producer只会向leader写入消息，consumer只会从leader读取消息，（leader负责读写，replica保证消息不丢）。为了保证消息不丢失，follower会定时从leader拉取消息，保持与leader的消息同步。当然，producer可以配置是否需要有follower同步成功，以及需要多少个replica，（即需要多少个ack）才算是消息发送成功。这块看个人的需求。

下面我们看下Replica Manager的启动过程。

一、入口

入口在KafkaServer的start方法中，比较简洁：

replicaManager = new ReplicaManager(config, metrics, time, kafkaMetricsTime, zkUtils, kafkaScheduler, logManager,isShuttingDown)

replicaManager.startup()

我们主要看下ReplicaManager里面都有什么内容。

二、ReplicaManager实例化

我们看看实例化的过程：

/* epoch of the controller that last changed the leader */

@volatile var controllerEpoch: Int = KafkaController.InitialControllerEpoch - 1

private val localBrokerId = config.brokerId

private val allPartitions = new Pool[(String, Int), Partition](valueFactory = Some { case (t, p) =>

  new Partition(t, p, time, this)

})

private val replicaStateChangeLock = new Object

val replicaFetcherManager = new ReplicaFetcherManager(config, this, metrics, jTime, threadNamePrefix)

private val highWatermarkCheckPointThreadStarted = new AtomicBoolean(false)

val highWatermarkCheckpoints = config.logDirs.map(dir => (new File(dir).getAbsolutePath, new OffsetCheckpoint(new File(dir, ReplicaManager.HighWatermarkFilename)))).toMap

private var hwThreadInitialized = false

this.logIdent = "[Replica Manager on Broker " + localBrokerId + "]: "

val stateChangeLogger = KafkaController.stateChangeLogger

private val isrChangeSet: mutable.Set[TopicAndPartition] = new mutable.HashSet[TopicAndPartition]()

private val lastIsrChangeMs = new AtomicLong(System.currentTimeMillis())

private val lastIsrPropagationMs = new AtomicLong(System.currentTimeMillis())

val delayedProducePurgatory = DelayedOperationPurgatory[DelayedProduce](

    purgatoryName = "Produce", config.brokerId, config.producerPurgatoryPurgeIntervalRequests)

val delayedFetchPurgatory = DelayedOperationPurgatory[DelayedFetch](

    purgatoryName = "Fetch", config.brokerId, config.fetchPurgatoryPurgeIntervalRequests)

首先是这个controllerEpoch，这个值表示的是leader发生变化时controller的epoch。epoch存储在zk中的/Controller_epoch中。
第二步是从配置broker.id中获取当前机器的brokerId。
实例化ReplicaFetcherManager，是一个follower从leader拉取消息的管理器，这里面有文章。
设置highWatermarkCheckPointThreadStarted为false，为了后续启动相关的线程用。
从文件（replication-offset-checkpoint）中获取所有topic和partition的HW，这个文件中存储了每个topic和partition对应的最新的checkPoint对应的offset值。HW表示的是topic的partition对应的最后一次commit的消息的offset值，也是用于消息完整性的保证。
定义了isrChangerSet，表示了isr改变顺序的集合。至于isr是干啥的，网上的内容比较多，搜索即可。
最后涉及到两个配置，分别是：
- producer.purgatory.purge.interval.requests：默认值1000,用于在procucer的ack设置是-1或者1时,跟踪消息是否添加成功,使用DelayedProduce实现。成功后清除。
- fetch.purgatory.purge.interval.requests：默认值1000，fetch 请求清除时的清除间隔

三、启动ReplicaManager

我们主要看下ReplicaManager的start方法：

def startup() {

// start ISR expiration thread

scheduler.schedule("isr-expiration", maybeShrinkIsr, period = config.replicaLagTimeMaxMs, unit = TimeUnit.MILLISECONDS)

scheduler.schedule("isr-change-propagation", maybePropagateIsrChanges, period = 2500L, unit = TimeUnit.MILLISECONDS)

}

这块主要启动了两个定时任务，分别是maybeShrinkIsr和maybePropagateIsrChanges。下面我们着重分析下。

3.1 maybeShrinkIsr

这个方法的调用时间间隔由配置replica.lag.time.max.ms控制，主要用于检查partition对应的isr列表中是否有心跳过期的isr。

  private def maybeShrinkIsr(): Unit = {

    trace("Evaluating ISR list of partitions to see which replicas can be removed from the ISR")

    allPartitions.values.foreach(partition => partition.maybeShrinkIsr(config.replicaLagTimeMaxMs))

  }

这块主要是遍历了所有的partition，每个partition都执行maybeShrinkIsr方法，下面我们进入maybeShrinkIsr，分析下主要做了哪些事情。

  def maybeShrinkIsr(replicaMaxLagTimeMs: Long) {

    val leaderHWIncremented = inWriteLock(leaderIsrUpdateLock) {

      leaderReplicaIfLocal() match {

        case Some(leaderReplica) =>

          val outOfSyncReplicas = getOutOfSyncReplicas(leaderReplica, replicaMaxLagTimeMs)

          if(outOfSyncReplicas.size > 0) {

            val newInSyncReplicas = inSyncReplicas -- outOfSyncReplicas

            assert(newInSyncReplicas.size > 0)

            info("Shrinking ISR for partition [%s,%d] from %s to %s".format(topic, partitionId,

              inSyncReplicas.map(_.brokerId).mkString(","), newInSyncReplicas.map(_.brokerId).mkString(",")))

            // update ISR in zk and in cache

            updateIsr(newInSyncReplicas)

            // we may need to increment high watermark since ISR could be down to 1

            replicaManager.isrShrinkRate.mark()

            maybeIncrementLeaderHW(leaderReplica)

          } else {

            false

          }

        case None => false // do nothing if no longer leader

      }

    }

整个步骤如下：

leaderReplicaIfLocal：先检查当前的partition的leader是否为当前的broker，如果为是，就不进入下面的方法，否则进入下面的方法。
getOutOfSyncReplicas：获取不同步的replica列表，获取的方法是首先从isr中去除掉leader，然后把当前时间-lastCaughtUpTimeMs大于replicaMaxLagTimeMs的replica筛选出来，即为outOfSyncReplicas。这里面的lastCaughtUpTimeMs是指上次同步的时间，不一定是心跳时间。
如果outOfSyncReplicas中存在replica，则继续。两个列表进行差值运算后得到新的isr列表，之后更新isr列表（即zk中的数据）。
最后可能需要更新下HW

3.2 maybePropagateIsrChanges

这个方法的调用时间是固定的，不由配置决定，代码中写死，为2500ms。这个方法会把isr的变化内容更新到zk中去，执行这个方法的条件是：

ISR变化没有被广播出去
最近5s内没有ISR变化或者上次广播的时间距离当前时间超过了60s,其实这里的广播就是指写入到zk中

  def maybePropagateIsrChanges() {

    val now = System.currentTimeMillis()

    isrChangeSet synchronized {

      if (isrChangeSet.nonEmpty &&

        (lastIsrChangeMs.get() + ReplicaManager.IsrChangePropagationBlackOut < now ||

          lastIsrPropagationMs.get() + ReplicaManager.IsrChangePropagationInterval < now)) {

        ReplicationUtils.propagateIsrChanges(zkUtils, isrChangeSet)

        isrChangeSet.clear()

        lastIsrPropagationMs.set(now)

      }

    }

  }

【Kafka源码】ReplicaManager启动过程的更多相关文章

Symfony2源码分析——启动过程2
文章地址:http://www.hcoding.com/?p=46 上一篇分析Symfony2框架源码,探究Symfony2如何完成一个请求的前半部分,前半部分可以理解为Symfony2框架为处理请求 ...
quartz2.x源码分析——启动过程
title: quartz2.x源码分析--启动过程 date: 2017-04-13 14:59:01 categories: quartz tags: [quartz, 源码分析] --- 先简单 ...
mysql源码分析-启动过程
mysql源码分析-启动过程概要 # sql/mysqld.cc, 不包含psi的初始化过程 mysqld_main: // 加载my.cnf和my.cnf.d,还有命令行参数 if (load_d ...
Nginx学习笔记（六）源码分析&启动过程
Nginx的启动过程主要介绍Nginx的启动过程,可以在/core/nginx.c中找到Nginx的主函数main(),那么就从这里开始分析Nginx的启动过程. 涉及到的基本函数源码: /* * ...
Symfony2源码分析——启动过程1
本文通过阅读分析Symfony2的源码,了解Symfony2启动过程中完成哪些工作,从阅读源码了解Symfony2框架. Symfony2的核心本质是把Request转换成Response的一个过程. ...
分布式事务_02_2PC框架raincat源码解析-启动过程
一.前言上一节已经将raincat demo工程运行起来了,这一节来分析下raincat启动过程的源码主要包括: 事务协调者启动过程事务参与者启动过程二.协调者启动过程主要就是在启动类中通过 ...
Spring MVC源码(一) ----- 启动过程与组件初始化
SpringMVC作为MVC框架近年来被广泛地使用,其与Mybatis和Spring的组合,也成为许多公司开发web的套装.SpringMVC继承了Spring的优点,对业务代码的非侵入性,配置的便捷 ...
Spring Boot源码分析-启动过程
Spring Boot作为目前最流行的Java开发框架,秉承"约定优于配置"原则,大大简化了Spring MVC繁琐的XML文件配置,基本实现零配置启动项目. 本文基于Spring ...
Syncthing源码解析 - 启动过程
我相信很多朋友会认为启动就是双击一下Syncthing程序图标,随后就启动完毕了!如果这样认为,对,也不对!对,是因为的确是这样操作,启动了Syncthing:不对是因为在调试Syncthing启动过 ...
Redis源码研究--启动过程
---------------------6月23日--------------------------- Redis启动入口即main函数在redis.c文件,伪代码如下: int main(int ...

随机推荐

axis和cxf集成Springmvc的使用
一.使用axis用wsdl生成Webservice: 工具:有axis插件的eclipse,wsdl文件: 操作步骤: 新建工程-->选择wsdl文件-->右键选择Webservice-- ...
Json操作问题总结
大家都知道,Json是一种轻量级的数据交换格式,对JS处理数据来说是很理想滴! 熟练写过xxx.json文件和操作的小伙伴来说,我说的问题都不是什么大问题啦,可以忽略本宝宝的文章,更希望各位大佬指点一 ...
Permutations 好题
Permutations Time Limit: 20000/10000MS (Java/Others) Memory Limit: 128000/64000KB (Java/Others) Subm ...
Python自学笔记-进程，线程（Mr serven）
对于操作系统来说,一个任务就是一个进程(Process),比如打开一个浏览器就是启动一个浏览器进程,打开一个记事本就启动了一个记事本进程,打开两个记事本就启动了两个记事本进程,打开一个Word就启动了 ...
【Java核心】ClassLoader原理及其使用
又把博客的皮肤换了换,看着更加简洁舒心一些.前段的知识只是略懂,拿过来就能用,只是自己的审美和设计水平有限,实在难以弄出自己特别满意的东西,也算是小小的遗憾吧!言归正传,由于最近涉及到Java核心的东 ...
自动化双向数据绑定AngularJs---入门
前言 AngularJS,由Misko Hevery 等人创建,后为Google所收购.是一款优秀的前端JS框架,已经被用于Google的多款产品当中.AngularJS有着诸多特性,最为 ...
Echarts数据可视化series-heatmap热力图，开发全解+完美注释
全栈工程师开发手册 (作者:栾鹏) Echarts数据可视化开发代码注释全解 Echarts数据可视化开发参数配置全解 6大公共组件详解(点击进入): title详解. tooltip详解.toolb ...
python 携带cookie访问网站（python接口测试post）
最近在使用自己研究性能测试工具的时候想到,使用python向服务器不断发送数据以作为并发测试.大概情况如下: #coding=utf-8 import urllib2 import urllib im ...
visual Studio 无法调试，提示程序跟踪已退出
今天在打码出现了vs无法调试,我在网上查了很久没有发现一个方法. vs点击启动时,出现了一下提示程序"[12648] *.vshost.exe: 程序跟踪"已退出,返回值为 0 ...
JavaWeb之Maven配置
Maven和C#的nuget类似,可以通过设置就能引入框架等第三方,方便又省事.Java中使用Maven来管理第三方.今天尝试着配置了一下. 一.JDK的安装关于JDK的安装可以查看百度经验,设置P ...

【Kafka源码】ReplicaManager启动过程