Spark createDirectStream 维护 Kafka offset（Scala）

createDirectStream方式需要自己维护offset，使程序可以实现中断后从中断处继续消费数据。

KafkaManager.scala

import kafka.common.TopicAndPartition

import kafka.message.MessageAndMetadata

import kafka.serializer.Decoder

import org.apache.spark.SparkException

import org.apache.spark.rdd.RDD

import org.apache.spark.streaming.StreamingContext

import org.apache.spark.streaming.dstream.InputDStream

import org.apache.spark.streaming.kafka.KafkaCluster.LeaderOffset

import scala.reflect.ClassTag

/**

  * Created by knowpigxia on 15-8-5.

  */

class KafkaManager(val kafkaParams: Map[String, String]) extends Serializable {

  private val kc = new KafkaCluster(kafkaParams)

  /**

    * 创建数据流

    * @param ssc

    * @param kafkaParams

    * @param topics

    * @tparam K

    * @tparam V

    * @tparam KD

    * @tparam VD

    * @return

    */

  def createDirectStream[K: ClassTag, V: ClassTag, KD <: Decoder[K]: ClassTag, VD <: Decoder[V]: ClassTag](

                                                                                                            ssc: StreamingContext,

                                                                                                            kafkaParams: Map[String, String],

                                                                                                            topics: Set[String]): InputDStream[(K, V)] =  {

    val groupId = kafkaParams.get("group.id").get

    // 在zookeeper上读取offsets前先根据实际情况更新offsets

    setOrUpdateOffsets(topics, groupId)

    //从zookeeper上读取offset开始消费message

    val messages = {

      val partitionsE = kc.getPartitions(topics)

      if (partitionsE.isLeft)

        throw new SparkException(s"get kafka partition failed: ${partitionsE.left.get}")

      val partitions = partitionsE.right.get

      val consumerOffsetsE = kc.getConsumerOffsets(groupId, partitions)

      if (consumerOffsetsE.isLeft)

        throw new SparkException(s"get kafka consumer offsets failed: ${consumerOffsetsE.left.get}")

      val consumerOffsets = consumerOffsetsE.right.get

      KafkaUtils.createDirectStream[K, V, KD, VD, (K, V)](

        ssc, kafkaParams, consumerOffsets, (mmd: MessageAndMetadata[K, V]) => (mmd.key, mmd.message))

    }

    messages

  }

  /**

    * 创建数据流前，根据实际消费情况更新消费offsets

    * @param topics

    * @param groupId

    */

  private def setOrUpdateOffsets(topics: Set[String], groupId: String): Unit = {

    topics.foreach(topic => {

      var hasConsumed = true

      val partitionsE = kc.getPartitions(Set(topic))

      if (partitionsE.isLeft)

        throw new SparkException(s"get kafka partition failed: ${partitionsE.left.get}")

      val partitions = partitionsE.right.get

      val consumerOffsetsE = kc.getConsumerOffsets(groupId, partitions)

      if (consumerOffsetsE.isLeft) hasConsumed = false

      if (hasConsumed) {// 消费过

        /**

          * 如果streaming程序执行的时候出现kafka.common.OffsetOutOfRangeException，

          * 说明zk上保存的offsets已经过时了，即kafka的定时清理策略已经将包含该offsets的文件删除。

          * 针对这种情况，只要判断一下zk上的consumerOffsets和earliestLeaderOffsets的大小，

          * 如果consumerOffsets比earliestLeaderOffsets还小的话，说明consumerOffsets已过时,

          * 这时把consumerOffsets更新为earliestLeaderOffsets

          */

        val earliestLeaderOffsetsE = kc.getEarliestLeaderOffsets(partitions)

        if (earliestLeaderOffsetsE.isLeft)

          throw new SparkException(s"get earliest leader offsets failed: ${earliestLeaderOffsetsE.left.get}")

        val earliestLeaderOffsets = earliestLeaderOffsetsE.right.get

        val consumerOffsets = consumerOffsetsE.right.get

        // 可能只是存在部分分区consumerOffsets过时，所以只更新过时分区的consumerOffsets为earliestLeaderOffsets

        var offsets: Map[TopicAndPartition, Long] = Map()

        consumerOffsets.foreach({ case(tp, n) =>

          val earliestLeaderOffset = earliestLeaderOffsets(tp).offset

          if (n < earliestLeaderOffset) {

            println("consumer group:" + groupId + ",topic:" + tp.topic + ",partition:" + tp.partition +

              " offsets已经过时，更新为" + earliestLeaderOffset)

            offsets += (tp -> earliestLeaderOffset)

          }

        })

        if (!offsets.isEmpty) {

          kc.setConsumerOffsets(groupId, offsets)

        }

      } else {// 没有消费过

      val reset = kafkaParams.get("auto.offset.reset").map(_.toLowerCase)

        var leaderOffsets: Map[TopicAndPartition, LeaderOffset] = null

        if (reset == Some("smallest")) {

          val leaderOffsetsE = kc.getEarliestLeaderOffsets(partitions)

          if (leaderOffsetsE.isLeft)

            throw new SparkException(s"get earliest leader offsets failed: ${leaderOffsetsE.left.get}")

          leaderOffsets = leaderOffsetsE.right.get

        } else {

          val leaderOffsetsE = kc.getLatestLeaderOffsets(partitions)

          if (leaderOffsetsE.isLeft)

            throw new SparkException(s"get latest leader offsets failed: ${leaderOffsetsE.left.get}")

          leaderOffsets = leaderOffsetsE.right.get

        }

        val offsets = leaderOffsets.map {

          case (tp, offset) => (tp, offset.offset)

        }

        kc.setConsumerOffsets(groupId, offsets)

      }

    })

  }

  /**

    * 更新zookeeper上的消费offsets

    * @param rdd

    */

  def updateZKOffsets(rdd: RDD[(String, String)]) : Unit = {

    val groupId = kafkaParams.get("group.id").get

    val offsetsList = rdd.asInstanceOf[HasOffsetRanges].offsetRanges

    for (offsets <- offsetsList) {

      val topicAndPartition = TopicAndPartition(offsets.topic, offsets.partition)

      val o = kc.setConsumerOffsets(groupId, Map((topicAndPartition, offsets.untilOffset)))

      if (o.isLeft) {

        println(s"Error updating the offset to Kafka cluster: ${o.left.get}")

      }

    }

  }

}

　　主程序中

def initKafkaParams = {

    Map[String, String](

      "metadata.broker.list" -> Constants.KAFKA_BROKERS,

      "group.id " -> Constants.KAFKA_CONSUMER_GROUP,

      "fetch.message.max.bytes" -> "20971520",

      "auto.offset.reset" -> "smallest"

    )

  } 

// kafka参数

val kafkaParams = initKafkaParams

val manager = new KafkaManager(kafkaParams)

val messageDstream = manager.createDirectStream[String, String, StringDecoder, StringDecoder](ssc, kafkaParams, Set(topic)) 

// 更新offsets

manager.updateZKOffsets(rdd)

Spark createDirectStream 维护 Kafka offset（Scala）的更多相关文章

Spark自定义维护kafka的offset到zk
import kafka.common.TopicAndPartition import kafka.message.MessageAndMetadata import kafka.serialize ...
spark streaming中维护kafka偏移量到外部介质
spark streaming中维护kafka偏移量到外部介质以kafka偏移量维护到redis为例. redis存储格式使用的数据结构为string,其中key为topic:partition, ...
scala spark-streaming整合kafka （spark 2.3 kafka 0.10）
Maven组件如下: ) { System.err.println() } StreamingExamples.setStreamingLogLevels() )) ) { System.) } )) ...
spark streaming从指定offset处消费Kafka数据
spark streaming从指定offset处消费Kafka数据 -- : 770人阅读评论() 收藏举报分类: spark() 原文地址:http://blog.csdn.net/high ...
Spark Streaming消费Kafka Direct保存offset到Redis，实现数据零丢失和exactly once
一.概述上次写这篇文章文章的时候,Spark还是1.x,kafka还是0.8x版本,转眼间spark到了2.x,kafka也到了2.x,存储offset的方式也发生了改变,笔者根据上篇文章和网上文章 ...
【转】Spark Streaming和Kafka整合开发指南
基于Receivers的方法这个方法使用了Receivers来接收数据.Receivers的实现使用到Kafka高层次的消费者API.对于所有的Receivers,接收到的数据将会保存在Spark ...
基于Spark Streaming + Canal + Kafka对Mysql增量数据实时进行监测分析
Spark Streaming可以用于实时流项目的开发,实时流项目的数据源除了可以来源于日志.文件.网络端口等,常常也有这种需求,那就是实时分析处理MySQL中的增量数据.面对这种需求当然我们可以通过 ...
spark streaming 整合kafka(二)
转载:https://www.iteblog.com/archives/1326.html 和基于Receiver接收数据不一样,这种方式定期地从Kafka的topic+partition中查询最新的 ...
Spark之 Spark Streaming整合kafka(Java实现版本)
pom依赖 <properties> <scala.version>2.11.8</scala.version> <hadoop.version>2.7 ...

随机推荐

mvn常用的构建命令
mvn -v 查看maven版本 mvn compile 编译 mvn test 测试 mvn package 打包 mvn clean 删除target mvn install 安装jar包到本地仓 ...
hdu 2215 & hdu 3932(最小覆盖圆)
Maple trees Time Limit: 1000/1000 MS (Java/Others) Memory Limit: 32768/32768 K (Java/Others)Total ...
C指针详解
前言:复杂类型说明要了解指针,多多少少会出现一些比较复杂的类型,所以我先介绍一下如何完全理解一个复杂类型,要理解复杂类型其实很简单,一个类型里会出现很多运算符,他们也像普通的表达式一样,有优先级,其 ...
百度之星资格赛 2016 Problem 1004
本文链接:http://www.cnblogs.com/Ash-ly/p/5494630.html 题意: 熊所居住的 D 国,是一个完全尊重人权的国度.以至于这个国家的所有人命名自己的名字都非常奇怪 ...
CodeForces 669B
链接:http://codeforces.com/problemset/problem/669/B 本文链接:http://www.cnblogs.com/Ash-ly/p/5443086.html ...
The 15th Zhejiang Provincial Collegiate Programming Contest Sponsored by TuSimple -A Peak
Peak Time Limit: 1 Second Memory Limit: 65536 KB A sequence of integers is called a peak, if ...
uva11168
uva11168 题意给出一些点坐标,选定一条直线,所有点在直线一侧(或直线上),使得所有点到直线的距离平均值最小. 分析显然直线一定会经过某两点(或一点),又要求点在直线某一侧,可以直接求出凸包 ...
NOIP2018提高组模拟题（五）
字符串(string) Description 小林与亮亮正在做一个游戏.小林随意地写出一个字符串,字符串只由大写字母组成,然后指定一个非负整数 m,亮亮可以进行至多 m 次操作,每次操作为交换相 ...
ASP.NET Core 2.2 基础知识(十八) 托管和部署概述
为了方便演示,以 .NET Core 控制台应用程序讲解. 我们新建一个控制台应用程序,安装 "Newtonsoft.Json" Nuget 包,然后右键点击该项目,选择" ...
前端面试题 vue
webpack 作用:webpack是把项目当作一个整体,通过一个给定的的主文件,webpack将从这个文件开始找到你的项目的所有依赖文件,使用loaders处理它们,最后打包成一个或多个浏览器可识别 ...

Spark createDirectStream 维护 Kafka offset（Scala）

Spark createDirectStream 维护 Kafka offset（Scala）的更多相关文章

随机推荐

热门专题