Spark createDirectStream 维护 Kafka offset（Scala）

createDirectStream方式需要自己维护offset，使程序可以实现中断后从中断处继续消费数据。

KafkaManager.scala

import kafka.common.TopicAndPartition

import kafka.message.MessageAndMetadata

import kafka.serializer.Decoder

import org.apache.spark.SparkException

import org.apache.spark.rdd.RDD

import org.apache.spark.streaming.StreamingContext

import org.apache.spark.streaming.dstream.InputDStream

import org.apache.spark.streaming.kafka.KafkaCluster.LeaderOffset

import scala.reflect.ClassTag

/**

  * Created by knowpigxia on 15-8-5.

  */

class KafkaManager(val kafkaParams: Map[String, String]) extends Serializable {

  private val kc = new KafkaCluster(kafkaParams)

  /**

    * 创建数据流

    * @param ssc

    * @param kafkaParams

    * @param topics

    * @tparam K

    * @tparam V

    * @tparam KD

    * @tparam VD

    * @return

    */

  def createDirectStream[K: ClassTag, V: ClassTag, KD <: Decoder[K]: ClassTag, VD <: Decoder[V]: ClassTag](

                                                                                                            ssc: StreamingContext,

                                                                                                            kafkaParams: Map[String, String],

                                                                                                            topics: Set[String]): InputDStream[(K, V)] =  {

    val groupId = kafkaParams.get("group.id").get

    // 在zookeeper上读取offsets前先根据实际情况更新offsets

    setOrUpdateOffsets(topics, groupId)

    //从zookeeper上读取offset开始消费message

    val messages = {

      val partitionsE = kc.getPartitions(topics)

      if (partitionsE.isLeft)

        throw new SparkException(s"get kafka partition failed: ${partitionsE.left.get}")

      val partitions = partitionsE.right.get

      val consumerOffsetsE = kc.getConsumerOffsets(groupId, partitions)

      if (consumerOffsetsE.isLeft)

        throw new SparkException(s"get kafka consumer offsets failed: ${consumerOffsetsE.left.get}")

      val consumerOffsets = consumerOffsetsE.right.get

      KafkaUtils.createDirectStream[K, V, KD, VD, (K, V)](

        ssc, kafkaParams, consumerOffsets, (mmd: MessageAndMetadata[K, V]) => (mmd.key, mmd.message))

    }

    messages

  }

  /**

    * 创建数据流前，根据实际消费情况更新消费offsets

    * @param topics

    * @param groupId

    */

  private def setOrUpdateOffsets(topics: Set[String], groupId: String): Unit = {

    topics.foreach(topic => {

      var hasConsumed = true

      val partitionsE = kc.getPartitions(Set(topic))

      if (partitionsE.isLeft)

        throw new SparkException(s"get kafka partition failed: ${partitionsE.left.get}")

      val partitions = partitionsE.right.get

      val consumerOffsetsE = kc.getConsumerOffsets(groupId, partitions)

      if (consumerOffsetsE.isLeft) hasConsumed = false

      if (hasConsumed) {// 消费过

        /**

          * 如果streaming程序执行的时候出现kafka.common.OffsetOutOfRangeException，

          * 说明zk上保存的offsets已经过时了，即kafka的定时清理策略已经将包含该offsets的文件删除。

          * 针对这种情况，只要判断一下zk上的consumerOffsets和earliestLeaderOffsets的大小，

          * 如果consumerOffsets比earliestLeaderOffsets还小的话，说明consumerOffsets已过时,

          * 这时把consumerOffsets更新为earliestLeaderOffsets

          */

        val earliestLeaderOffsetsE = kc.getEarliestLeaderOffsets(partitions)

        if (earliestLeaderOffsetsE.isLeft)

          throw new SparkException(s"get earliest leader offsets failed: ${earliestLeaderOffsetsE.left.get}")

        val earliestLeaderOffsets = earliestLeaderOffsetsE.right.get

        val consumerOffsets = consumerOffsetsE.right.get

        // 可能只是存在部分分区consumerOffsets过时，所以只更新过时分区的consumerOffsets为earliestLeaderOffsets

        var offsets: Map[TopicAndPartition, Long] = Map()

        consumerOffsets.foreach({ case(tp, n) =>

          val earliestLeaderOffset = earliestLeaderOffsets(tp).offset

          if (n < earliestLeaderOffset) {

            println("consumer group:" + groupId + ",topic:" + tp.topic + ",partition:" + tp.partition +

              " offsets已经过时，更新为" + earliestLeaderOffset)

            offsets += (tp -> earliestLeaderOffset)

          }

        })

        if (!offsets.isEmpty) {

          kc.setConsumerOffsets(groupId, offsets)

        }

      } else {// 没有消费过

      val reset = kafkaParams.get("auto.offset.reset").map(_.toLowerCase)

        var leaderOffsets: Map[TopicAndPartition, LeaderOffset] = null

        if (reset == Some("smallest")) {

          val leaderOffsetsE = kc.getEarliestLeaderOffsets(partitions)

          if (leaderOffsetsE.isLeft)

            throw new SparkException(s"get earliest leader offsets failed: ${leaderOffsetsE.left.get}")

          leaderOffsets = leaderOffsetsE.right.get

        } else {

          val leaderOffsetsE = kc.getLatestLeaderOffsets(partitions)

          if (leaderOffsetsE.isLeft)

            throw new SparkException(s"get latest leader offsets failed: ${leaderOffsetsE.left.get}")

          leaderOffsets = leaderOffsetsE.right.get

        }

        val offsets = leaderOffsets.map {

          case (tp, offset) => (tp, offset.offset)

        }

        kc.setConsumerOffsets(groupId, offsets)

      }

    })

  }

  /**

    * 更新zookeeper上的消费offsets

    * @param rdd

    */

  def updateZKOffsets(rdd: RDD[(String, String)]) : Unit = {

    val groupId = kafkaParams.get("group.id").get

    val offsetsList = rdd.asInstanceOf[HasOffsetRanges].offsetRanges

    for (offsets <- offsetsList) {

      val topicAndPartition = TopicAndPartition(offsets.topic, offsets.partition)

      val o = kc.setConsumerOffsets(groupId, Map((topicAndPartition, offsets.untilOffset)))

      if (o.isLeft) {

        println(s"Error updating the offset to Kafka cluster: ${o.left.get}")

      }

    }

  }

}

　　主程序中

def initKafkaParams = {

    Map[String, String](

      "metadata.broker.list" -> Constants.KAFKA_BROKERS,

      "group.id " -> Constants.KAFKA_CONSUMER_GROUP,

      "fetch.message.max.bytes" -> "20971520",

      "auto.offset.reset" -> "smallest"

    )

  } 

// kafka参数

val kafkaParams = initKafkaParams

val manager = new KafkaManager(kafkaParams)

val messageDstream = manager.createDirectStream[String, String, StringDecoder, StringDecoder](ssc, kafkaParams, Set(topic)) 

// 更新offsets

manager.updateZKOffsets(rdd)

Spark createDirectStream 维护 Kafka offset（Scala）的更多相关文章

Spark自定义维护kafka的offset到zk
import kafka.common.TopicAndPartition import kafka.message.MessageAndMetadata import kafka.serialize ...
spark streaming中维护kafka偏移量到外部介质
spark streaming中维护kafka偏移量到外部介质以kafka偏移量维护到redis为例. redis存储格式使用的数据结构为string,其中key为topic:partition, ...
scala spark-streaming整合kafka （spark 2.3 kafka 0.10）
Maven组件如下: ) { System.err.println() } StreamingExamples.setStreamingLogLevels() )) ) { System.) } )) ...
spark streaming从指定offset处消费Kafka数据
spark streaming从指定offset处消费Kafka数据 -- : 770人阅读评论() 收藏举报分类: spark() 原文地址:http://blog.csdn.net/high ...
Spark Streaming消费Kafka Direct保存offset到Redis，实现数据零丢失和exactly once
一.概述上次写这篇文章文章的时候,Spark还是1.x,kafka还是0.8x版本,转眼间spark到了2.x,kafka也到了2.x,存储offset的方式也发生了改变,笔者根据上篇文章和网上文章 ...
【转】Spark Streaming和Kafka整合开发指南
基于Receivers的方法这个方法使用了Receivers来接收数据.Receivers的实现使用到Kafka高层次的消费者API.对于所有的Receivers,接收到的数据将会保存在Spark ...
基于Spark Streaming + Canal + Kafka对Mysql增量数据实时进行监测分析
Spark Streaming可以用于实时流项目的开发,实时流项目的数据源除了可以来源于日志.文件.网络端口等,常常也有这种需求,那就是实时分析处理MySQL中的增量数据.面对这种需求当然我们可以通过 ...
spark streaming 整合kafka(二)
转载:https://www.iteblog.com/archives/1326.html 和基于Receiver接收数据不一样,这种方式定期地从Kafka的topic+partition中查询最新的 ...
Spark之 Spark Streaming整合kafka(Java实现版本)
pom依赖 <properties> <scala.version>2.11.8</scala.version> <hadoop.version>2.7 ...

随机推荐

【C++】类的特殊成员变量+初始化列表
参考资料: 1.黄邦勇帅 2.http://blog.163.com/sunshine_linting/blog/static/448933232011810101848652/ 3.http://w ...
c语言中Triplet是什么意思？
此词条多出现于三元组抽象数据类型的定义. 例如: 数据结构编程试验中,构造三元组类型. 1．三元组抽象数据类型的定义 ADT Triplet { 数据对象:D={e1, e2, e3| e1, e2, ...
Android 使用WebView控件展示SVG图
1.添加布局界面代码: <LinearLayout xmlns:android="http://schemas.android.com/apk/res/android" xm ...
ubuntu 16.04 qtcreator 闪退
当用QtCreator 进行代码自动补全时,比如编写ros代码,ROS_INFO时候就会出现闪退,后面按照 http://doc.qt.io/qtcreator/creator-clang-codem ...
【cocos2d-js官方文档】二十一、v3相对于v2版本的api变动
分类: cocos2d-js(28) 目录(?)[+] CCAudio.js SimpleAudioEngine.js改名为CCAudio.js. AudioEngine中删除了以下几个方法: pre ...
selenium 定位
一 . chrome的调试工具 1)在chrome界面,按F12快捷键,弹出chrome的调试工具 2)找出登录按钮的id和username.password的id 二．XPath工具安装为了提 ...
字典树（Trie Tree）
终于要开始更新我的ACM学习之路了,不过没想到却是因为一次Java大作业,有趣,%yuan老师. 字典树是一种很简单的树形结构,主要用来进行词频统计,在算法竞赛中有时也会碰到. 字典树的基本思路是,通 ...
POJ1251 Jungle Roads(Kruskal)(并查集）
Jungle Roads Time Limit: 1000MS Memory Limit: 10000K Total Submissions: 23882 Accepted: 11193 De ...
表（Table）
虽然我们已经将不同用途的物品保存在不同的仓库中了,但是在同一个仓库中数据的保存仍然存在问题.比如食品分为熟食.生肉.大米等,如果把他们随意的堆放在一起,就会造成我们无法很容易的对这些食品进行管理,当要 ...
对三个数排序 Exercise06_05
import java.util.Scanner; /** * @author 冰樱梦 * 时间:2018年下半年 * 题目:对三个数排序 * */ public class Exercise06_0 ...

Spark createDirectStream 维护 Kafka offset（Scala）

Spark createDirectStream 维护 Kafka offset（Scala）的更多相关文章

随机推荐

热门专题