flink 根据时间消费kafka

经常遇到这样的场景,13点-14点的时候flink程序发生了故障,或者集群崩溃,导致实时程序挂掉1小时,程序恢复的时候想把程序倒回13点或者更前,重新消费kafka中的数据.

下面的代码就是根据指定时间戳(也可以换算成时间)开始消费数据,支持到这样就灵活了,可以在启动命令中加个参数,然后再配个守护程序来控制程序.

flink代码

import java.util.Properties

import org.apache.flink.streaming.api.scala._

import org.apache.flink.streaming.connectors.kafka.FlinkKafkaConsumer010

import org.apache.flink.streaming.connectors.kafka.internals.KafkaTopicPartition

import org.cdp.kafka.KafkaOffsetFind

object flinkkafka1 {

  def main(args: Array[String]): Unit = {

    /** ***************************************************************************************************************

      * kafka info

      */

    val zkCluster = "localhost:2181"

    val kafkaCluster = "localhost:9092"

    val topic = "cdp20"

    val timestamp = 1519804800000L

    /** ***************************************************************************************************************

      * flink env

      */

    val env = StreamExecutionEnvironment.getExecutionEnvironment

    /** ***************************************************************************************************************

      * create kafka stream

      */

    val props = new Properties()

    props.setProperty("bootstrap.servers", kafkaCluster)

    props.setProperty("zookeeper.connect", zkCluster)

    props.put("key.deserializer", "org.apache.kafka.common.serialization.StringDeserializer")

    props.put("value.deserializer", "org.apache.kafka.common.serialization.StringDeserializer")

    props.setProperty("group.id", "cdp20-c1")

    /* ***********************************************************************************************************

     * stream

     */

    //找到时间戳对应偏移量

    val offsetFinder = new KafkaOffsetFind[String]

    val offset = offsetFinder.useTimestamp(timestamp,topic,props)

    print(offset)

    val kafkaOffsets = new java.util.HashMap[KafkaTopicPartition, java.lang.Long]

    for (o <- offset) {

      kafkaOffsets.put(new KafkaTopicPartition(topic, o._1), o._2)

    }

    //创建根据时间消费kafka的数据流

    val kafkaTime = env

      .addSource {

        new FlinkKafkaConsumer010[String](topic,

          new KeyedDeserializationSchemaWithKey(new DefaultStringDeserializer),

          props)

          .setStartFromSpecificOffsets(kafkaOffsets)

      }

    /** ***************************************************************************************************************

      * exec

      */

    kafkaTime.print()

    /** ***************************************************************************************************************

      * flink execute

      */

    env.execute("flink-kafka")

  }

}

kafka根据时间找偏移量代码

import java.util

import java.util.Properties

import org.apache.kafka.clients.consumer.KafkaConsumer

import org.apache.kafka.common.TopicPartition

import scala.collection.JavaConverters._

/* ***********************************************************************************************************

 * 作者：陈大炮

 * 时间：2018-02-28

 * 内容：根据时间消费kafka

 *      使用unix时间戳,查找kafka分区对应的偏移量

 */

class KafkaOffsetFind[T] {

  //超时时间

  val POLL_TIMEOUT = 2000

  //使用时间查询

  def useTimestamp(timestamp: Long, topic: String, kafkaProps: Properties): List[(Int, Long)] = {

    //创建消费者,获得消费者分区

    val consumer = createConsumer(kafkaProps)

    consumer.subscribe(util.Arrays.asList(topic))

    consumer.poll(POLL_TIMEOUT)

    val partitions = consumer.assignment().asScala.toList

    //拼出一个查询map

    val findMap = new util.HashMap[TopicPartition, java.lang.Long]

    partitions

      .foreach {

        c =>

          findMap.put(new TopicPartition(topic, c.partition()), timestamp)

      }

    //使用查询map去获得偏移量

    val offsetMap = consumer.offsetsForTimes(findMap)

    //返回前关闭下消费者

    consumer.close()

    //返回分区号和对应的偏移量

    partitions.map {

      p =>

        (p.partition(), offsetMap.get(new TopicPartition(topic, 0)).offset())

    }

  }

  //创建消费者

  protected def createConsumer(kafkaProps: Properties): KafkaConsumer[String, T] = {

    val props = kafkaProps.clone().asInstanceOf[Properties]

    props.put("enable.auto.commit", "false")

    props.put("key.deserializer", "org.apache.kafka.common.serialization.StringDeserializer")

    props.put("value.deserializer", "org.apache.kafka.common.serialization.StringDeserializer")

    new KafkaConsumer[String, T](props)

  }

}

注意事项（由漂泊的美好提供）

1.使用KafkaConsumer.offsetsForTimes要确认集群已开启log.message.timestamp.type参数

2.client端要使用0.10.*的客户端发送数据，使用低版本会造成数据格式不同问题

参考内容

http://blog.csdn.net/forrest_ou/article/details/78978575

https://github.com/noris-network/KafkaOffsetFinder

flink 根据时间消费kafka的更多相关文章

Flink(五) 【消费kafka】
目录 0.目的 1.本地测试 2.线上测试提交作业 0.目的测试flink消费kafka的几种消费策略 kafkaSource.setStartFromEarliest() //从起始位置 kaf ...
Flink消费Kafka到HDFS实现及详解
1.概述最近有同学留言咨询,Flink消费Kafka的一些问题,今天笔者将用一个小案例来为大家介绍如何将Kafka中的数据,通过Flink任务来消费并存储到HDFS上. 2.内容这里举个消费Kaf ...
Flink消费Kafka数据并把实时计算的结果导入到Redis
1. 完成的场景在很多大数据场景下,要求数据形成数据流的形式进行计算和存储.上篇博客介绍了Flink消费Kafka数据实现Wordcount计算,这篇博客需要完成的是将实时计算的结果写到redis. ...
Flink消费kafka
Flink消费Kafka https://blog.csdn.net/boling_cavalry/article/details/85549434 https://www.cnblogs.com/s ...
Spark Streaming消费Kafka Direct方式数据零丢失实现
使用场景 Spark Streaming实时消费kafka数据的时候,程序停止或者Kafka节点挂掉会导致数据丢失,Spark Streaming也没有设置CheckPoint(据说比较鸡肋,虽然可以 ...
17-Flink消费Kafka写入Mysql
戳更多文章: 1-Flink入门 2-本地环境搭建&构建第一个Flink应用 3-DataSet API 4-DataSteam API 5-集群部署 6-分布式缓存 7-重启策略 8-Fli ...
Spark streaming消费Kafka的正确姿势
前言在游戏项目中,需要对每天千万级的游戏评论信息进行词频统计,在生产者一端,我们将数据按照每天的拉取时间存入了Kafka当中,而在消费者一端,我们利用了spark streaming从kafka中不 ...
《从0到1学习Flink》—— Flink 写入数据到 Kafka
前言之前文章 <从0到1学习Flink>-- Flink 写入数据到 ElasticSearch 写了如何将 Kafka 中的数据存储到 ElasticSearch 中,里面其实就已经用 ...
Spark Streaming消费Kafka Direct保存offset到Redis，实现数据零丢失和exactly once
一.概述上次写这篇文章文章的时候,Spark还是1.x,kafka还是0.8x版本,转眼间spark到了2.x,kafka也到了2.x,存储offset的方式也发生了改变,笔者根据上篇文章和网上文章 ...

随机推荐

通过u盘启动盘重装系统
前言:一直想通过u盘启动盘给旧本装个win7,但是发现网上完整的教程很少.这里分享给大家我重装的一些步骤和遇到的问题. 前期准备: 1.我们要准备一个容量在4G以上的U盘. 2.我们要将U盘中的重要数 ...
lua垃圾回收之空表
故事背景: 自己手动手写的一个lua外部库luaopen_xxx,采用了tolua++1.0.93,编译后得到xxx.dll,当在luajit中require 'xxx'后是正常的,但如果运行环境换成 ...
December 28th 2016 Week 53rd Wednesday
Knowledge is a treasure, but practice is the key to it. 知识是珍宝,而实践是获取她的钥匙. I know a lot, but what I r ...
ZT A2DP协议笔记
A2DP协议笔记 (2013-07-30 10:07:54) 转载▼ 标签: a2dp bluetooth src sink 分类: Bluetooth 1.概述 A2DP(Advanced ...
jq实现从容器中间扩散的方式显示文字
<!DOCTYPE html> <html lang="en"> <head> <meta charset="UTF-8&quo ...
BZOJ 2038 小Z的袜子(hose) 莫队算法模板题
题目链接: https://www.lydsy.com/JudgeOnline/problem.php?id=2038 题目大意: 作为一个生活散漫的人,小Z每天早上都要耗费很久从一堆五颜六色的袜子中 ...
ZooKeeper学习之路（五）ZooKeeper API的简单使用增删改查
zookeeper文件系统的增删改查 public class ZKDemo1 { private static final String CONNECT_STRING = "hadoop1 ...
对json的理解？
回答一: a.JSON对象:以 ”{“ 开始,以 ”}” 结束,里面则是一系列的键(key)值(value)对,键和值用 ”:” 分开,每对键值对之间用 ”,” 分开.参考以下语法: {key1:va ...
LayIM.AspNetCore Middleware 开发日记（七）Asp.Net.Core.SignalR闪亮登场
前言前几篇介绍了整个中间件的构成,路由,基本配置等等.基本上没有涉及到通讯部分.不过已经实现了融云的通讯功能,由于是第三方的就不在单独去写.正好.NET Core SignalR已经出来好久了, ...
Markdown语法初体验
前言由于把博客主题样式换了,所以改用Markdown语法,让代码看起来更加舒服一些. 照葫芦画瓢这里是H1标题(===) 这里是H2标题(---) 使用一个#号使用两个#号使用三个#号引用 ...

flink 根据时间消费kafka

flink代码

kafka根据时间找偏移量代码

flink 根据时间消费kafka的更多相关文章

随机推荐

热门专题