Spark2.11 两种流操作 + Kafka

Spark2.x 自从引入了 Structured Streaming 后，未来数据操作将逐步转化到 DataFrame/DataSet，以下将介绍 Spark2.x 如何与 Kafka0.10+整合

Structured Streaming + Kafka

引包

groupId = org.apache.spark

artifactId = spark-sql-kafka-0-10_2.11

version = 2.1.1

为了让更直观的展示包的依赖，以下是我的工程 sbt 文件

name := "spark-test"

version := "1.0"

scalaVersion := "2.11.7"

// https://mvnrepository.com/artifact/org.apache.spark/spark-core_2.11

libraryDependencies += "org.apache.spark" % "spark-core_2.11" % "2.1.1" % "provided"

// https://mvnrepository.com/artifact/org.apache.spark/spark-mllib_2.11

libraryDependencies += "org.apache.spark" % "spark-mllib_2.11" % "2.1.1" % "provided"

// https://mvnrepository.com/artifact/org.apache.spark/spark-streaming_2.11

libraryDependencies += "org.apache.spark" % "spark-streaming_2.11" % "2.1.1" % "provided"

// https://mvnrepository.com/artifact/org.apache.hadoop/hadoop-client

libraryDependencies += "org.apache.hadoop" % "hadoop-client" % "2.7.3"

// https://mvnrepository.com/artifact/mysql/mysql-connector-java

libraryDependencies += "mysql" % "mysql-connector-java" % "5.1.38"

// https://mvnrepository.com/artifact/org.apache.kafka/kafka_2.11

libraryDependencies += "org.apache.kafka" % "kafka_2.11" % "0.10.2.1"

//libraryDependencies += "org.apache.spark" % "spark-streaming-kafka-0-10_2.11" % "2.1.1"

libraryDependencies += "org.apache.spark" % "spark-sql-kafka-0-10_2.11" % "2.1.1"

Structured Streaming 连接 Kafka

def main(args: Array[String]): Unit = {

    val spark = SparkSession

      .builder()

      .appName("Spark structured streaming Kafka example")

      //      .master("local[2]")

      .getOrCreate()

    val inputstream = spark.readStream

      .format("kafka")

      .option("kafka.bootstrap.servers", "127.0.0.1:9092")

      .option("subscribe", "testss")

      .load()

    import spark.implicits._

    val query = inputstream.select($"key", $"value")

      .as[(String, String)].map(kv => kv._1 + " " + kv._2).as[String]

      .writeStream

      .outputMode("append")

      .format("console")

      .start()

    query.awaitTermination()

  }

流的元数据如下

Column	Type
key	binary
value	binary
topic	string
partition	int
offset	long
timestamp	long
timestampType	int

可配参数

Option	value	meaning
assign	json string {"topicA":[0,1],"topicB":[2,4]}	用于指定消费的 TopicPartitions，`assign`，`subscribe`，`subscribePattern` 是三种消费方式，只能同时指定一个
subscribe	A comma-separated list of topics	用于指定要消费的 topic
subscribePattern	Java regex string	使用正则表达式匹配消费的 topic
kafka.bootstrap.servers	A comma-separated list of host:port	kafka brokers

不能配置的参数

group.id: 对每个查询，kafka 自动创建一个唯一的 group
auto.offset.reset: 可以通过 startingOffsets 指定，Structured Streaming 会对任何流数据维护 offset, 以保证承诺的 exactly once.
key.deserializer: 在 DataFrame 上指定，默认 ByteArrayDeserializer
value.deserializer: 在 DataFrame 上指定，默认 ByteArrayDeserializer
enable.auto.commit:
interceptor.classes:

Stream + Kafka

从最新offset开始消费

def main(args: Array[String]): Unit = {

	val kafkaParams = Map[String, Object](

	  "bootstrap.servers" -> "localhost:9092",

	  "key.deserializer" -> classOf[StringDeserializer],

	  "value.deserializer" -> classOf[StringDeserializer],

	  "group.id" -> "use_a_separate_group_id_for_each_stream",

	  "auto.offset.reset" -> "latest",

	  "enable.auto.commit" -> (false: java.lang.Boolean)

	)

	val ssc =new StreamingContext(OpContext.sc, Seconds(2))

	val topics = Array("test")

	val stream = KafkaUtils.createDirectStream[String, String](

	  ssc,

	  PreferConsistent,

	  Subscribe[String, String](topics, kafkaParams)

	)

	stream.foreachRDD(rdd=>{

	  val offsetRanges=rdd.asInstanceOf[HasOffsetRanges].offsetRanges

	  rdd.foreachPartition(iter=>{

		val o: OffsetRange = offsetRanges(TaskContext.get.partitionId)

		println(s"${o.topic} ${o.partition} ${o.fromOffset} ${o.untilOffset}")

	  })

	  stream.asInstanceOf[CanCommitOffsets].commitAsync(offsetRanges)

	})

//    stream.map(record => (record.key, record.value)).print(1)

	ssc.start()

	ssc.awaitTermination()

  }

从指定的offset开始消费

def main(args: Array[String]): Unit = {

  val kafkaParams = Map[String, Object](

	"bootstrap.servers" -> "localhost:9092",

	"key.deserializer" -> classOf[StringDeserializer],

	"value.deserializer" -> classOf[StringDeserializer],

	"group.id" -> "use_a_separate_group_id_for_each_stream",

	//      "auto.offset.reset" -> "latest",

	"enable.auto.commit" -> (false: java.lang.Boolean)

  )

  val ssc = new StreamingContext(OpContext.sc, Seconds(2))

  val fromOffsets = Map(new TopicPartition("test", 0) -> 1100449855L)

  val stream = KafkaUtils.createDirectStream[String, String](

	ssc,

	PreferConsistent,

	Assign[String, String](fromOffsets.keys.toList, kafkaParams, fromOffsets)

  )

  stream.foreachRDD(rdd => {

	val offsetRanges = rdd.asInstanceOf[HasOffsetRanges].offsetRanges

	for (o <- offsetRanges) {

	  println(s"${o.topic} ${o.partition} ${o.fromOffset} ${o.untilOffset}")

	}

	stream.asInstanceOf[CanCommitOffsets].commitAsync(offsetRanges)

  })

  //    stream.map(record => (record.key, record.value)).print(1)

  ssc.start()

  ssc.awaitTermination()

}

Streaming结合Kafka的更多相关文章

spark streaming 对接kafka记录
spark streaming 对接kafka 有两种方式: 参考: http://group.jobbole.com/15559/ http://blog.csdn.net/kwu_ganymede ...
Spark Streaming、Kafka结合Spark JDBC External DataSouces处理案例
场景:使用Spark Streaming接收Kafka发送过来的数据与关系型数据库中的表进行相关的查询操作: Kafka发送过来的数据格式为:id.name.cityId,分隔符为tab zhangs ...
【转】Spark Streaming和Kafka整合开发指南
基于Receivers的方法这个方法使用了Receivers来接收数据.Receivers的实现使用到Kafka高层次的消费者API.对于所有的Receivers,接收到的数据将会保存在Spark ...
Structured Streaming从Kafka 0.8中读取数据的问题
众所周知,Structured Streaming默认支持Kafka 0.10,没有提供针对Kafka 0.8的Connector,但这对高手来说不是事儿,于是有个Hortonworks的邵大牛(前段 ...
Spark streaming消费Kafka的正确姿势
前言在游戏项目中,需要对每天千万级的游戏评论信息进行词频统计,在生产者一端,我们将数据按照每天的拉取时间存入了Kafka当中,而在消费者一端,我们利用了spark streaming从kafka中不 ...
Spark Streaming和Kafka整合保证数据零丢失
当我们正确地部署好Spark Streaming,我们就可以使用Spark Streaming提供的零数据丢失机制.为了体验这个关键的特性,你需要满足以下几个先决条件: 1.输入的数据来自可靠的数据源 ...
spark streaming集成kafka
Kakfa起初是由LinkedIn公司开发的一个分布式的消息系统,后成为Apache的一部分,它使用Scala编写,以可水平扩展和高吞吐率而被广泛使用.目前越来越多的开源分布式处理系统如Clouder ...
spark streaming 整合 kafka(一)
转载:https://www.iteblog.com/archives/1322.html Apache Kafka是一个分布式的消息发布-订阅系统.可以说,任何实时大数据处理工具缺少与Kafka整合 ...
Kafka：ZK+Kafka+Spark Streaming集群环境搭建（十一）定制一个arvo格式文件发送到kafka的topic，通过Structured Streaming读取kafka的数据
将arvo格式数据发送到kafka的topic 第一步:定制avro schema: { "type": "record", "name": ...

随机推荐

如何通过 WebP 自适应方案减少图片资源大小
前言我们知道,理想的网页应该在 1 秒内打开,而在页面的整体大小中,图片往往是所占比例最大的一部分(大约占到 60% 以上,更多了解请点击),也可以参照如下图所示.优化图片不仅可以加快页面显示,还能 ...
jQuery选择器的分类之过滤选择器
jQuery选择器的分类之过滤选择器上一篇文章为大家简单呢的介绍了jQuery选择器中的基本选择器,层级选择器,表单选择器,接下来就带大家了解一下过滤选择器... 过滤选择器都分为哪些??? 1.基 ...
NancyFx 2.0的开源框架的使用-CustomModule(自定义模块)
NancyFx框架的自定义模块新建一个空的Web项目然后通过NuGet库安装下面的包 Nancy Nancy.Hosting.Aspnet 然后添加Models,Module,Views三个文件夹 ...
Linux 下按时间顺序批量删除文件
ls -lrt| awk '{print $9}'| head -n 10 | xargs rm -rf 1.文件按时间排序: 2.获取文件名字: 3.取前10个文件 4.删除文件
JAVA – 虚函数、抽象函数、抽象类、接口
本文转载地址:http://blog.csdn.net/trojanpizza/article/details/6556604 1. Java虚函数虚函数的存在是为了多态. C++中普通成员函数加 ...
ke
#include <stdio.h> #include <stdlib.h> // For rand() and srand() #include <time.h> ...
《安卓网络编程》之第一篇 java环境下模拟客户端、服务器端
1.Socket简介在网络上的两个程序通过一个双向的通信连接实现数据的交换,这个双向链路的一端称为一个Socket.Socket通常用来实现客户方和服务方的连接.Socket是TCP/IP协议的一个 ...
Html_Task4(知识点：水平居中+垂直居中/position/float/border-radius)
任务四:定位和居中问题任务目标实践HTML/CSS布局方式深入了解position等CSS属性任务描述实现如示例图(点击打开) 的效果灰色元素水平垂直居中,有两个四分之一圆位于其左上角和 ...
无声的吐槽csdn
上次朋友聚会,说csdn挺好的,我琢磨着,那好我也去注册一个.经过n次的注册(用户名那边老是验证不过,不给中文开头,然后随便填了一个),终于搞定了! 我想,不错啊,做了这么多限制,挺安全的感觉.然后我 ...
sparklyr包：实现Spark与R的接口
日前,Rstudio公司发布了sparklyr包.该包具有以下几个功能: 实现R与Spark的连接—sparklyr包提供了一个完整的dplyr后端筛选并聚合Spark数据集,接着在R中实现分析与可 ...

Streaming结合Kafka

Spark2.11 两种流操作 + Kafka

Structured Streaming + Kafka

Stream + Kafka

Streaming结合Kafka的更多相关文章

随机推荐

热门专题