SparkStreaming+kafka Receiver模式

云山之巅 2024-09-19 22:45:40 原文

1.图解

　　

2.过程

　　1.使用Kafka的High Level Consumer API 实现，消费者不能自己去维护消费者offset，而且kafka也不关心数据是否丢失。

　　2.当向zookeeper中更新完offset后，Driver如果挂到，Driver下的Executors会被kill掉，会造成数据丢失。

　　3.开启WAL【Write Ahead Log】预写日志机制，将数据备份到HDFS中一份，再去更新zookeeper中的offset，此时需调整spark存储基本，去掉备份两次【MEMORY_AND_DISK_SER_2中的_2】。开启WAL机制会加大application处理的时间。

3.特点

　　1.receiver模式依赖zookeeper管理offset。

　　2.receiver模式的并行度由spark.streaming.blockInterval决定，默认是200ms。

　　3.receiver模式接收block.batch数据后会封装到RDD中，这里的block对应RDD中的partition。

　　4.在batchInterval一定的情况下，减少spark.streaming.Interval参数值，会增大DStream中的partition个数，建议spark.streaming.Interval最低不能低于50ms。

4.代码实现

package big.data.analyse.streaming

import org.apache.spark.storage.StorageLevel

import org.apache.spark.streaming.kafka.KafkaUtils

import org.apache.spark.streaming.{Seconds, StreamingContext}

import org.apache.spark.{SparkContext, SparkConf}

/**

  * Created by zhen on 2019/5/11.

  */

object SparkStreamingReceiverKafka {

  def main(args: Array[String]) {

    val conf = new SparkConf()

    conf.setAppName("SparkStreamingReceiverKafka")

    conf.set("spark.streaming.kafka.maxRatePerPartition", "")

    conf.setMaster("local[2]")

    val sc = new SparkContext(conf)

    sc.setLogLevel("WARN")

    val ssc = new StreamingContext(sc, Seconds()) // 创建streamingcontext入口

    val quorum = "master,worker1,worker2"

    val groupId = "zhenGroup"

    val map : Map[String, Int] = Map("zhenTopic" -> ) // topic名称为zhenTopic，每次使用1个线程读取数据

    val dframe = KafkaUtils.createStream(ssc, quorum, groupId, map, StorageLevel.MEMORY_AND_DISK_SER_2)

    dframe.foreachRDD(rdd => { // 操作方式和rdd类似，必须使用action算子才会触发程序执行！

      rdd.foreachPartition(partition =>{

        partition.foreach(println)

      })

    })

  }

}

SparkStreaming+kafka Receiver模式的更多相关文章

【Spark篇】---SparkStreaming+Kafka的两种模式receiver模式和Direct模式
一.前述 SparkStreamin是流式问题的解决的代表,一般结合kafka使用,所以本文着重讲解sparkStreaming+kafka两种模式. 二.具体 1.Receiver模式原理图 ...
SparkStreaming+Kafka 处理实时WIFI数据
业务背景技术选型 Kafka Producer SparkStreaming 接收Kafka数据流基于Receiver接收数据直连方式读取kafka数据 Direct连接示例使用Zookeep ...
SparkStreaming+Kafka整合
SparkStreaming+Kafka整合 1.需求使用SparkStreaming,并且结合Kafka,获取实时道路交通拥堵情况信息. 2.目的对监控点平均车速进行监控,可以实时获取交通拥堵情 ...
[Spark]Spark-streaming通过Receiver方式实时消费Kafka流程（Yarn-cluster）
1.启动zookeeper 2.启动kafka服务(broker) [root@master kafka_2.11-0.10.2.1]# ./bin/kafka-server-start.sh con ...
【SparkStreaming学习之四】 SparkStreaming+kafka管理消费offset
环境虚拟机:VMware 10 Linux版本:CentOS-6.5-x86_64 客户端:Xshell4 FTP:Xftp4 jdk1.8 scala-2.10.4(依赖jdk1.8) spark ...
Spark-Streaming kafka count 案例
Streaming 统计来自 kafka 的数据,这里涉及到的比较,kafka 的数据是使用从 flume 获取到的,这里相当于一个小的案例. 1. 启动 kafka Spark-Streaming ...
Kafka KRaft模式探索
1.概述 Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者在网站中的所有动作流数据.其核心组件包含Producer.Broker.Consumer,以及依赖的Zookeeper集群. ...
kafka单机模式部署安装，zookeeper启动
在root的用户下 1):前提安装JDK环境,设置JAVA环境变量 2):下载kafka,命令:wget http://mirrors.shuosc.org/apache/kafka/0.10.2 ...
java kafka单列模式生产者客户端
1.所需要的依赖 <?xml version="1.0" encoding="UTF-8"?> <project xmlns="ht ...

随机推荐

C# .net 高清压缩图片合并图片方法
/// <summary> /// 合并宽度一样的图片 /// </summary> /// <param name="imgUrls">多张图 ...
setDefaultDllDirectories无法定位动态链接库kernel32.dll
参考链接 : https://blog.csdn.net/gdali/article/details/93084828 https://tieba.baidu.com/p/5795675519?red ...
安装和使用nltk
安装参考:https://www.cnblogs.com/zrmw/p/10869325.html 分词:注意先分句再分词,这些对象均来自nltk.tokenize库 word_tokenize 导 ...
Spring Boot整合UEditor不修改源码
1.创建Springboot项目,目录结构如下(在resources中static/ueditor/jsp/config.json) 2.pom文件引入 <dependency> < ...
[转]Nodejs利用phantom 将html生成图片
原文地址:https://www.jianshu.com/p/8679f469e8d6 不过下载起来比较麻烦. 需要手动下载,然后将其添加到PATH中. 下载链接: https://sl-m-ssl. ...
WeQuant教程—1.5 实盘运行须知
为了保证实盘交易程序能够正常稳定地运行,同时保护您在使用时账户资金的安全,我们设计了一些规则和机制.了解这些机制有助于您更快上手实盘交易. 启动前检查机制在实盘交易程序启动前,系统会执行一次检查,出 ...
python1-变量和简单的数据类型
变量和简单的数据类型 1 Hello World程序 1.1 执行py文件 linux下编辑一个文件,hello.py print("Hello world") 执行 # pyth ...
读Secrets of the JavaScript Ninja（二）对象
面向对象和原型理解原型在JavaScript中,可通过原型实现继承.原型的概念很简单.每个对象都含有原型的引用,当查找属性时,若对象本身不具有该属性,则会查找原型上是否有该属性. 每个对象都可以有 ...
Laradock中文文档
文档地址:https://laradock.linganmin.cn
JS实现文字转语音播放
JS实现文字转语音播放背景实现方式第一种:百度文字转语音开放API第二种:微软TTS语音引擎第三种:SpeechSynthesisUtterance总结背景在做项目的过程中,经常会遇到场景是客户要求播 ...