学习Spark2.0中的Structured Streaming（一）

转载自：http://lxw1234.com/archives/2016/10/772.htm

Spark2.0新增了Structured Streaming，它是基于SparkSQL构建的可扩展和容错的流式数据处理引擎，使得实时流式数据计算可以和离线计算采用相同的处理方式（DataFrame&SQL）。Structured Streaming顾名思义，它将数据源和计算结果都映射成一张”结构化”的表，在计算的时候以结构化的方式去操作数据流，大大方便和提高了数据开发的效率。

Spark2.0之前，流式计算通过Spark Streaming进行：

使用Spark Streaming每次只能消费当前批次内的数据，当然可以通过window操作，消费过去一段时间（多个批次）内的数据。举个简例子，需要每隔10秒，统计当前小时的PV和UV，在数据量特别大的情况下，使用window操作并不是很好的选择，通常是借助其它如Redis、HBase等完成数据统计。

Structured Streaming将数据源和计算结果都看做是无限大的表，数据源中每个批次的数据，经过计算，都添加到结果表中作为行。

先试试官方给的例子，在本地启动NetCat： nc -lk 9999

在另一个会话中：

cd $SPARK_HOME/bin

./spark-shell（以local模式进入spark-shell命令行），运行下面的程序：

    import org.apache.spark.sql.functions._

    import org.apache.spark.sql.SparkSession

    val spark = SparkSession.builder.appName("StructuredNetworkWordCount").getOrCreate()

    import spark.implicits._

    val lines = spark.readStream.format("socket").option("host", "localhost").option("port", ).load()

    val words = lines.as[String].flatMap(_.split(" "))

    val wordCounts = words.groupBy("value").count()

    val query = wordCounts.writeStream.outputMode("complete").format("console").start()

    query.awaitTermination()

在NetCat会话中输入”apache spark”，spark-shell中显示：

在NetCat会话中分两次再输入”apache hadoop”，”lxw1234.com hadoop spark”， spark-shell中显示：

可以看到，每个Batch显示的结果，都是完整的WordCount统计结果，这便是结算结果输出中的完整模式（Complete Mode）。

关于结算结果的输出，有三种模式：

Complete Mode：输出最新的完整的结果表数据。
Append Mode：只输出结果表中本批次新增的数据，其实也就是本批次中的数据；
Update Mode（暂不支持）：只输出结果表中被本批次修改的数据；

这些Output，可以直接通过连接器（如MySQL JDBC、HBase API等）写入外部存储系统。

再看看Append模式，
注意：Append模式不支持基于数据流上的聚合操作（Append output mode not supported when there
are streaming aggregations on streaming DataFrames/DataSets）；

    import org.apache.spark.sql.functions._

    import org.apache.spark.sql.SparkSession

    val spark = SparkSession.builder.appName("StructuredNetworkWordCount").getOrCreate()

    import spark.implicits._

    val lines = spark.readStream.format("socket").option("host", "localhost").option("port", ).load()

    val words = lines.as[String].flatMap(_.split(" "))

    val query = words.writeStream.outputMode("append").format("console").start()

    query.awaitTermination()

在NetCat中分三次输入：
apache spark
apache hadoop
lxw1234.com hadoop spark

spark-shell中显示：

只有当前批次的数据。

学习Spark2.0中的Structured Streaming（一）的更多相关文章

Spark Streaming揭秘 Day29 深入理解Spark2.x中的Structured Streaming
Spark Streaming揭秘 Day29 深入理解Spark2.x中的Structured Streaming 在Spark2.x中,Spark Streaming获得了比较全面的升级,称为St ...
浅谈Spark2.x中的Structured Streaming
在Spark2.x中,Spark Streaming获得了比较全面的升级,称为Structured Streaming,和之前的很不同,功能更强大,效率更高,跟其他的组件整合性也更好. 连续应用程序c ...
Spark3.0分布，Structured Streaming UI登场
近日,在Spark开源十周年之际,Spark3.0发布了,这个版本大家也是期盼已久.登录Spark官网,最新的版本已经是3.0.而且不出意外,对于Structured Streaming进行了再一次的 ...
DataFlow编程模型与Spark Structured streaming
流式(streaming)和批量( batch):流式数据,实际上更准确的说法应该是unbounded data(processing),也就是无边界的连续的数据的处理:对应的批量计算,更准确的说法是 ...
Apache Spark 2.2.0 中文文档 - Structured Streaming 编程指南 | ApacheCN
Structured Streaming 编程指南概述快速示例 Programming Model (编程模型) 基本概念处理 Event-time 和延迟数据容错语义 API 使用 Data ...
Kafka：ZK+Kafka+Spark Streaming集群环境搭建（十一）定制一个arvo格式文件发送到kafka的topic，通过Structured Streaming读取kafka的数据
将arvo格式数据发送到kafka的topic 第一步:定制avro schema: { "type": "record", "name": ...
geotrellis使用（二十五）将Geotrellis移植到spark2.0
目录前言升级spark到2.0 将geotrellis最新版部署到spark2.0(CDH) 总结一.前言事情总是变化这么快,前面刚写了一篇博客介绍如何将geotrellis移植 ...
Spark2.0机器学习系列之12：线性回归及L1、L2正则化区别与稀疏解
概述线性回归拟合一个因变量与一个自变量之间的线性关系y=f(x). Spark中实现了: (1)普通最小二乘法 (2)岭回归(L2正规化) (3)La ...
Spark2.0机器学习系列之6：GBDT（梯度提升决策树）、GBDT与随机森林差异、参数调试及Scikit代码分析
概念梳理 GBDT的别称 GBDT(Gradient Boost Decision Tree),梯度提升决策树. GBDT这个算法还有一些其他的名字,比如说MART(Multiple Addi ...

随机推荐

<转>pandas学习
1.Pandas 基本介绍 Numpy 和 Pandas 有什么不同? 如果用 python 的列表和字典来作比较, 那么可以说 Numpy 是列表形式的,没有数值标签,而 Pandas 就是字典形式 ...
杨辉三角(Pascal Triangle)的几种C语言实现及其复杂度分析
说明本文给出杨辉三角的几种C语言实现,并简要分析典型方法的复杂度. 本文假定读者具备二项式定理.排列组合.求和等方面的数学知识. 一基本概念杨辉三角,又称贾宪三角.帕斯卡三角,是二项式系数在三 ...
WEB中会话跟踪[转]
今天晚上去华工参加睿智融科的笔试,问到web会话跟踪,一脸懵比,这个词听都没听过,回来后百度下,发现其实会话跟踪的内容我基本都了解的~_~ 转自:http://www.cnblogs.com/gaop ...
【Spring Boot&&Spring Cloud系列】Spring Boot中使用NoSql数据库Redis
github地址:https://github.com/AndyFlower/Spring-Boot-Learn/tree/master/spring-boot-nosql-redis 一.加入依赖到 ...
PV&UV&IP之间的区别和联系
PV PV是网站分析的一个术语,用于衡量网站用户访问的网页的数量.对于广告投入商来说,PV值可以预期它可以带来多少收入广告,一般来说,OV与来访者的数量成正比,但是PV并不直接决定页面的真实来访者数量 ...
ThinkPHP-5.0.23新的RCE漏洞测试和POC
TP5新RCE漏洞昨天又是周五,讨厌周五曝漏洞,还得又得加班,算了,还是先验证一波.新的TP5RCE,据说发现者因为上次的RCE,于是又审计了代码,结果发现的.TP5也成了万人轮啊. 测试环境搭建 ...
linux shell脚本中 mode=${1:-sart} filename=${fileuser:-"filename"}
$1代表第二个参数m=${1:-start}表示如果$1存在且不为空,m就是$1如果$1不存在或为空,那么m就是start filename=${fileuser:-"filename&qu ...
python nose测试框架全面介绍八---接口测试中非法参数的断言
在测接口时,会有这样的场景,输入非法的参数,校验返回的错误码及错误内容通常做法为发请求,将错误的返回结果拿出,再进行对比匹配:但存在一个问题,需要再写错误返回分析函数,不能与之前正常发请求的函数共用 ...
Unity3D笔记模型和角色动画的输出设置
Java虚拟机九 java.lang.String在虚拟机中的实现
在Java中,Java的设计者对String对象进行了大量的优化,主要有三个特点: 1.不变性: 不变性是指String对象一旦生成,则不能再对它进行改变.String的这个特点可以泛化成不变(imm ...

学习Spark2.0中的Structured Streaming（一）

学习Spark2.0中的Structured Streaming（一）的更多相关文章

随机推荐

热门专题