Flink入门 - 窗口函数

/*

* ProcessWinFunOnWindow

*/ 

final StreamExecutionEnvironment streamExecutionEnvironment = StreamExecutionEnvironment.getExecutionEnvironment(); 

DataStream<Tuple3<String, String, Long>> input = streamExecutionEnvironment.fromElements(ENGLISH_TRANSCRIPT); 

DataStream<Double> avgEnglishScore = input.keyBy(0).countWindow(2).process(new MyProcessWindowFunction()); 

avgEnglishScore.print(); 

streamExecutionEnvironment.execute(); 

public static final Tuple3[] ENGLISH_TRANSCRIPT = new Tuple3[] { 

Tuple3.of("class1","张三",100L), 

Tuple3.of("class1","李四",78L), 

Tuple3.of("class1","王五",99L), 

Tuple3.of("class2","赵六",81L), 

Tuple3.of("class2","钱七",59L), 

Tuple3.of("class2","马二",97L) 

}; 

private static class MyProcessWindowFunction extends ProcessWindowFunction<Tuple3<String, String, Long>, Double, Tuple, GlobalWindow> { 

@Override

public void process(Tuple tuple,

ProcessWindowFunction<Tuple3<String, String, Long>, Double, Tuple, GlobalWindow>.Context context,

Iterable<Tuple3<String, String, Long>> elements, Collector<Double> out) throws Exception {

Long sum = 0L;

Long count = 0L;

for (Tuple3<String, String, Long> element : elements) {

sum += element.f2;

count++;

}

out.collect(sum.doubleValue() / count.doubleValue());

}

} 

// 运行结果

2> 89.0

1> 70.0 

// 如果是input.keyBy(0).countWindow(3)

1> 79.0

2> 92.33333333333333

/**

*AggFunctionOnWindow

*/

final StreamExecutionEnvironment streamExecutionEnvironment = StreamExecutionEnvironment.getExecutionEnvironment(); 

DataStream<Tuple3<String, String, Long>> input = streamExecutionEnvironment.fromElements(ENGLISH_TRANSCRIPT); 

DataStream<Double> avgEnglishScore = input.keyBy(0).countWindow(3).aggregate(new AverageAggregate()); 

avgEnglishScore.print(); 

streamExecutionEnvironment.execute(); 

private static class AverageAggregate implements AggregateFunction<Tuple3<String, String, Long>, Tuple2<Long, Long>, Double> { 

/**

* 创建累加器来保存中间状态

*/

@Override

public Tuple2<Long, Long> createAccumulator() {

// TODO Auto-generated method stub

return new Tuple2<>(0L, 0L);

} 

/**

* 来一个元素计算一下sum和count并保存中间结果到累加器

*/

@Override

public Tuple2<Long, Long> add(Tuple3<String, String, Long> value, Tuple2<Long, Long> accmulator) {

// TODO Auto-generated method stub

return new Tuple2<>(accmulator.f0 + value.f2, accmulator.f1 + 1);

} 

/**

* 从累加器提取结果

*/

@Override

public Double getResult(Tuple2<Long, Long> accmulator) {

// TODO Auto-generated method stub

return accmulator.f0.doubleValue() / accmulator.f1.doubleValue();

} 

/**

*

*/

@Override

public Tuple2<Long, Long> merge(Tuple2<Long, Long> value1, Tuple2<Long, Long> value2) {

// TODO Auto-generated method stub

return new Tuple2<>(value1.f0 + value2.f0, value1.f1 + value2.f1);

} 

} 

// 运行结果

1> 79.0

2> 92.33333333333333

/**

*ReduceFunctionOnWindowAll

*/ 

final StreamExecutionEnvironment streamExecutionEnvironment = StreamExecutionEnvironment.getExecutionEnvironment(); 

DataStream<Tuple3<String, String, Long>> input = streamExecutionEnvironment.fromElements(ENGLISH_TRANSCRIPT); 

DataStream<Tuple3<String, String, Long>> totalEnglishScore = input.keyBy(0).countWindow(3).reduce(new ReduceFunction<Tuple3<String, String, Long>>(){ 

@Override

public Tuple3<String, String, Long> reduce(Tuple3<String, String, Long> value1,

Tuple3<String, String, Long> value2) throws Exception {

// TODO Auto-generated method stub

return new Tuple3<>(value1.f0, value1.f1, value1.f2 + value2.f2);

}

}); 

totalEnglishScore.map(new MapFunction<Tuple3<String, String, Long>, Tuple2<String, Long>>() { 

@Override

public Tuple2<String, Long> map(Tuple3<String, String, Long> value) throws Exception {

// TODO Auto-generated method stub

return new Tuple2<>(value.f0, value.f2);

}

}).print(); 

streamExecutionEnvironment.execute(); 

// 运行结果

2> (class1,277)

1> (class2,237)

Flink入门 - 窗口函数的更多相关文章

第02讲：Flink 入门程序 WordCount 和 SQL 实现
我们右键运行时相当于在本地启动了一个单机版本.生产中都是集群环境,并且是高可用的,生产上提交任务需要用到flink run 命令,指定必要的参数. 本课时我们主要介绍 Flink 的入门程序以及 SQ ...
Flink入门（二）——Flink架构介绍
1.基本组件栈了解Spark的朋友会发现Flink的架构和Spark是非常类似的,在整个软件架构体系中,同样遵循着分层的架构设计理念,在降低系统耦合度的同时,也为上层用户构建Flink应用提供了丰富 ...
Flink入门（三）——环境与部署
flink是一款开源的大数据流式处理框架,他可以同时批处理和流处理,具有容错性.高吞吐.低延迟等优势,本文简述flink在windows和linux中安装步骤,和示例程序的运行,包括本地调试环境,集群 ...
Flink入门（四）——编程模型
flink是一款开源的大数据流式处理框架,他可以同时批处理和流处理,具有容错性.高吞吐.低延迟等优势,本文简述flink的编程模型. 数据集类型: 无穷数据集:无穷的持续集成的数据集合有界数据集:有 ...
Flink入门（五）——DataSet Api编程指南
Apache Flink Apache Flink 是一个兼顾高吞吐.低延迟.高性能的分布式处理框架.在实时计算崛起的今天,Flink正在飞速发展.由于性能的优势和兼顾批处理,流处理的特性,Flink ...
不一样的Flink入门教程
前言微信搜[Java3y]关注这个朴实无华的男人,点赞关注是对我最大的支持! 文本已收录至我的GitHub:https://github.com/ZhongFuCheng3y/3y,有300多篇原创 ...
Flink入门-第一篇：Flink基础概念以及竞品对比
Flink入门-第一篇:Flink基础概念以及竞品对比 Flink介绍截止2021年10月Flink最新的稳定版本已经发展到1.14.0 Flink起源于一个名为Stratosphere的研究项目主 ...
flink 入门
http://ifeve.com/flink-quick-start/ http://vinoyang.com/2016/05/02/flink-concepts/ http://wuchong.me ...
Flink入门宝典（详细截图版）
本文基于java构建Flink1.9版本入门程序,需要Maven 3.0.4 和 Java 8 以上版本.需要安装Netcat进行简单调试. 这里简述安装过程,并使用IDEA进行开发一个简单流处理程序 ...

随机推荐

Mockito 的用法
本文为博主原创,转载请注明出处: Mockito 是一个基于MIT协议的开源java测试框架. Mockito区别于其他模拟框架的地方主要是允许开发者在没有建立“预期”时验证被测系统的行为.对于moc ...
docker build提示error checking context：can't stat xxx
现象描述使用docker build一个镜像的时候,提示下面的错误: ➜ docker build -t image_name -f xxx.dockerfile . error checking ...
Flask 学习（一）简单介绍
Flask介绍(轻量级的框架) Flask是一个基于Python开发并且依赖jinja2模板和Werkzeug WSGI服务的一个微型框架,对于Werkzeug本质是Socket服务端,其用于接收ht ...
Java8 特性
1.jdk8的特性stream().map() 2.Java8中用Lambda表达式的groupBy合并多个相同属性的对象集合 3.Java8 Stream 语法详解 & 用法实例
图文讲解Android ImageView的ScaleType
ScaleType的设置方式包括: 1. 在layout的xml中定义android:scaleType="xxx": 2. 在java代码中调用imageView.setScal ...
[转]System Verilog的概念以及与verilog的对比
原文地址: http://blog.csdn.net/gtatcs/article/details/8970489 SystemVerilog语言简介 SystemVerilog是一种硬件描述和验证语 ...
Mysql update多表联合更新
下面我建两个表,并执行一系列sql语句,仔细观察sql执行后表中数据的变化,很容易就能理解多表联合更新的用法 student表 ...
keystone源码阅读--python函数
按照setup.sfg文件中[entry_poubts]中的声明前后阅读: 1.cmd.manage:main os.path.join(path,name):连接目录与文件名或目录os.path.e ...
PowerDNS + PowerDNS-Admin
一.基础配置 1.1 环境说明 Centos 7.5.1804 PDNS MariaDB 1.2 关闭防火墙和 selinux setenforce sed -i 's/SELINUX=enforci ...
JVM 堆内存设置原理
堆内存设置原理 JVM堆内存分为2块:Permanent Space 和 Heap Space. Permanent 即持久代(Permanent Generation),主要存放的是Java类定 ...

Flink入门 - 窗口函数

Flink入门 - 窗口函数的更多相关文章

随机推荐

热门专题