56、Spark Streaming: transform以及实时黑名单过滤案例实战

一、transform以及实时黑名单过滤案例实战

1、概述

transform操作，应用在DStream上时，可以用于执行任意的RDD到RDD的转换操作。它可以用于实现，DStream API中所没有提供的操作。比如说，DStream API中，

并没有提供将一个DStream中的每个batch，与一个特定的RDD进行join的操作。但是我们自己就可以使用transform操作来实现该功能。

DStream.join()，只能join其他DStream。在DStream每个batch的RDD计算出来之后，会去跟其他DStream的RDD进行join。

案例：广告计费日志实时黑名单过滤

2、java案例

package cn.spark.study.streaming;

import java.util.ArrayList;

import java.util.List;

import org.apache.spark.SparkConf;

import org.apache.spark.api.java.JavaPairRDD;

import org.apache.spark.api.java.JavaRDD;

import org.apache.spark.api.java.function.Function;

import org.apache.spark.api.java.function.PairFunction;

import org.apache.spark.streaming.Durations;

import org.apache.spark.streaming.api.java.JavaDStream;

import org.apache.spark.streaming.api.java.JavaPairDStream;

import org.apache.spark.streaming.api.java.JavaReceiverInputDStream;

import org.apache.spark.streaming.api.java.JavaStreamingContext;

import com.google.common.base.Optional;

import scala.Tuple2;

/**

 * 基于transform的实时广告计费日志黑名单过滤

 *

 * @author bcqf

 *

 */

public class TransformBlacklist {

    @SuppressWarnings("deprecation")

    public static void main(String[] args) {

        SparkConf conf = new SparkConf()

                .setMaster("local[2]")

                .setAppName("TransformBlacklist");

        JavaStreamingContext jssc = new JavaStreamingContext(conf, Durations.seconds(5));

        // 用户对我们的网站上的广告可以进行点击

        // 点击之后，是不是要进行实时计费，点一下，算一次钱

        // 但是，对于那些帮助某些无良商家刷广告的人，那么我们有一个黑名单

        // 只要是黑名单中的用户点击的广告，我们就给过滤掉

        // 先做一份模拟的黑名单RDD

        List<Tuple2<String, Boolean>> blacklist = new ArrayList<Tuple2<String, Boolean>>();

        blacklist.add(new Tuple2<String, Boolean>("tom", true));

        final JavaPairRDD<String, Boolean> blacklistRDD = jssc.sc().parallelizePairs(blacklist);

        // 这里的日志格式，就简化一下，就是date username的方式

        JavaReceiverInputDStream<String> adsClickLogDStream = jssc.socketTextStream("spark1", 9999);

        // 所以，要先对输入的数据，进行一下转换操作，变成，(username, date username)

        // 以便于，后面对每个batch RDD，与定义好的黑名单RDD进行join操作

        JavaPairDStream<String, String> userAdsClickLogDStream = adsClickLogDStream.mapToPair(

                new PairFunction<String, String, String>() {

                    private static final long serialVersionUID = 1L;

                    @Override

                    public Tuple2<String, String> call(String adsClickLog)

                            throws Exception {

                        return new Tuple2<String, String>(

                                adsClickLog.split(" ")[1], adsClickLog);

                    }

                });

        // 然后，就可以执行transform操作了，将每个batch的RDD，与黑名单RDD进行join、filter、map等操作

        // 实时进行黑名单过滤

        JavaDStream<String> validAdsClickLogDStream = userAdsClickLogDStream.transform(

                new Function<JavaPairRDD<String,String>, JavaRDD<String>>() {

                    private static final long serialVersionUID = 1L;

                    @Override

                    public JavaRDD<String> call(JavaPairRDD<String, String> userAdsClickLogRDD)

                            throws Exception {

                        // 这里为什么用左外连接？

                        // 因为，并不是每个用户都存在于黑名单中的

                        // 所以，如果直接用join，那么没有存在于黑名单中的数据，会无法join到

                        // 就给丢弃掉了

                        // 所以，这里用leftOuterJoin，就是说，哪怕一个user不在黑名单RDD中，没有join到

                        // 也还是会被保存下来的

                        JavaPairRDD<String, Tuple2<String, Optional<Boolean>>> joinedRDD =

                                userAdsClickLogRDD.leftOuterJoin(blacklistRDD);

                        // 连接之后，执行filter算子

                        JavaPairRDD<String, Tuple2<String, Optional<Boolean>>> filteredRDD =

                                joinedRDD.filter(

                                        new Function<Tuple2<String,

                                                Tuple2<String,Optional<Boolean>>>, Boolean>() {

                                            private static final long serialVersionUID = 1L;

                                            @Override

                                            public Boolean call(

                                                    Tuple2<String,

                                                            Tuple2<String, Optional<Boolean>>> tuple)

                                                    throws Exception {

                                                // 这里的tuple，就是每个用户，对应的访问日志，和在黑名单中

                                                // 的状态

                                                if(tuple._2._2().isPresent() &&

                                                        tuple._2._2.get()) {

                                                    return false;

                                                }

                                                return true;

                                            }

                                        });

                        // 此时，filteredRDD中，就只剩下没有被黑名单过滤的用户点击了

                        // 进行map操作，转换成我们想要的格式

                        JavaRDD<String> validAdsClickLogRDD = filteredRDD.map(

                                new Function<Tuple2<String,Tuple2<String,Optional<Boolean>>>, String>() {

                                    private static final long serialVersionUID = 1L;

                                    @Override

                                    public String call(

                                            Tuple2<String, Tuple2<String, Optional<Boolean>>> tuple)

                                            throws Exception {

                                        return tuple._2._1;

                                    }

                                });

//

                        return validAdsClickLogRDD;

                    }

                });

        // 打印有效的广告点击日志

        // 其实在真实企业场景中，这里后面就可以走写入kafka、ActiveMQ等这种中间件消息队列

        // 然后再开发一个专门的后台服务，作为广告计费服务，执行实时的广告计费，这里就是只拿到了有效的广告点击

        validAdsClickLogDStream.print();

        jssc.start();

        jssc.awaitTermination();

        jssc.close();

    }

}

##在eclipse中运行程序

##服务器端运行nc

[root@spark1 kafka]# nc -lk 9999

20150814 marry

20150814 tom

##结果，tom已经被过滤掉了

20150814 marry

2、scala案例

package cn.spark.study.streaming

import org.apache.spark.SparkConf

import org.apache.spark.streaming.StreamingContext

import org.apache.spark.streaming.Seconds

/**

 * @author bcqf

 */

object TransformBlacklist {

  def main(args: Array[String]): Unit = {

    val conf = new SparkConf()

        .setMaster("local[2]")

        .setAppName("TransformBlacklist")

    val ssc = new StreamingContext(conf, Seconds(5))

    val blacklist = Array(("tom", true))

    val blacklistRDD = ssc.sparkContext.parallelize(blacklist, 5)  

    val adsClickLogDStream = ssc.socketTextStream("spark1", 9999)

    val userAdsClickLogDStream = adsClickLogDStream

        .map { adsClickLog => (adsClickLog.split(" ")(1), adsClickLog) } 

    val validAdsClickLogDStream = userAdsClickLogDStream.transform(userAdsClickLogRDD => {

      val joinedRDD = userAdsClickLogRDD.leftOuterJoin(blacklistRDD)

      val filteredRDD = joinedRDD.filter(tuple => {

        if(tuple._2._2.getOrElse(false)) {

          false

        } else {

          true

        }

      })

      val validAdsClickLogRDD = filteredRDD.map(tuple => tuple._2._1)

      validAdsClickLogRDD

    })

    validAdsClickLogDStream.print()

    ssc.start()

    ssc.awaitTermination()

  }

}

56、Spark Streaming: transform以及实时黑名单过滤案例实战的更多相关文章

（升级版）Spark从入门到精通（Scala编程、案例实战、高级特性、Spark内核源码剖析、Hadoop高端）
本课程主要讲解目前大数据领域最热门.最火爆.最有前景的技术——Spark.在本课程中,会从浅入深,基于大量案例实战,深度剖析和讲解Spark,并且会包含完全从企业真实复杂业务需求中抽取出的案例实战.课 ...
基于Spark Streaming + Canal + Kafka对Mysql增量数据实时进行监测分析
Spark Streaming可以用于实时流项目的开发,实时流项目的数据源除了可以来源于日志.文件.网络端口等,常常也有这种需求,那就是实时分析处理MySQL中的增量数据.面对这种需求当然我们可以通过 ...
苏宁基于Spark Streaming的实时日志分析系统实践 Spark Streaming 在数据平台日志解析功能的应用
https://mp.weixin.qq.com/s/KPTM02-ICt72_7ZdRZIHBA 苏宁基于Spark Streaming的实时日志分析系统实践原创: AI+落地实践 AI前线 20 ...
【慕课网实战】Spark Streaming实时流处理项目实战笔记八之铭文升级版
铭文一级: Spark Streaming is an extension of the core Spark API that enables scalable, high-throughput, ...
【Streaming】30分钟概览Spark Streaming 实时计算
本文主要介绍四个问题: 什么是Spark Streaming实时计算? Spark实时计算原理流程是什么? Spark 2.X下一代实时计算框架Structured Streaming Spark S ...
spark streaming (二)
一.基础核心概念 1.StreamingContext详解 (一) 有两种创建StreamingContext的方式: val conf = new SparkConf().s ...
Spark调优 | Spark Streaming 调优
Spark调优 | Spark Streaming 调优 1.数据序列化 2.广播大变量 3.数据处理和接收时的并行度 4.设置合理的批处理间隔 5.内存优化 5.1 内存管理 5.2优化策略 5.3 ...
Spark Streaming笔记
Spark Streaming学习笔记 liunx系统的习惯创建hadoop用户在hadoop根目录(/home/hadoop)上创建如下目录app 存放所有软件的安装目录 app/tmp 存放临时文 ...
Spark Streaming中空batches处理的两种方法（转）
原文链接:Spark Streaming中空batches处理的两种方法 Spark Streaming是近实时(near real time)的小批处理系统.对给定的时间间隔(interval),S ...

随机推荐

Java自学-操作符三元操作符
Java的三元操作符三元操作符 ?: 示例 1 : 三元操作符语法:表达式?值1:值2 如果表达式为真返回值1 如果表达式为假返回值2 public class HelloWorld { pu ...
Spring通过注解@Autowired/@Resource获取bean实例时为什么可以直接获取接口而不是注入的类
问: 这个问题困扰了我好久,一直疑问这个接口的bean是怎么注入进去的?因为只看到使用@Service注入了实现类serviceImpl,使用时怎么却获取的接口,而且还能调用到实现类的方法,难道这个接 ...
Celery：First Steps
参考文档:http://docs.celeryproject.org/en/latest/getting-started/first-steps-with-celery.html#first-step ...
图说jdk1.8新特性（2）--- Lambda
简要说明 jdk常用函数式接口 Predicate @FunctionalInterface public interface Predicate<T> { boolean test(T ...
css display block 和 inline
根据CSS规范的规定,每一个网页元素都有一个display属性,用于确定该元素的类型,每一个元素都有默认的display属性值,比如div元素,它的默认display属性值为“block”,成为“块级 ...
tree - 列出树状目录结构
tree - list contents of directories in a tree-like format. 树状显示目录结构常用格式: tree [option] [directory] ...
MyBatis日记（四）：MyBatis——insert、update、delete、select
MyBatis简单增删改查操作,此处所做操作,皆是在之前创建的MyBatis的Hello world的工程基础上所做操作. 首先在接口文件(personMapper.java)中,添加操作方法: pa ...
Docker Private Registry 常用组件
Docker Private Registry 常用组件作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.Docker Registry概述 1>.什么是registry ...
Docker存储卷篇
Docker存储卷篇作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.写时复制(COW)机制所谓写时复制的效果如上图所示: Docker镜像由多个只读层叠加而成,启动容器 ...
逆向破解之160个CrackMe —— 006
CrackMe —— 006 160 CrackMe 是比较适合新手学习逆向破解的CrackMe的一个集合一共160个待逆向破解的程序 CrackMe:它们都是一些公开给别人尝试破解的小程序,制作 c ...

56、Spark Streaming: transform以及实时黑名单过滤案例实战

56、Spark Streaming: transform以及实时黑名单过滤案例实战的更多相关文章

随机推荐

热门专题