转载自:http://www.jianshu.com/p/082ef79c63c1

broadcast


官方文档描述:


  1. Broadcast a read-only variable to the cluster, returning a
  2. [[org.apache.spark.broadcast.Broadcast]] object for reading it in distributed functions.
  3. The variable will be sent to each cluster only once.

函数原型:


  1. def broadcast[T](value: T): Broadcast[T]

广播变量允许程序员将一个只读的变量缓存在每台机器上,而不用在任务之间传递变量。广播变量可被用于有效地给每个节点一个大输入数据集的副本。Spark还尝试使用高效地广播算法来分发变量,进而减少通信的开销。 Spark的动作通过一系列的步骤执行,这些步骤由分布式的洗牌操作分开。Spark自动地广播每个步骤每个任务需要的通用数据。这些广播数据被序列化地缓存,在运行任务之前被反序列化出来。这意味着当我们需要在多个阶段的任务之间使用相同的数据,或者以反序列化形式缓存数据是十分重要的时候,显式地创建广播变量才有用。

源码分析:


  1. def broadcast[T: ClassTag](value: T): Broadcast[T] = {
  2. assertNotStopped()
  3. if (classOf[RDD[_]].isAssignableFrom(classTag[T].runtimeClass)) {
  4. // This is a warning instead of an exception in order to avoid breaking user programs that
  5. // might have created RDD broadcast variables but not used them:
  6. logWarning("Can not directly broadcast RDDs; instead, call collect() and "
  7. + "broadcast the result (see SPARK-5063)")
  8. }
  9. val bc = env.broadcastManager.newBroadcast[T](value, isLocal)
  10. val callSite = getCallSite
  11. logInfo("Created broadcast " + bc.id + " from " + callSite.shortForm)
  12. cleaner.foreach(_.registerBroadcastForCleanup(bc))
  13. bc
  14. }

实例:


  1. List<Integer> data = Arrays.asList(5, 1, 1, 4, 4, 2, 2);
  2. JavaRDD<Integer> javaRDD = javaSparkContext.parallelize(data,5);
  3. final Broadcast<List<Integer>> broadcast = javaSparkContext.broadcast(data);
  4. JavaRDD<Integer> result = javaRDD.map(new Function<Integer, Integer>() {
  5. List<Integer> iList = broadcast.value();
  6. @Override
  7. public Integer call(Integer v1) throws Exception {
  8. Integer isum = 0;
  9. for(Integer i : iList)
  10. isum += i;
  11. return v1 + isum;
  12. }
  13. });
  14. System.out.println(result.collect());

accumulator


官方文档描述:


  1. Create an [[org.apache.spark.Accumulator]] variable of a given type, which tasks can "add"
  2. values to using the `add` method. Only the master can access the accumulator's `value`.

函数原型:


  1. def accumulator[T](initialValue: T, accumulatorParam: AccumulatorParam[T]): Accumulator[T]
  2. def accumulator[T](initialValue: T, name: String, accumulatorParam: AccumulatorParam[T])
  3. : Accumulator[T]

累加器是仅仅被相关操作累加的变量,因此可以在并行中被有效地支持。它可以被用来实现计数器和sum。Spark原生地只支持数字类型的累加器,开发者可以添加新类型的支持。如果创建累加器时指定了名字,可以在Spark的UI界面看到。这有利于理解每个执行阶段的进程(对于Python还不支持) 。
累加器通过对一个初始化了的变量v调用SparkContext.accumulator(v)来创建。在集群上运行的任务可以通过add或者”+=”方法在累加器上进行累加操作。但是,它们不能读取它的值。只有驱动程序能够读取它的值,通过累加器的value方法。

源码分析:


  1. def accumulator[T](initialValue: T, name: String)(implicit param: AccumulatorParam[T])
  2. : Accumulator[T] = {
  3. val acc = new Accumulator(initialValue, param, Some(name))
  4. cleaner.foreach(_.registerAccumulatorForCleanup(acc))
  5. acc
  6. }

实例:


  1. class VectorAccumulatorParam implements AccumulatorParam<Vector> {
  2. @Override
  3. //合并两个累加器的值。
  4. //参数r1是一个累加数据集合
  5. //参数r2是另一个累加数据集合
  6. public Vector addInPlace(Vector r1, Vector r2) {
  7. r1.addAll(r2);
  8. return r1;
  9. }
  10. @Override
  11. //初始值
  12. public Vector zero(Vector initialValue) {
  13. return initialValue;
  14. }
  15. @Override
  16. //添加额外的数据到累加值中
  17. //参数t1是当前累加器的值
  18. //参数t2是被添加到累加器的值
  19. public Vector addAccumulator(Vector t1, Vector t2) {
  20. t1.addAll(t2);
  21. return t1;
  22. }
  23. }
  24. List<Integer> data = Arrays.asList(5, 1, 1, 4, 4, 2, 2);
  25. JavaRDD<Integer> javaRDD = javaSparkContext.parallelize(data,5);
  26. final Accumulator<Integer> accumulator = javaSparkContext.accumulator(0);
  27. Vector initialValue = new Vector();
  28. for(int i=6;i<9;i++)
  29. initialValue.add(i);
  30. //自定义累加器
  31. final Accumulator accumulator1 = javaSparkContext.accumulator(initialValue,new VectorAccumulatorParam());
  32. JavaRDD<Integer> result = javaRDD.map(new Function<Integer, Integer>() {
  33. @Override
  34. public Integer call(Integer v1) throws Exception {
  35. accumulator.add(1);
  36. Vector term = new Vector();
  37. term.add(v1);
  38. accumulator1.add(term);
  39. return v1;
  40. }
  41. });
  42. System.out.println(result.collect());
  43. System.out.println("~~~~~~~~~~~~~~~~~~~~~" + accumulator.value());
  44. System.out.println("~~~~~~~~~~~~~~~~~~~~~" + accumulator1.value());
 

【Spark Java API】broadcast、accumulator的更多相关文章

  1. 【Spark调优】Broadcast广播变量

    [业务场景] 在Spark的统计开发过程中,肯定会遇到类似小维表join大业务表的场景,或者需要在算子函数中使用外部变量的场景(尤其是大变量,比如100M以上的大集合),那么此时应该使用Spark的广 ...

  2. HBase【操作Java api】

    一.导入依赖 创建模块,导入以下依赖,maven默认编译版本是1.5,用1.8编译. pom.xml <dependencies> <dependency> <group ...

  3. 【Spark调优】提交job资源参数调优

    [场景] Spark提交作业job的时候要指定该job可以使用的CPU.内存等资源参数,生产环境中,任务资源分配不足会导致该job执行中断.失败等问题,所以对Spark的job资源参数分配调优非常重要 ...

  4. 【Spark调优】数据倾斜及排查

    [数据倾斜及调优概述] 大数据分布式计算中一个常见的棘手问题——数据倾斜: 在进行shuffle的时候,必须将各个节点上相同的key拉取到某个节点上的一个task来进行处理,比如按照key进行聚合或j ...

  5. 【高德地图API】从零开始学高德JS API(二)地图控件与插件——测距、圆形编辑器、鼠标工具、地图类型切换、鹰眼鱼骨

    原文:[高德地图API]从零开始学高德JS API(二)地图控件与插件——测距.圆形编辑器.鼠标工具.地图类型切换.鹰眼鱼骨 摘要:无论是控件还是插件,都是在一级API接口的基础上,进行二次开发,封装 ...

  6. 【百度地图API】如何用圆形搜索获取中心点周围100米内全部关键点?如天安门附近所有的餐厅、加油站、宾馆、大厦等

    原文:[百度地图API]如何用圆形搜索获取中心点周围100米内全部关键点?如天安门附近所有的餐厅.加油站.宾馆.大厦等 摘要: 在LBS上有这样一个常用的功能,查找附近所有的关键点(POI点,比如标志 ...

  7. 【Java基础】11、java方法中只有值传递,没有引用传递

    public class Example { String testString = new String("good"); char[] testCharArray = {'a' ...

  8. 【Java基础】4、java中的内部类

    内部类的分类:常规内部类.静态内部类.私有内部类.局部内部类.匿名内部类. 实例1:常规内部类 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 2 ...

  9. 【Spark调优】Kryo序列化

    [Java序列化与反序列化] Java序列化是指把Java对象转换为字节序列的过程:而Java反序列化是指把字节序列恢复为Java对象的过程.序列化使用场景:1.数据的持久化,通过序列化可以把数据永久 ...

随机推荐

  1. python 时间格式化

    2018-10-25 17:49:51 监控软件 原始 2018-10-2517:49:51 切割后 2018/10/25 17:49:51 格式化后 shijian = ' '.join(respo ...

  2. python中的pandas的两种基本使用

    python中的pandas的两种基本使用2018年05月19日 16:03:36 木子柒努力成长 阅读数:480 一.pandas简介 pandas:panel data analysis(面板数据 ...

  3. 复习回顾(String,StringBuffer,Arrays方法总结)

    String: String类的对象是一经创建就无法变动内容的字符串常量,创建String类的对象可以使用直接赋值和利用构造方法赋值 String str=“hello”;  String str=n ...

  4. golang写的反弹shell(自作孽不可活,切记,切记!)

    仅作安全研究 package main import ( "os/exec" "go-pop3" "log" "strings&q ...

  5. Java应用集群下的定时任务处理方案(mysql)

    Java应用集群下的定时任务处理方案(mysql)   因为自己有csdn和博客园两个博客, 所以两边都会发一下. csdn地址: http://blog.csdn.net/u012881584/ar ...

  6. scrapy框架简介和基础应用

    scrapy框架介绍 环境安装 基础使用 一.什么是Scrapy? Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架,非常出名,非常强悍.所谓的框架就是一个已经被集成了各种功能(高性 ...

  7. FileNotFoundError: [Errno 2] No such file or directory的解决方法

    1.获取当前文件所在路径 basedir = os.path.dirname(__file__) print("basedir:" + basedir) 2.将路径进行拼接 upl ...

  8. Java中double转BigDecimal的注意事项

    先上结论:不要直接用double变量作为构造BigDecimal的参数! 线上有这么一段Java代码逻辑: 1,接口传来一个JSON串,里面有个数字:57.3. 2,解析JSON并把这个数字保存在一个 ...

  9. 最长公共子序列与最长公共字串 (dp)转载http://blog.csdn.net/u012102306/article/details/53184446

    1. 问题描述 子串应该比较好理解,至于什么是子序列,这里给出一个例子:有两个母串 cnblogs belong 比如序列bo, bg, lg在母串cnblogs与belong中都出现过并且出现顺序与 ...

  10. JS导入导出Excel表格的方法

    https://blog.csdn.net/aa122273328/article/details/50388673 导出 https://blog.csdn.net/qq_37281252/arti ...