Spark

一.coalesce

  1.简介

    coalesce常用来合并分区,第二个参数是合并分区时是否产生shuffle。true为产生shuffle,false为不产生shuffle。默认是false不产生shuffle。如果coalesce设置的分区数比原来的分区数还大的话若设置为false则不起作用。如果设置为true则效果等价于repartition。即repartition(numPartitions) = coalesce(numPartitions)。

  2.测试数据

    val array = Array("spark,scala,6", "hadoop,java,12", "tensorflow,python,8", "solr,java,16", "hbase,java,11")

  3.代码           

    /**
    * coalesce算子,常用于减少分区
     */
    val befParNum = rdd.getNumPartitions
    rdd = rdd.coalesce(1, false) // true为产生shuffle
    val coalParNum = rdd.getNumPartitions
    /**
     * repartition与之类型,一般增大分区数
     */
    rdd = rdd.repartition(3)
    val reParNum = rdd.getNumPartitions
    println("初始分区数:" + befParNum + ",coalesce分区后:" + coalParNum + ",repartition分区后:" + reParNum)

  4.结果

    初始分区数:2,coalesce分区后:1,repartition分区后:3

二.zip,zipWithIndex

  1.简介

    zip将两个RDD中的元素变成一个KV格式的RDD,两个RDD的每个分区元素个数必须相同。zipWithIndex该函数将RDD中的元素和这个元素在RDD中的索引下标【从0开始】组合成【K,V】键值对。

  2.测试数据

   val zip_array_left = Array(1,2,5,6,7,5,3,1)
   val zip_array_left_2 = Array(1,2,5,6,7,8,9,0)
   val zip_array_right = Array("spark", "scala", "hive", "hbase", "python", "hive", "hbase", "hbase")

  3.代码

   /**
   * zip
    */
   //to rdd
   val zip_left = sc.parallelize(zip_array_left)
   val zip_left_2 = sc.parallelize(zip_array_left_2)
   val zip_right = sc.parallelize(zip_array_right)    //zip
   val zip = zip_left.zip(zip_right)
   zip.foreach(println)
   println("------------------")    val zip_2 = zip_left_2.zip(zip_right)
   /**
    * zipWithIndex
  */
   val zip_index = zip.zipWithIndex()
   zip_index.foreach(println)

  4.结果

    (1,spark)
    (2,scala)
    (5,hive)
    (6,hbase)
    (7,python)
    (5,hive)
    (3,hbase)
    (1,hbase)
    ------------------
    ((1,spark),0)
    ((7,python),4)
    ((2,scala),1)
    ((5,hive),2)
    ((5,hive),5)
    ((6,hbase),3)
    ((3,hbase),6)
    ((1,hbase),7)

三.countByKey,countByValue

  1.简介

    countByKey作用在K,V格式的RDD之上,统计相同key的个数。countByValue作用在K,V格式的RDD之上,统计相同value的个数。

  2.测试数据

    同上

  3.代码

   /**
   * countByKey
   */
   val zip_key = zip.countByKey()
   zip_key.foreach(println)
   println("------------------")
   /**
   * countByValue
   */
   val zip_value = zip.countByValue()
   zip_value.foreach(println)

  4.结果 

    (5,2)
    (1,2)
    (6,1)
    (2,1)
    (7,1)
    (3,1)
    ------------------
    ((7,python),1)
    ((1,spark),1)
    ((2,scala),1)
    ((1,hbase),1)
    ((3,hbase),1)
    ((6,hbase),1)
    ((5,hive),2)

四.cogroup

  1.简介

    cogroup 对两个内部数据结构为元组(仅有两个元素的元组)的数据进行匹配,把匹配上的value值保存到一个元组中。

  2.测试数据

    同上

  3.代码  

   zip.cogroup(zip_2).foreach(println)

  4.结果

    (0,(CompactBuffer(),CompactBuffer(hbase)))
    (1,(CompactBuffer(spark, hbase),CompactBuffer(spark)))
    (7,(CompactBuffer(python),CompactBuffer(python)))
    (3,(CompactBuffer(hbase),CompactBuffer()))
    (6,(CompactBuffer(hbase),CompactBuffer(hbase)))
    (9,(CompactBuffer(),CompactBuffer(hbase)))
    (8,(CompactBuffer(),CompactBuffer(hive)))
    (5,(CompactBuffer(hive, hive),CompactBuffer(hive)))
    (2,(CompactBuffer(scala),CompactBuffer(scala))) 

五.flatten

  1.简介

    把多层集合数据展开成一个集合。

  2.测试数据

   val sourceDate = Array("zhen@zhen01/2018-09-04_18;57;02_SOURCE",
   "zhen@zhen02/2018-09-05_11;37;11_SOURCE","zhen@zhen03/2018-09-06_11;37;11_TEST")
   val resultDate = Array("zhen@zhen01/2018-09-04_18;57","zhen@zhen02/2018-09-05_11;37",
    "zhen@zhen03/2018-09-06_11;37")

  3.代码

   val seq = Seq(sourceDate, resultDate)
   seq.flatten.foreach(println)

  4.结果

    zhen@zhen01/2018-09-04_18;57;02_SOURCE
    zhen@zhen02/2018-09-05_11;37;11_SOURCE
    zhen@zhen03/2018-09-06_11;37;11_TEST
    zhen@zhen01/2018-09-04_18;57
    zhen@zhen02/2018-09-05_11;37
    zhen@zhen03/2018-09-06_11;37

Spark算子代码实践的更多相关文章

  1. UserView--第二种方式(避免第一种方式Set饱和),基于Spark算子的java代码实现

      UserView--第二种方式(避免第一种方式Set饱和),基于Spark算子的java代码实现   测试数据 java代码 package com.hzf.spark.study; import ...

  2. UserView--第一种方式set去重,基于Spark算子的java代码实现

    UserView--第一种方式set去重,基于Spark算子的java代码实现 测试数据 java代码 package com.hzf.spark.study; import java.util.Ha ...

  3. Spark—RDD编程常用转换算子代码实例

    Spark-RDD编程常用转换算子代码实例 Spark rdd 常用 Transformation 实例: 1.def map[U: ClassTag](f: T => U): RDD[U]  ...

  4. 【Spark算子】:reduceByKey、groupByKey和combineByKey

    在spark中,reduceByKey.groupByKey和combineByKey这三种算子用的较多,结合使用过程中的体会简单总结: 我的代码实践:https://github.com/wwcom ...

  5. 我的Spark SQL单元测试实践

    最近加入一个Spark项目,作为临时的开发人员协助进行开发工作.该项目中不存在测试的概念,开发人员按需求进行编码工作后,直接向生产系统部署,再由需求的提出者在生产系统检验程序运行结果的正确性.在这种原 ...

  6. Spark算子---实战应用

    Spark算子实战应用 数据集 :http://grouplens.org/datasets/movielens/ MovieLens 1M Datase 相关数据文件 : users.dat --- ...

  7. ReactiveCocoa代码实践之-更多思考

    三.ReactiveCocoa代码实践之-更多思考 1. RACObserve()宏形参写法的区别 之前写代码考虑过 RACObserve(self.timeLabel , text) 和 RACOb ...

  8. ReactiveCocoa代码实践之-RAC网络请求重构

    前言 RAC相比以往的开发模式主要有以下优点:提供了统一的消息传递机制:提供了多种奇妙且高效的信号操作方法:配合MVVM设计模式和RAC宏绑定减少多端依赖. RAC的理论知识非常深厚,包含有FRP,高 ...

  9. (转)Spark 算子系列文章

    http://lxw1234.com/archives/2015/07/363.htm Spark算子:RDD基本转换操作(1)–map.flagMap.distinct Spark算子:RDD创建操 ...

随机推荐

  1. Go随机数

    Go math/rand包用于生成随机数. 代码: package main import "fmt" import "math/rand" func main ...

  2. 跟面试官聊.NET垃圾收集,直刺面试官G点

    装逼的面试官和装逼的程序员 我面试别人的时候,经常是按这种路子来面试: 看简历和面试题,从简历和面试题上找到一些技术点,然后跟应聘者聊. 聊某个技术点的时候,应聘者的回答会牵涉到其他的技术点,然后我会 ...

  3. Java——构造方法和匿名对象

    前言 在编写程序时不安全的初始化会导致程序发生发生重大错误.为了使程序可以被安全地初始化,C++引入了构造器(也可以成为构造方法)的概念,这是一个在创建对象时被自动调用的特殊方法.Java中也采用了构 ...

  4. [PKUWC2018] 随机游走

    Description 给定一棵 \(n\) 个结点的树,你从点 \(x\) 出发,每次等概率随机选择一条与所在点相邻的边走过去. 有 \(Q\) 次询问,每次询问给定一个集合 \(S\),求如果从 ...

  5. Linux comm命令求出文件的交集、差集

    A(1,2,3)和B(3,4,5),A和B的交集是3,A对B的差集是1和2,B对A的差集是4和5,A和B求差的结果是1.2.4.5. 在Linux中可以使用comm命令求出这些集. [root@xue ...

  6. ARM 汇编指令 DCD

    简介 DCD:数据定义( Data Definition )伪指令 一般用于为特定的数据分配存储单元,同时可完成已分配存储单元的初始化. 语法格式: 标号 DCD(或 DCDU) 表达式 DCD(或 ...

  7. 应用TortoiseGit为github账号添加SSH keys,解决pull总是提示输入密码的问题

    每次同步或者上传代码到githun上的代码库时,需要每次都输入用户名和密码,这时我们设置一下SSH key就可以省去这些麻烦了.若果使用TortoiseGit作为github本地管理工具,Tortoi ...

  8. Google Maps API Key申请办法(最新)

    之前的Google Maps Api的API Key很容易申请,只需要按照一个简单的表单提交部署的网站地址即可,自动生成API Key并给出引用的路径. 但是最近在处理另外一个项目的时候发现之前的这种 ...

  9. [android] android下junit测试框架配置

    我们的业务代码一般是放在一个新的包下面,这个业务类不能够通过右键run as java application,因为android项目只能运行在手机上的dalvak虚拟机里面 新建一个包,里面写测试类 ...

  10. [android] 请求码和结果码的作用

    当一个界面中要要开启多个带有返回值的activity时,这个时候,就需要用到请求码和结果码了 调用startActivityForResult(intent,requestCode)方法,开启acti ...