【spark】RDD操作

RDD操作分为转换操作和行动操作。

对于RDD而言，每一次的转化操作都会产生不同的RDD，供一个操作使用。

我们每次转换得到的RDD是惰性求值的

也就是说，整个转换过程并不是会真正的去计算，而是只记录了转换的轨迹。

当遇到行动操作的时候，才会发生真正的计算，从DAG图的源头开始进行“从头到尾”的计算。

常见的操作

操作类型	函数名	作用
转化操作	map()	参数是函数，函数应用于RDD每一个元素，返回值是新的RDD
	flatMap()	参数是函数，函数应用于RDD每一个元素，将元素数据进行拆分，变成迭代器，返回值是新的RDD
	filter()	参数是函数，函数会过滤掉不符合条件的元素，返回值是新的RDD
	distinct()	没有参数，将RDD里的元素进行去重操作
	union()	参数是RDD，生成包含两个RDD所有元素的新RDD
	intersection()	参数是RDD，求出两个RDD的共同元素
	subtract()	参数是RDD，将原RDD里和参数RDD里相同的元素去掉
	cartesian()	参数是RDD，求两个RDD的笛卡儿积
行动操作	collect()	返回RDD所有元素
	count()	RDD里元素个数
	countByValue()	各元素在RDD中出现次数
	reduce()	并行整合所有RDD数据，例如求和操作
	fold(0)(func)	和reduce功能一样，不过fold带有初始值
	aggregate(0)(seqOp,combop)	和reduce功能一样，但是返回的RDD数据类型和原RDD不一样
	foreach(func)	对RDD每个元素都是使用特定函数

除此之外我们还用到过的转换操作还有

1.groupByKey()：应用于（K,V）键值对的数据集，返回一个新的（K，Iterable）形式的数据集

2.reduceByKey(func)：应用于（K,V）键值对的数据集，返回一个新的（K，V）形式的数据集

其中每个值是将每个Key传入到func中进行聚合。

除此之外我们还用到过的行动操作还有

1.first()：返回数据集的第一个元素

2.take(n)：以数组形式返回数据集的前n个元素。

示例

转化操作

val rddInt:RDD[Int] = sc.makeRDD(List(1,2,3,4,5,6,2,5,1)

val rddStr:RDD[String] = sc.parallelize(Array("a","b","c","d","b","a"), 1)

val rddFile:RDD[String] = sc.textFile(path, 1)

val rdd01:RDD[Int] = sc.makeRDD(List(1,3,5,3))

val rdd02:RDD[Int] = sc.makeRDD(List(2,4,5,1))

/* map操作 */

    println("======map操作======")

    println(rddInt.map(x => x + 1).collect().mkString(","))

    println("======map操作======")

/* filter操作 */

    println("======filter操作======")

    println(rddInt.filter(x => x > 4).collect().mkString(","))

    println("======filter操作======")

/* flatMap操作 */

    println("======flatMap操作======")

    println(rddFile.flatMap { x => x.split(",") }.first())

    println("======flatMap操作======")

/* distinct去重操作 */

    println("======distinct去重======")

    println(rddInt.distinct().collect().mkString(","))

    println(rddStr.distinct().collect().mkString(","))

    println("======distinct去重======")

/* union操作 */

    println("======union操作======")

    println(rdd01.union(rdd02).collect().mkString(","))

    println("======union操作======")

/* intersection操作 */

    println("======intersection操作======")

    println(rdd01.intersection(rdd02).collect().mkString(","))

    println("======intersection操作======")

/* subtract操作 */

    println("======subtract操作======")

    println(rdd01.subtract(rdd02).collect().mkString(","))

    println("======subtract操作======")

/* cartesian操作 */

    println("======cartesian操作======")

    println(rdd01.cartesian(rdd02).collect().mkString(","))

    println("======cartesian操作======")

行动操作

val rddInt:RDD[Int] = sc.makeRDD(List(1,2,3,4,5,6,2,5,1))

val rddStr:RDD[String] = sc.parallelize(Array("a","b","c","d","b","a"), 1)

/* count操作 */

    println("======count操作======")

    println(rddInt.count())

    println("======count操作======")

/* countByValue操作 */

    println("======countByValue操作======")

    println(rddInt.countByValue())

    println("======countByValue操作======")

/* reduce操作 */

    println("======countByValue操作======")

    println(rddInt.reduce((x, y) => x + y))

    println("======countByValue操作======")

/* fold操作 */

    println("======fold操作======")

    println(rddInt.fold(0)((x, y) => x + y))

    println("======fold操作======")

/* aggregate操作 */

    println("======aggregate操作======")

    val res: (Int, Int) = rddInt.aggregate((0, 0))((x, y) => (x._1 + x._2, y),

                                                               (x, y) => (x._1 + x._2, y._1 + y._2))

    println(res._1 + "," + res._2)

    println("======aggregate操作======")

/* foreach操作 */

    println("======foeach操作======")

    println(rddStr.foreach { x => println(x) })

    println("======foeach操作======")

【spark】RDD操作的更多相关文章

Spark RDD操作(1)
https://www.zybuluo.com/jewes/note/35032 RDD是什么? RDD是Spark中的抽象数据结构类型,任何数据在Spark中都被表示为RDD.从编程的角度来看,RD ...
Spark RDD 操作
1. Spark RDD 创建操作 1.1 数据集合 parallelize 可以创建一个能够并行操作的RDD.其函数定义如下: ) scala> sc.defaultParallelism ...
spark RDD操作的底层实现原理
RDD操作闭包外部变量原则 RDD相关操作都需要传入自定义闭包函数(closure),如果这个函数需要访问外部变量,那么需要遵循一定的规则,否则会抛出运行时异常.闭包函数传入到节点时,需要经过下面的步 ...
Spark RDD操作之Map系算子
在linux系统上安装solrCloud 1.依赖: JRE solr7.3 需要 java1.8 独立的zookeeper服务 ,zookeeper安装请参考: http://zookeeper.a ...
Spark学习（一）--RDD操作
标签(空格分隔): 学习笔记 Spark编程模型的两种抽象:RDD(Resilient Distributed Dataset)和两种共享变量(支持并行计算的广播变量和累加器). RDD RDD是一种 ...
Spark RDD/Core 编程 API入门系列之动手实战和调试Spark文件操作、动手实战操作搜狗日志文件、搜狗日志文件深入实战（二）
1.动手实战和调试Spark文件操作这里,我以指定executor-memory参数的方式,启动spark-shell. 启动hadoop集群 spark@SparkSingleNode:/usr/ ...
Spark编程模型及RDD操作
转载自:http://blog.csdn.net/liuwenbo0920/article/details/45243775 1. Spark中的基本概念在Spark中,有下面的基本概念.Appli ...
Spark 键值对RDD操作
键值对的RDD操作与基本RDD操作一样,只是操作的元素由基本类型改为二元组. 概述键值对RDD是Spark操作中最常用的RDD,它是很多程序的构成要素,因为他们提供了并行操作各个键或跨界点重新进行数 ...
Spark RDD、DataFrame原理及操作详解
RDD是什么? RDD (resilientdistributed dataset),指的是一个只读的,可分区的分布式数据集,这个数据集的全部或部分可以缓存在内存中,在多次计算间重用. RDD内部可以 ...
spark RDD 常见操作
fold 操作区别与 co 1.mapValus 2.flatMapValues 3.comineByKey 4.foldByKey 5.reduceByKey 6.groupByKey 7.so ...

随机推荐

Django之html-模板继承
在编程的过程中,我们经常会重复性的写了很多的代码,比如一个页面的框架部分,这样我又多少个页面就得写上多少次,这样既不好维护,也不够高效,所以我们引出了html的模板继承部分. 1.写好一个html文件 ...
Python中的不同进制的语法和转换
不同进制的书写方式八进制(Octal) 0o377 十六进制(Hex) 0xFF 二进制(Binary) 0b11111111 不同进制之间的转换 python提供了三个内置的函数,能够用来在不同进 ...
servlet 通过 FileItem 实现多文件上传
[本文简介] 一个servlet 多文件上传的简单例子. [依赖包] commons-fileupload-1.3.1.jar commons-io-2.2.jar [依赖包下载] commons-f ...
Digital Audio - Creating a WAV (RIFF) file
Abstract:This tutorial covers the creation of a WAV (RIFF) audio file. It covers bit size, sample ra ...
Ubuntu学习笔记1-基本部分
Vim相当于vi的升级版 Find p*.txt支持查找通配符 Echo 回显命令 echo hello >1.txt 追加命令,不覆盖 echo hello >1.txt 覆盖命 ...
java执行cmd命令和linux命令
文章出处http://blog.csdn.net/xh16319/article/details/17302947 一:window下执行cmd指定一:window下执行cmd指定程序例子: [j ...
MySQL ——索引原理与慢查询优化（Day45）
阅读目录一介绍二索引的原理三索引的数据结构三 MySQL索引管理四测试索引五正确使用索引六查询优化神器-explain 七慢查询优化的基本步骤八慢日志管理 ====== ...
python 对象和类
python中所有数据都是以对象形式存在.对象既包含数据(变量),也包含代码(函数),是某一类具体事物的特殊实例. 面向对象的三大特性为封装.继承和多态. 1.定义类 #定义空类 class Pers ...
Php DOMDocument 中的 formatOutput
Nicely formats output with indentation and extra space 是否处理缩进和多余的空白符
虚拟环境virtualenv和virtualenvwrapper(转)
virtualenv是用来创建一个独立的Python虚拟环境的工具,通过virtualenv可以创建一个拥有独立的python版本和安装库的虚拟开发环境.这样一来我们就可以在虚拟环境中安装各种各种所需 ...

【spark】RDD操作

【spark】RDD操作的更多相关文章

随机推荐

热门专题