[Spark RDD_1] RDD 基本概念

山间一棵松 2024-10-21 11:26:59 原文

0. 说明

　　RDD 概述 && 创建 RDD 的方式 && RDD 编程 API（Transformation 和 Action Operations） && RDD 的依赖关系

1. RDD 概述

　　Spark 围绕弹性分布式数据集（RDD）的概念展开，RDD 是可以并行操作的容错的容错集合。

　　resilient distributed dataset，弹性分布式数据集。

　　不可变集合，可以进行并行操作的分区化数据集合。

　　该类包含了 RDD 常见操作，比如 map、filter、persist 等。

　　对于 key-value 的 RDD，会自动转换成（隐式转换）PairRDDFunction,该类提供了所有的 ByKey 操作。

　　内部，每个 RDD 主要含有 5 个主要属性：

分区列表（轻量级数据集合，没有实际数据）
计算每个切片的计算函数
和其他RDD的依赖列表
针对 K-V 类型 RDD，还有一个分区类(可选)
计算每个切片的首选位置列表(可选)

2. 创建 RDD 的方式

　　创建 RDD 有两种方法

　　【方法一】

　　并行化驱动程序中的现有集合。

　　例子如下

　　【方法二】

　　引用外部存储系统中的数据集，例如共享文件系统，HDFS，HBase 或提供 Hadoop InputFormat 的任何数据源。

　　textFile() 方法最初创建的是 HadoopRDD，HadoopRDD 提供了读取 HDFS 文件核心功能。

　　sc.textFile()

　　产生了两个 RDD
　　HadoopRDD -> MapPartitionRDD

　　

3. RDD 编程 API（Transformation 和 Action Operations）

　　【变换 Transformation】

　　返回值为新的 RDD

　　map

　　flatMap

　　filter()

　　reduceByKey()

　　【动作 Actions】

　　返回值为具体的值

　　collect()
　　save()
　　reduce()
　　count()

4. RDD 的依赖关系

　　【依赖】

　　RDD 的依赖是 子 RDD 上的每个分区和父 RDD 分区数量上的对应关系
　　Dependency
　　　　|----ShuffleDependency　(宽依赖)
　　　　|----NarrowDependency （窄依赖：子 RDD 的每个分区依赖少量的父 RDD 分区）
　　　　　　|-----One2OneDependency （一对一依赖）
　　　　　　|-----RangeDependency（范围依赖）
　　　　　　|-----PruneDependency（Prune 依赖）

　　【说明】

　　构造 RDD 时使用的是 One2OneDependency

[Spark RDD_1] RDD 基本概念的更多相关文章

【原】Learning Spark (Python版) 学习笔记(一)----RDD 基本概念与命令
<Learning Spark>这本书算是Spark入门的必读书了,中文版是<Spark快速大数据分析>,不过豆瓣书评很有意思的是,英文原版评分7.4,评论都说入门而已深入不足 ...
Learning Spark (Python版) 学习笔记(一)----RDD 基本概念与命令
<Learning Spark>这本书算是Spark入门的必读书了,中文版是<Spark快速大数据分析>,不过豆瓣书评很有意思的是,英文原版评分7.4,评论都说入门而已深入不足 ...
Spark RDD基本概念与基本用法
1. 什么是RDD RDD(Resilient Distributed Dataset)叫做分布式数据集,是Spark中最基本的数据抽象,它代表一个不可变.可分区.里面的元素可并行计算的集合.RDD具 ...
关于Spark中RDD的设计的一些分析
RDD, Resilient Distributed Dataset,弹性分布式数据集, 是Spark的核心概念. 对于RDD的原理性的知识,可以参阅Resilient Distributed Dat ...
Spark中的一些概念
最近工作用到Spark,这里记一些自己接触到的Spark基本概念和知识. 本文链接:https://www.cnblogs.com/hhelibeb/p/10288915.html 名词 RDD:在高 ...
spark中RDD的转化操作和行动操作
本文主要是讲解spark里RDD的基础操作.RDD是spark特有的数据模型,谈到RDD就会提到什么弹性分布式数据集,什么有向无环图,本文暂时不去展开这些高深概念,在阅读本文时候,大家可以就把RDD当 ...
Spark集群基础概念与 spark架构原理
一.Spark集群基础概念将DAG划分为多个stage阶段,遵循以下原则: 1.将尽可能多的窄依赖关系的RDD划为同一个stage阶段. 2.当遇到shuffle操作,就意味着上一个stage阶段结 ...
大话Spark(1)-Spark概述与核心概念
说到Spark就不得不提MapReduce/Hadoop, 当前越来越多的公司已经把大数据计算引擎从MapReduce升级到了Spark. 至于原因当然是MapReduce的一些局限性了, 我们一起先 ...
Spark之RDD的定义及五大特性
RDD是分布式内存的一个抽象概念,是一种高度受限的共享内存模型,即RDD是只读的记录分区的集合,能横跨集群所有节点并行计算,是一种基于工作集的应用抽象. RDD底层存储原理:其数据分布存储于多台机器上 ...

随机推荐

【IT笔试面试题整理】有序数组生成最小高度二叉树
[试题描述]定义一个函数,输入一个有序数组生成最小高度二叉树 We will try to create a binary tree such that for each node, the numb ...
mongodb之oplog
1.查看master上当前的oplog状态: >rs.printReplicationInfo() configured oplog size: 5000MBlog length start t ...
版本管理（一）之Git和GitHub的区别（优点和缺点）
Git 简介 https://www.yiibai.com/git/getting-started-git-basics.html Git 是一个开源的分布式版本控制系统,用于敏捷高效地处理任何或小或 ...
es6学习笔记7--Set
Set 基本用法 ES6提供了新的数据结构Set.它类似于数组,但是成员的值都是唯一的,没有重复的值. Set本身是一个构造函数,用来生成Set数据结构. var s = new Set(); [2, ...
【转】CSS和SVG中的剪切——clip-path属性和<clipPath>元素
本文由大漠根据SaraSoueidan的<Clipping in CSS and SVG – The clip-path Property and <clipPath> Elemen ...
nodejs的__dirname，__filename，process.cwd()区别
假定我们有这样一个mynode的node项目在User/leinov/porject/文件夹下,cli是一个可执行文件 |-- mynode |-- bin |-- cli.js |-- src |- ...
深入出不来nodejs源码-timer模块(JS篇)
鸽了好久,最近沉迷游戏,继续写点什么吧,也不知道有没有人看. 其实这个node的源码也不知道该怎么写了,很多模块涉及的东西比较深,JS和C++两头看,中间被工作耽搁回来就一脸懵逼了,所以还是挑一些简单 ...
Microsoft Office MIME Types
经常需要查找Microsoft Office MIME Types,终于在MSDN网上找到,摘录如下,以备查阅与参考:http://blogs.msdn.com/b/vsofficedeveloper ...
tomcat内存设置问题
一. tomcat内存设置问题收藏在使用Java程序从数据库中查询大量的数据或是应用服务器(如tomcat.jboss,weblogic)加载jar包时会出现java.lang.OutOfMemo ...
Linux应用调试-strace命令
1.strace简介 strace常用来跟踪进程执行时的系统调用和所接收的信号.通过strace可以知道应用程序打开了哪些文件,以及读写了什么内容,包括消耗的时间以及返回值等 2.安装strace命令 ...