Spark源码学习1

转自：http://www.cnblogs.com/hseagle/p/3664933.html

一、基本概念(Basic Concepts)

RDD - resillient distributed dataset 弹性分布式数据集

Operation - 作用于RDD的各种操作分为transformation和action

Job - 作业，一个JOB包含多个RDD及作用于相应RDD上的各种operation

Stage - 一个作业分为多个阶段

Partition - 数据分区，一个RDD中的数据可以分成多个不同的区

DAG - Directed Acycle graph, 有向无环图，反应RDD之间的依赖关系

Narrow dependency - 窄依赖，子RDD依赖于父RDD中固定的data partition

Wide Dependency - 宽依赖，子RDD对父RDD中的所有data partition都有依赖

Caching Managenment -- 缓存管理，对RDD的中间计算结果进行缓存管理以加快整体的处理速度

二、编程模型(Programming Model)

RDD是只读的数据分区集合，注意是数据集，作用于RDD上的Operation分为transformantion和action。经Transformation处理之后，数据集中的内容会发生更改，由数据集A转换成为数据集B；而经Action处理之后，数据集中的内容会被归约为一个具体的数值，只有当RDD上有action时，该RDD及其父RDD上的所有operation才会被提交到cluster中真正的被执行。从代码到动态运行，涉及到的组件如下图所示。

演示代码

 val sc = new SparkContext("Spark://...", "MyJob", home, jars)

 val file = sc.textFile("hdfs://...")

 val errors = file.filter(_.contains("ERROR"))

 errors.cache()

 errors.count()

三、运行态(Runtime view)

不管什么样的静态模型，其在动态运行的时候无外乎由进程，线程组成。用Spark的术语来说，static view称为dataset view，而dynamic view称为parition view. 关系如图所示

在Spark中的task可以对应于线程，worker是一个个的进程，worker由driver来进行管理。那么问题来了，这一个个的task是如何从RDD演变过来的呢？下节将详细回答这个问题。

四、部署(Deployment view)

当有Action作用于某RDD时，该action会作为一个job被提交。在提交的过程中，DAGScheduler模块介入运算，计算RDD之间的依赖关系。RDD之间的依赖关系就形成了DAG。每一个JOB被分为多个stage，划分stage的一个主要依据是当前计算因子的输入是否是确定的，如果是则将其分在同一个stage，避免多个stage之间的消息传递开销。当stage被提交之后，由taskscheduler来根据stage来计算所需要的task，并将task提交到对应的worker.Spark支持以下几种部署模式1)standalone 2)Mesos 3) yarn. 这些部署模式将作为taskscheduler的初始化入参。

五、RDD接口(RDD Interface)

RDD由以下几个主要部分组成

partitions -- partition集合，一个RDD中有多少data partition
dependencies -- RDD依赖关系
compute(parition) -- 对于给定的数据集，需要作哪些计算
preferredLocations -- 对于data partition的位置偏好
partitioner -- 对于计算出来的数据结果如何分发

六、缓存机制(caching)

RDD的中间计算结果可以被缓存起来，缓存先选Memory,如果Memory不够的话，将会被写入到磁盘中，根据LRU(last-recent update)来决定哪先内容继续保存在内存，哪些保存到磁盘。

七、容错性(Fault-tolerant)

从最初始的RDD到衍生出来的最后一个RDD，中间要经过一系列的处理。那么如何处理中间环节出现错误的场景呢？Spark提供的解决方案是只对失效的data partition进行事件重演，而无须对整个数据全集进行事件重演，这样可以大大加快场景恢复的开销。RDD又是如何知道自己的data partition的number该是多少？如果是hdfs文件，那么hdfs文件的block将会成为一个重要的计算依据。

八、集群管理(cluster management)

task运行在cluster之上，除了spark自身提供的standalone部署模式之外，spark还内在支持yarn和mesos.Yarn来负责计算资源的调度和监控，根据监控结果来重启失效的task或者是重新distributed task一旦有新的node加入cluster的话。

Spark源码学习1的更多相关文章

Spark源码学习1.2——TaskSchedulerImpl.scala
许久没有写博客了,没有太多时间,最近陆续将Spark源码的一些阅读笔记传上,接下来要修改Spark源码了. 这个类继承于TaskScheduler类,重载了TaskScheduler中的大部分方法,是 ...
Spark源码学习1.1——DAGScheduler.scala
本文以Spark1.1.0版本为基础. 经过前一段时间的学习,基本上能够对Spark的工作流程有一个了解,但是具体的细节还是需要阅读源码,而且后续的科研过程中也肯定要修改源码的,所以最近开始Spark ...
Spark源码学习2
转自:http://www.cnblogs.com/hseagle/p/3673123.html 在源码阅读时,需要重点把握以下两大主线. 静态view 即 RDD, transformation a ...
spark源码学习-withScope
withScope是最近的发现版中新增加的一个模块,它是用来做DAG可视化的(DAG visualization on SparkUI) 以前的sparkUI中只有stage的执行情况,也就是说我们 ...
Spark源码学习1.6——Executor.scala
Executor.scala 一.Executor类首先判断本地性,获取slaves的host name(不是IP或者host: port),匹配运行环境为集群或者本地.如果不是本地执行,需要启动一 ...
Spark源码学习1.5——BlockManager.scala
一.BlockResult类该类用来表示返回的匹配的block及其相关的参数.共有三个参数: data:Iterator [Any]. readMethod: DataReadMethod.Valu ...
Spark源码学习1.4——MapOutputTracker.scala
相关类:MapOutputTrackerMessage,GetMapOutputStatuses extends MapPutputTrackerMessage,StopMapOutputTracke ...
Spark源码学习3
转自:http://www.cnblogs.com/hseagle/p/3673132.html 一.概要本篇主要阐述在TaskRunner中执行的task其业务逻辑是如何被调用到的,另外试图讲清楚 ...
Spark源码学习1.8——ShuffleBlockManager.scala
shuffleBlockManager继承于Logging,参数为blockManager和shuffleManager.shuffle文件有三个特性:shuffleId,整个shuffle stag ...

随机推荐

CSS或者JS实现鼠标悬停显示另一元素
想达到鼠标悬停到元素a上,显示另一个元素b,可以通过css实现也可以通过js实现.js:写两个函数:mouseenter,mouseleave,例如:其中 $("#a").mous ...
dubbo+zookeeper+spring+springMVC+mybatis的使用
读前声明:由于本人水平有限,有错误或者描述不恰当的地方请指出来,勿喷!第一次写博客. 源码下载链接:http://files.cnblogs.com/files/la-tiao-jun-blog/du ...
java打包/命令行方式运行jar（命令行进行程序测试）
public class Testtmp { public static void main(String[] args) { // TODO Auto-generated method stub f ...
Java并发编程实践(读书笔记) 任务执行(未完)
任务的定义大多数并发程序都是围绕任务进行管理的.任务就是抽象和离散的工作单元. 任务的执行策略 1.顺序的执行任务这种策略的特点是一般只有按顺序处理到来的任务.一次只能处理一个任务,后来其它任 ...
Oracle查看被锁的表和解锁[转]
查看被锁的表 select p.spid,a.serial#, c.object_name,b.session_id,b.oracle_username,b.os_user_name from v$p ...
JavaWeb核心编程之(三.2)Servlet配置
Servlet配置 1.配置Serlvet加载时机 2.配置多映射配置加载时机新建项目config->创建包com.xiaoan.config->创建类FirstServlet imp ...
在struts2中整合ajax时出现Template /template/ajax/head.ftl not found错误时的处理方法
Struts2 Ajax出现错误“Template /template/ajax/head.ftl not found” 2013-02-08 18:26:27| 分类: 默认分类|字号订阅 ...
struts2笔记01-环境搭建
1.官网下载struts2 struts-2.3.28-all.zip,这个包可谓应有尽有,以后全靠它了! 2.jar包怎么选? (1)struts-2.3.28-all\struts-2 ...
第6章堆排序，d叉堆，优先队列
#include<stdio.h> #include<stdlib.h> #include<string.h> #define leftChild(i) (2*(i ...
USB OTG ID 检测原理
OTG 检测的原理是: USB OTG标准在完全兼容USB2.0标准的基础上,增添了电源管理(节省功耗)功能,它允许设备既可作为主机,也可作为外设操作(两用OTG).USB OTG技术可实现没有主机时 ...

Spark源码学习1

Spark源码学习1的更多相关文章

随机推荐

热门专题