Spark运行时的内核架构以及架构思考

一： Spark内核架构

1，Drive是运行程序的时候有main方法，并且会创建SparkContext对象，是程序运行调度的中心，向Master注册程序，然后Master分配资源。

应用程序： Application = Driver（驱动程序） + Executor（执行程序）

Driver部分的代码：主要是SparkContext +SparkConf

Application 的main 方法、创建sparkcontext、这样环境对象 sparkcontext 创建时要有程序的高层调度器DAGScheduler 分为几个阶段、底层调度器TasKScheduler 一个阶段的任务处理、SchedulerBackend向Master 注册程序、分资源、根据 job 许多RDD 从后向前倒推如宽依赖划分不同的stage 然后提交给底层调度器TaskScheduler 然后根据数据的本地性发送到 Excutor 去执行，如出问题向 Drive 部分汇报完成关闭创建对象

Executor 是运行在Worker所在节点上，为当前应用程序而开启的一个JVM进程里边的一个对象，这个对象负责具体Task的运行。这个JVM进程里面是通过线程池并发每个线程运行一个Task任务，完成后进行线程复用。

默认情况在一个节点上只为当前程序开启一个 Excutor。

Cluster Manager（集群中获取资源的Web服务）

spark Aplication 运行不依赖 Cluster Manager

可插拔的资源方式粗粒度的

Worker 操作代码的节点，不运行程序的代码，管理当前节点的资源（cup，Memory），并接收 Master指令来分配具体的计算资源的Excutor（在新的进程中分配）

并通过ExcutorRunner 来具体启动一个新进程，进程里面有Executor。

在此可以做一个比喻：Worker是工头，Cluster Manager：是项目经理

Master：是Boss

worker 不会汇报当前信息（发心跳）给 Master

故障时候发的心跳只有 workid

Master 分配时就知道资源

Job 包含一系列的task 并行计算一般由action 触发 action不会产生RDD

action前面的是RDD ,前面的RDD是Transformation级别的是lazy的执行方式，他是从后往前推，如果后面的RDD与前面的RDD是回溯的话是窄依赖（如果父RDD的一个Partition被一个子RDD的Partion所使用的话就是窄依赖，否则的话就是宽依赖，如果子RDD中的Partition对父RDD的Partition依赖的数量不会随着数据量规模的改变而改变的话就是窄依赖，否则的话就是宽依赖）的话就在内存中进行迭代。宽依赖导致stage的划分。

Spark快绝不是因为基于内存，最基本的是他的调度，然后是他的容错

如果宽依赖

依赖构成了 DAG ，DAG导致宽依赖

stage 是内存迭代当然也可以磁盘的迭代，如有100W 个数据分片就有 100W 个task任务

stage内部：计算逻辑一样只是算的数据不一样而已

任务本身计算数据分片，一个pation是否精的等于一个 block大小？

默认情况下是一个数据分片 128MB 最后一个记录跨2个 block

怎么分配资源:通过spark-env.sh和spark-defaults.sh

Scheduling:

Dependency Types :

Event Flow :

长按识别关注我们，每天都有技术和精彩内容分享哦！~

Spark运行时的内核架构以及架构思考的更多相关文章

ILBC 运行时（ILBC Runtime）架构
本文是 VMBC / D# 项目的系列文章, 有关 VMBC / D# , 见 <我发起并创立了一个 VMBC 的子项目 D#>(以下简称 <D#>) https:// ...
spark运行时加载配置文件（hive，hdfs）
文章为转载,如有版权问题,请联系,谢谢! 转自:https://blog.csdn.net/piduzi/article/details/81636253 适合场景:在运行时才确定用哪个数据源 imp ...
Android数据存储之Android 6.0运行时权限下文件存储的思考
前言: 在我们做App开发的过程中基本上都会用到文件存储,所以文件存储对于我们来说是相当熟悉了,不过自从Android 6.0发布之后,基于运行时权限机制访问外置sdcard是需要动态申请权限,所以以 ...
spark运行时出现Neither spark.yarn.jars nor spark.yarn.archive is set错误的解决办法（图文详解）
不多说,直接上干货! 福利 => 每天都推送欢迎大家,关注微信扫码并加入我的4个微信公众号: 大数据躺过的坑 Java从入门到架构师人工智能躺过的坑 ...
Spark on Yarn运行时加载的jar包
spark on yarn运行时会加载的jar包有如下: spark-submit中指定的--jars $SPARK_HOME/jars下的jar包 yarn提供的jar包 spark-submit通 ...
【转载】Spark运行架构
1. Spark运行架构 1.1 术语定义 lApplication:Spark Application的概念和Hadoop MapReduce中的类似,指的是用户编写的Spark应用程序,包含了一个 ...
Spark运行架构
http://blog.csdn.net/pipisorry/article/details/52366288 1. Spark运行架构 1.1 术语定义 lApplication:Spark App ...
Spark 运行架构核心总结
摘要: 1.基本术语 2.运行架构 2.1基本架构 2.2运行流程 2.3相关的UML类图 2.4调度模块: 2.4.1作业调度简介 2.4.2任务调度简介 3.运行模式 3.1 standalo ...
Spark入门实战系列--4.Spark运行架构
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 1. Spark运行架构 1.1 术语定义 lApplication:Spark Appli ...

随机推荐

LeetCode 137. 只出现一次的数字 II（Single Number II）
题目描述给定一个非空整数数组,除了某个元素只出现一次以外,其余每个元素均出现了三次.找出那个只出现了一次的元素. 说明: 你的算法应该具有线性时间复杂度. 你可以不使用额外空间来实现吗? 示例 1: ...
Ngrinder脚本开发各细节锦集（groovy）
Ngrinder脚本开发各细节锦集(groovy) 1.生成随机字符串(import org.apache.commons.lang.RandomStringUtils) 数字:RandomStrin ...
redis如何清空当前缓存和所有缓存
Windows环境下使用命令行进行redis缓存清理1.redis安装目录下输入cmd2.redis-cli -p 端口号3.flushdb 清除当前数据库缓存4.flushall 清除 ...
Oracle 表空间扩容
1 系统表空间扩容注:表空间监测或扩容方式很多,这里只提供一种方便使用的方法 1)查询SQL 注:需要输入百分比,如:90,就可查出使用率超过90%的表空间, with t as (select b ...
带事务管理的spring数据库动态切换
动态切换数据源理论知识项目中我们经常会遇到多数据源的问题,尤其是数据同步或定时任务等项目更是如此:又例如:读写分离数据库配置的系统. 1.相信很多人都知道JDK代理,分静态代理和动态代理两种,同样的 ...
javascript之Location对象
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/ ...
获取packageName和startActivity
import android import pprint # 获取packageName droid = android.Android(('192.168.1.101', 42250)) droid ...
6-2 shell编程基础
shell编程基础编程基础 Linus:Talk is cheap, show me the code 程序和编程风格程序: 程序:算法+数据结构数据:是程序的核心算法:处理数据的方式数据结 ...
DVD Cloner 2019MAC如何使用？
DVD Cloner 2019 for mac是一款应用在Mac上的DVD刻录软件,它可以将DVD克隆到任何空白光盘,包括具有多种复制模式的DVD + R / RW,DVD-R / RW,DVD + ...
python高级之(三) --- 高阶函数
高阶函数 map函数简介 """ map(func,*iterables) 参数:一个是函数.一个是序列作用:将序列中的元素依此作用于函数,将函数运行结果返回存放于 ...

Spark运行时的内核架构以及架构思考

一： Spark内核架构

Spark运行时的内核架构以及架构思考的更多相关文章

随机推荐

热门专题