Spark运行时的内核架构以及架构思考

一： Spark内核架构

1，Drive是运行程序的时候有main方法，并且会创建SparkContext对象，是程序运行调度的中心，向Master注册程序，然后Master分配资源。

应用程序： Application = Driver（驱动程序） + Executor（执行程序）

Driver部分的代码：主要是SparkContext +SparkConf

Application 的main 方法、创建sparkcontext、这样环境对象 sparkcontext 创建时要有程序的高层调度器DAGScheduler 分为几个阶段、底层调度器TasKScheduler 一个阶段的任务处理、SchedulerBackend向Master 注册程序、分资源、根据 job 许多RDD 从后向前倒推如宽依赖划分不同的stage 然后提交给底层调度器TaskScheduler 然后根据数据的本地性发送到 Excutor 去执行，如出问题向 Drive 部分汇报完成关闭创建对象

Executor 是运行在Worker所在节点上，为当前应用程序而开启的一个JVM进程里边的一个对象，这个对象负责具体Task的运行。这个JVM进程里面是通过线程池并发每个线程运行一个Task任务，完成后进行线程复用。

默认情况在一个节点上只为当前程序开启一个 Excutor。

Cluster Manager（集群中获取资源的Web服务）

spark Aplication 运行不依赖 Cluster Manager

可插拔的资源方式粗粒度的

Worker 操作代码的节点，不运行程序的代码，管理当前节点的资源（cup，Memory），并接收 Master指令来分配具体的计算资源的Excutor（在新的进程中分配）

并通过ExcutorRunner 来具体启动一个新进程，进程里面有Executor。

在此可以做一个比喻：Worker是工头，Cluster Manager：是项目经理

Master：是Boss

worker 不会汇报当前信息（发心跳）给 Master

故障时候发的心跳只有 workid

Master 分配时就知道资源

Job 包含一系列的task 并行计算一般由action 触发 action不会产生RDD

action前面的是RDD ,前面的RDD是Transformation级别的是lazy的执行方式，他是从后往前推，如果后面的RDD与前面的RDD是回溯的话是窄依赖（如果父RDD的一个Partition被一个子RDD的Partion所使用的话就是窄依赖，否则的话就是宽依赖，如果子RDD中的Partition对父RDD的Partition依赖的数量不会随着数据量规模的改变而改变的话就是窄依赖，否则的话就是宽依赖）的话就在内存中进行迭代。宽依赖导致stage的划分。

Spark快绝不是因为基于内存，最基本的是他的调度，然后是他的容错

如果宽依赖

依赖构成了 DAG ，DAG导致宽依赖

stage 是内存迭代当然也可以磁盘的迭代，如有100W 个数据分片就有 100W 个task任务

stage内部：计算逻辑一样只是算的数据不一样而已

任务本身计算数据分片，一个pation是否精的等于一个 block大小？

默认情况下是一个数据分片 128MB 最后一个记录跨2个 block

怎么分配资源:通过spark-env.sh和spark-defaults.sh

Scheduling:

Dependency Types :

Event Flow :

长按识别关注我们，每天都有技术和精彩内容分享哦！~

Spark运行时的内核架构以及架构思考的更多相关文章

ILBC 运行时（ILBC Runtime）架构
本文是 VMBC / D# 项目的系列文章, 有关 VMBC / D# , 见 <我发起并创立了一个 VMBC 的子项目 D#>(以下简称 <D#>) https:// ...
spark运行时加载配置文件（hive，hdfs）
文章为转载,如有版权问题,请联系,谢谢! 转自:https://blog.csdn.net/piduzi/article/details/81636253 适合场景:在运行时才确定用哪个数据源 imp ...
Android数据存储之Android 6.0运行时权限下文件存储的思考
前言: 在我们做App开发的过程中基本上都会用到文件存储,所以文件存储对于我们来说是相当熟悉了,不过自从Android 6.0发布之后,基于运行时权限机制访问外置sdcard是需要动态申请权限,所以以 ...
spark运行时出现Neither spark.yarn.jars nor spark.yarn.archive is set错误的解决办法（图文详解）
不多说,直接上干货! 福利 => 每天都推送欢迎大家,关注微信扫码并加入我的4个微信公众号: 大数据躺过的坑 Java从入门到架构师人工智能躺过的坑 ...
Spark on Yarn运行时加载的jar包
spark on yarn运行时会加载的jar包有如下: spark-submit中指定的--jars $SPARK_HOME/jars下的jar包 yarn提供的jar包 spark-submit通 ...
【转载】Spark运行架构
1. Spark运行架构 1.1 术语定义 lApplication:Spark Application的概念和Hadoop MapReduce中的类似,指的是用户编写的Spark应用程序,包含了一个 ...
Spark运行架构
http://blog.csdn.net/pipisorry/article/details/52366288 1. Spark运行架构 1.1 术语定义 lApplication:Spark App ...
Spark 运行架构核心总结
摘要: 1.基本术语 2.运行架构 2.1基本架构 2.2运行流程 2.3相关的UML类图 2.4调度模块: 2.4.1作业调度简介 2.4.2任务调度简介 3.运行模式 3.1 standalo ...
Spark入门实战系列--4.Spark运行架构
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 1. Spark运行架构 1.1 术语定义 lApplication:Spark Appli ...

随机推荐

CentOS7 开机启动脚本与命令后台运行
一.& 在 Linux 命令后加上 & 可以在后台运行二.nohup 对 SIGHUP 信号免疫,对 SIGINT 信号不免疫,可用 shopt | grep hup 查看. 当关 ...
MySQL获取距离
BEGIN ) ), ) ) ) ) ),))),); END
javascript的变量声明和数据类型
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/ ...
利用Bag中的getCount()方法统计list集合中重复元素
实际应用场景:从Excel导入数据时,存在某个标识符相同的多条数据,需要进行合并,因此需要统计重复元素,可以利用Bag包下的getCount()进行统计,代码如下: package test.com. ...
docker笔记、常遇问题、常用命令
启动一个容器并且进到里面,退出后,容器结束 [root@bogon ~]# docker run --name mynginx -it nginx 启动一个容器,退出后自动删除 [root@bogon ...
Intervals and Timeouts
Intervals var num = 0; var max = 10; function incrementNumber(){ num++; // if the max has not been r ...
ubuntu安装成功之后需要做些什么？
1.安装VMtool 1.1打开虚拟机之后-> 安装VMtool 1.2 点击之后,桌面就会出现一个VMtool光驱文件,如果提示光驱被占用就先用root登录 1.3在命令行挂载 sudo mo ...
php进阶之路 -- 03 命名空间
php进阶之路 -- 03 命名空间命名空间概述定义命名空间空间成员和子空间空间成员的访问空间引入全局空间一. 命名空间概述什么是命名空间?从广义上来说,命名空间是一种封装事物的方法. ...
PI膜应变片试样制备
一.选取基板 1.喷涂在玻璃基板上PI膜 2.正面用记号笔标记PI膜工艺参数——转速.厚度 3.玻璃板背面为PI膜二.贴防护膜 1.事先画好二维图,以dxf格式存放 2.裁减合适的大小,并将其贴在打 ...
np的concatenate和pandas的groupby
1. concatenate concatenate函数可以实现对两个张量进行拼接,这个张量可以实一维向量,二维矩阵等等 1. 首先定义四个列表,然后用concatenate把他们拼接起来,这里我设a ...

Spark运行时的内核架构以及架构思考

一： Spark内核架构

Spark运行时的内核架构以及架构思考的更多相关文章

随机推荐

热门专题