Spark和YARN

Spark在master node生成DAG之后，将DAG以及map函数，action函数进行打包，还有一个很重的打包内容：如何在worker节点执行。统统打包之后传递给YARN，YARN本身只是负责分配资源，以及将上游应用要执行的内容（spark打的函数包）放在分配的资源里面执行；执行内容他并不知晓；可以是向worker节点监听的某个端口发送指令；可以是执行本地的一个shell脚本等等。

在YARN集群的模式下，并不是container里面的程序访问容器外面的executor，而是每个container里面跑的是就executor；executor来执行Task的业务逻辑。spark自己的Applicatin Master在想YARN的slave Node申请container的时候传递的CLC（Container Lauch Context）其实就是就是一个构建了包含executor的环境。

Spark提交给YARN两种模式，一种是yarn-cluster，另外一种是yarn-client；两者的区别在于Driver执行（以及产生的SparkContext的实例）在什么地方，前者是在Client端，这种方式比较容易调试，多用于测试调试阶段，因为sparkContext在client端，可以看到日志信息；后者Driver的执行实在NodeManager的一个容器中，这意味着yarn-cluster模式下，client向YARN提交一个application之后，就可以什么都不做了（比如选择直接退出），因为driver的运行，DAG的生成以及Scheduler等都是在NodeManager的container里面执行的，和applicationMaster在同一个容器内；

SparkContext的位置的不同导致了后续沟通的不同；因为SparkContext后续是要和container沟通的，yarn-client模式就是yarn集群之外的client和NodeManager里面的executor交互，yarn-cluster则是在集群内部交互。

在YARN里面跑的是Executor，每个Executor都是一个进程（不是线程）；

使用YARN的几点理由：

1. YARN提供了资源队列以及资源池的模式来处理提交的任务；

2. spark standalone模式，要求每个application一个executor；YARN可以让你选择executor的数量；

3. YARN未来将会实现container的动态伸缩（现在还不支持https://issues.apache.org/jira/browse/YARN-1197），可以享受这种YARN才有的资源透明伸缩；

3. 支持认证，基于Kerberos的安全认证。

参考：

http://blog.cloudera.com/blog/2014/05/apache-spark-resource-management-and-yarn-app-models/

Spark和YARN的更多相关文章

Spark on YARN的部署
Spark on YARN的原理就是依靠yarn来调度Spark,比默认的Spark运行模式性能要好的多,前提是首先部署好hadoop HDFS并且运行在yarn上,然后就可以开始部署spark on ...
配置Spark on YARN集群内存
参考原文:http://blog.javachen.com/2015/06/09/memory-in-spark-on-yarn.html?utm_source=tuicool 运行文件有几个G大,默 ...
Spark on Yarn 学习(一)
最近看到明风的关于数据挖掘平台下实用Spark和Yarn来做推荐的PPT,感觉很赞,现在基于大数据和快速计算方面技术的发展很快,随着Apache基金会上发布的一个个项目,感觉真的新技术将会不断出现在大 ...
Spark on Yarn：任务提交参数配置
当在YARN上运行Spark作业,每个Spark executor作为一个YARN容器运行.Spark可以使得多个Tasks在同一个容器里面运行. 以下参数配置为例子: spark-submit -- ...
运行 Spark on YARN
运行 Spark on YARN Spark 0.6.0 以上的版本添加了在yarn上执行spark application的功能支持,并在之后的版本中持续的改进.关于本文的内容是翻译官网的内容,大 ...
Spark On YARN使用时上传jar包过多导致磁盘空间不够。。。
今天测试过程中发现YARN Node变成Unhealthy了,后来定位到硬盘空间不够..... 通过查找大于100M的文件时发现有N多个spark-assembly-1.4.0-SNAPSHOT-ha ...
Spark on YARN两种运行模式介绍
本文出自:Spark on YARN两种运行模式介绍http://www.aboutyun.com/thread-12294-1-1.html(出处: about云开发) 问题导读 1.Spark ...
Spark源码系列（七）Spark on yarn具体实现
本来不打算写的了,但是真的是闲来无事,整天看美剧也没啥意思.这一章打算讲一下Spark on yarn的实现,1.0.0里面已经是一个stable的版本了,可是1.0.1也出来了,离1.0.0发布才一 ...
Apache Spark源码走读之8 -- Spark on Yarn
欢迎转载,转载请注明出处,徽沪一郎. 概要 Hadoop2中的Yarn是一个分布式计算资源的管理平台,由于其有极好的模型抽象,非常有可能成为分布式计算资源管理的事实标准.其主要职责将是分布式计算集群的 ...
Spark on Yarn
Spark on Yarn 1. Spark on Yarn模式优点与其他计算框架共享集群资源(eg.Spark框架与MapReduce框架同时运行,如果不用Yarn进行资源分配,MapReduce ...

随机推荐

Linux 笔记 #01# 搭建 Python 环境 & vim 代码高亮
日常收集 vim editor: How do I enable and disable vim syntax highlighting? 搭建 Python 环境 vim editor: How d ...
CentOS7.2 安装nginx-1.10.3
nginx-1.10.3 下载nginx 检查是否安装了依赖库: [root@localhost ~]# rpm -q gcc gcc-4.8.5-11.el7.x86_64 [root@localh ...
使用 v-cloak 防止页面加载时出现 vue.js 的变量名
知识点:使用 v-cloak 防止页面加载时出现 vue.js 的变量名场景:在使用vue语法,实现下拉框功能时,展示数据列表之前,出现对应的 vuejs 变量名代码: var vm = new ...
Flask 1 Introductory Chapter
reference: <Flask Web 开发> Environment Python 3 Mac OSX Introductory Chapter: 安装 1.安装第三方工具 virt ...
使用 if 语句
与很多编程语言一样,if 表达式用来处理逻辑条件.在 R 中,逻辑条件通常表达为某个表达式返回的单值逻辑向量.例如,我们可以写一个简单的函数 check_positive,如果输入一个正数则返回 1, ...
jq 抖动效果
1 .html <div style="margin:50px auto;width:900px;overflow:visible;"> <div id=&quo ...
kafka 官方示例代码--消费者
kafka 0.9.0添加了一套新的Java 消费者API,用以替换之前的high-level API (基于ZK) 和low-level API.新的Java消费者API目前为测试版.另外kafka ...
tenserflow models包的安装
1.下载 models包 https://github.com/tensorflow/models 2.将models包拷贝到本机Python包的安装地址即可,本机Python包的安装地址的查看方式可 ...
唯一索引 && 主键索引
唯一索引唯一索引不允许两行具有相同的索引值. 如果现有数据中存在重复的键值,则大多数数据库都不允许将新创建的唯一索引与表一起保存. 当新数据将使表中的键值重复时,数据库也拒绝接受此数据.例如,如果在 ...
wikioi 1035 火车停留裸费用流
链接:http://wikioi.com/problem/1035/ 怎么说呢,只能说这个建图很有意思.因为只有m条道,然后能互相接在一起的连通,对每个点进行拆点,很有意思的一道裸费用留题. 代码: ...

Spark和YARN

Spark和YARN的更多相关文章

随机推荐

热门专题