Spark分析之SparkContext启动过程分析

SparkContext作为整个Spark的入口，不管是spark、sparkstreaming、spark sql都需要首先创建一个SparkContext对象，然后基于这个SparkContext进行后续RDD的操作；所以很有必要了解下SparkContext在初始化时干了什么事情。

SparkContext初始化过程主要干了如下几件事情：

1、根据SparkContext的构造入参SparkConf创建SparkEnv；

2、初始化SparkUI;

3、创建TaskScheduler；

4、创建DAGScheduler；

5、启动taskScheduler；

通过源代码说明SparkContext初始化的过程

1、创建SparkEnv

private[spark] val env = SparkEnv.create(

    conf, "<driver>", conf.get("spark.driver.host"), conf.get("spark.driver.port").toInt,

    isDriver = true, isLocal = isLocal, listenerBus = listenerBus)

SparkEnv.set(env)

2、初始化SparkUI

private[spark] val ui = new SparkUI(this)

ui.bind()

3、创建TaskScheduler：根据spark的运行模式创建不同的SchedulerBackend

private[spark] var taskScheduler = SparkContext.createTaskScheduler(this, master)

private def createTaskScheduler(sc: SparkContext, master: String): TaskScheduler = {

    val SPARK_REGEX = """spark://(.*)""".r

    master match {

      case SPARK_REGEX(sparkUrl) =>

        val scheduler = new TaskSchedulerImpl(sc)

        val masterUrls = sparkUrl.split(",").map("spark://" + _)

        val backend = new SparkDeploySchedulerBackend(scheduler, sc, masterUrls)

        scheduler.initialize(backend) //为TaskSchedulerImpl中的backend变量初始化

        scheduler

   }

}

TaskSchedulerImpl extends TaskScheduler{

    var backend: SchedulerBackend = null

    def initialize(backend: SchedulerBackend) {

        this.backend = backend   //将SparkDeploySchedulerBackend赋值给backend变量

        rootPool = new Pool("", schedulingMode, 0, 0)

        schedulableBuilder = {

            schedulingMode match {

                case SchedulingMode.FIFO =>  //先进先出调度

                    new FIFOSchedulableBuilder(rootPool)

                case SchedulingMode.FAIR =>   //公平调度

                    new FairSchedulableBuilder(rootPool, conf)

            }

        }

        schedulableBuilder.buildPools()

    }

}

private[spark] class SparkDeploySchedulerBackend(scheduler: TaskSchedulerImpl,sc: SparkContext,masters: Array[String])

  extends CoarseGrainedSchedulerBackend(scheduler, sc.env.actorSystem) with AppClientListener with Logging {

}

4、创建DAGScheduler：根据TaskScheduler创建DAGScheduler，用于接收提交过来的job

//根据TaskScheduler创建DAGScheduler，产生eventProcssActor(是DAGSchedule的通信载体，能接收和发送很多消息)

@volatile private[spark] var dagScheduler: DAGScheduler = new DAGScheduler(this)

class DAGScheduler{

    def this(sc: SparkContext) = this(sc, sc.taskScheduler)

    private def initializeEventProcessActor() {

        implicit val timeout = Timeout(30 seconds)

        val initEventActorReply =  dagSchedulerActorSupervisor ? Props(new DAGSchedulerEventProcessActor(this))

        eventProcessActor = Await.result(initEventActorReply, timeout.duration).

        asInstanceOf[ActorRef]

    }

    initializeEventProcessActor()

}


//详细分析见DAGScheduler篇章

private[scheduler] class DAGSchedulerEventProcessActor(dagScheduler: DAGScheduler)extends Actor with Logging {{

    override def preStart() {

        dagScheduler.taskScheduler.setDAGScheduler(dagScheduler)

    }

    def receive = {

        case JobSubmitted(jobId, rdd, func, partitions, allowLocal, callSite, listener, properties) =>

            dagScheduler.handleJobSubmitted(jobId, rdd, func, partitions, allowLocal, callSite,listener, properties)

        ......

    }

}

5、启动taskScheduler

启动taskScheduler的主要目的是启动相应的SchedulerBackend，并判断是否进行推测式执行任务；

在启动TaskScheduler的过程中会创建Application并向Master发起注册请求；

taskScheduler.start()

TaskSchedulerImpl extends TaskScheduler{

    var backend: SchedulerBackend = null

    override def start() {

        backend.start()

        //spark.speculation...

    }

}

private[spark] class SparkDeploySchedulerBackend(scheduler: TaskSchedulerImpl,sc: SparkContext,masters: Array[String])

  extends CoarseGrainedSchedulerBackend(scheduler, sc.env.actorSystem) with AppClientListener with Logging {

    var client: AppClient = null

    val maxCores = conf.getOption("spark.cores.max").map(_.toInt)

    override def start() {

        super.start()  //调用CoarseGrainedSchedulerBackend的start()方法

        val driverUrl = "akka.tcp://spark@%s:%s/user/%s".format(

            conf.get("spark.driver.host"), conf.get("spark.driver.port"),

            CoarseGrainedSchedulerBackend.ACTOR_NAME)

        val command = Command(

            "org.apache.spark.executor.CoarseGrainedExecutorBackend", args, sc.executorEnvs,

            classPathEntries, libraryPathEntries, extraJavaOpts)

        val sparkHome = sc.getSparkHome()

        val appDesc = new ApplicationDescription(sc.appName, maxCores, sc.executorMemory, command,

            sparkHome, sc.ui.appUIAddress, sc.eventLogger.map(_.logDir))

        client = new AppClient(sc.env.actorSystem, masters, appDesc, this, conf)

        client.start() 

    }

}

class CoarseGrainedSchedulerBackend(scheduler: TaskSchedulerImpl, actorSystem: ActorSystem) extends SchedulerBackend with Logging

    var driverActor: ActorRef = null

    override def start() {

        driverActor = actorSystem.actorOf(

        Props(new DriverActor(properties)), name = CoarseGrainedSchedulerBackend.ACTOR_NAME)

    }

}

class ClientActor extends Actor with Logging{

    override def preStart() {

        registerWithMaster()  //向Master注册Application

    }

}

CoarseGrainedSchedulerBackend与CoarseGrainedExecutorBackend通信

private[spark] class CoarseGrainedExecutorBackend(driverUrl: String, executorId: String, hostPort: String, cores: Int)

  extends Actor with ExecutorBackend with Logging {

    var executor: Executor = null

    var driver: ActorSelection = null

    override def preStart() {

        logInfo("Connecting to driver: " + driverUrl)

        driver = context.actorSelection(driverUrl)

        driver ! RegisterExecutor(executorId, hostPort, cores)  //注册Executor，接收方是CoarseGrainedSchedulerBackend

        context.system.eventStream.subscribe(self, classOf[RemotingLifecycleEvent])

    }

    override def receive = {

        case RegisteredExecutor(sparkProperties)

        case LaunchTask(taskDesc)

        case KillTask(taskId, _, interruptThread)

        case StopExecutor

    }

}

Spark分析之SparkContext启动过程分析的更多相关文章

Spark分析之Standalone运行过程分析
一.集群启动过程--启动Master $SPARK_HOME/sbin/start-master.sh start-master.sh脚本关键内容: spark-daemon.sh start org ...
Zico源代码分析：执行启动过程分析和总结
事实上已经有童鞋对Zico的源代码和执行过程进行了总结,比如:http://www.cnblogs.com/shuaiwang/p/4522905.html.这里我再补充一些内容. 当我们使用mvn ...
Spark Streaming应用启动过程分析
本文为SparkStreaming源码剖析的第三篇,主要分析SparkStreaming启动过程. 在调用StreamingContext.start方法后,进入JobScheduler.start方 ...
《深入理解Spark：核心思想与源码分析》——SparkContext的初始化（叔篇）——TaskScheduler的启动
<深入理解Spark:核心思想与源码分析>一书前言的内容请看链接<深入理解SPARK:核心思想与源码分析>一书正式出版上市 <深入理解Spark:核心思想与源码分析> ...
spark源码阅读--SparkContext启动过程
##SparkContext启动过程基于spark 2.1.0 scala 2.11.8 spark源码的体系结构实在是很庞大,从使用spark-submit脚本提交任务,到向yarn申请容器,启 ...
Disconf源码分析之启动过程分析下（2）
接上文,下面是第二次扫描的XML配置. <bean id="disconfMgrBean2" class="com.baidu.disconf.client.Dis ...
Linux内核分析（三）内核启动过程分析——构造一个简单的Linux系统
一.系统的启动(各历史节点) 在最开始的时候,计算机的启动实际上依靠一段二进制码,可以这么理解,他并不是一个真正的计算机启动一道程序.计算机在开始加电的时候几乎是没有任何用处的,因为RAM芯片中包括的 ...
u-boot 源码分析(1) 启动过程分析
u-boot 源码分析(1) 启动过程分析文章目录 u-boot 源码分析(1) 启动过程分析前言配置源码结构 api arch board common cmd drivers fs Kbu ...
ASP.Net Core MVC6 RC2 启动过程分析[偏源码分析]
入口程序如果做过Web之外开发的人,应该记得这个是标准的Console或者Winform的入口.为什么会这样呢? .NET Web Development and Tools Blog ASP.NE ...

随机推荐

Python 字典的嵌套
wf = { "name":"汪峰", "age":52, "hobby":["唱歌", " ...
IntelliJ IDEA使用（二）：tomcat和jetty配置(转自：http://www.cnblogs.com/jenkinschan/p/6052948.html)
上一讲用idea创建了maven web项目,接下来我们把项目发布到tomcat和jetty运行,以便进一步地开发和调试配置tomcat 第一.打开菜单栏第二.点击设置按钮,添加应用服务器,选择t ...
如何使用Java读写系统属性？
如何使用Java读写系统属性? 读: Properties props = System.getProperties(); Enumeration prop_names = props.propert ...
liunx的磁盘管理的基本命令
df 查看磁盘占用率 du -sh 查看磁盘多大 sudo fdisk -l 查看硬盘信息 sudo mkfs -t ext3 /dev/sdb1 建立文件系统(相当于格式化) ...
centos7安装mysql5.7的终极解决方案
在centos7中安装最新版本mysql5.7.10可能会出现各种各样的问题,不管出现什么问题,先仔细阅读下面,或许对你有帮助! 1.systemctl stop mysqld.service 关闭m ...
BZOJ3771: Triple【生成函数】
Description 我们讲一个悲伤的故事. 从前有一个贫穷的樵夫在河边砍柴. 这时候河里出现了一个水神,夺过了他的斧头,说: "这把斧头,是不是你的?" 樵夫一看:" ...
HTTP、TCP、UDP以及SOCKET
HTTP.TCP.UDP以及SOCKET 一.TCP/IP代表传输控制协议/网际协议,指的是一系列协组. 可分为四个层次:数据链路层.网络层.传输层和应用层. 在网络层:有IP协议.ICMP协议.AR ...
【正则表达式】java应用正则表达式
一:简单应用 /** * * ' * & * ' * & * & * ' * ' * ' * sources=sdcg'hde&xyz'dfa&&ad' ...
Java调用.Net WebService参数为空解决办法 (远程)调试webservice方法
同事遇到一个很囧的问题,java调,netwebservice的时候,调用无参数方法成功,调用有参数的方法每次我这边的webservice日志都记录参数为空,而我自己.Net程序调用完全没有问题,后面 ...
spring cloud 之 Eureka 知识点
Eureka原理当服务消费者想要调用服务提供者的API时,首先会在注册中心中查询当前可用的实例的网络地址(也可能是定时查询可用实例,本地缓存好可用服务列表),然后再使用客户端负载均衡,命中到其中一个 ...

Spark分析之SparkContext启动过程分析

Spark分析之SparkContext启动过程分析的更多相关文章

随机推荐

热门专题