《k8s-1.13版本源码分析》- 调度器设计
本文原始地址:https://farmer-hutao.github.io/k8s-source-code-analysis/core/scheduler/desigh.html
github项目地址:https://github.com/farmer-hutao/k8s-source-code-analysis
1. 概述
我们先整体了解一下Scheduler的设计原理,然后再看这些过程是如何用代码实现的。关于调度器的设计在官网有介绍,我下面结合官网给的说明,简化掉不影响理解的复杂部分,和大家介绍一下Scheduler的工作过程。
英文还可以的小伙伴们可以看一下官网的介绍先:scheduler.md
官网有一段描述如下:
The Kubernetes scheduler runs as a process alongside the other master components such as the API server. Its interface to the API server is to watch for Pods with an empty PodSpec.NodeName, and for each Pod, it posts a binding indicating where the Pod should be scheduled.
简单翻译一下,也就是说Scheduler是一个跑在其他组件边上的独立程序,对接Apiserver寻找PodSpec.NodeName为空的Pod,然后用post的方式发送一个api调用,指定这些pod应该跑在哪个node上。
通俗地说,就是scheduler是相对独立的一个组件,主动访问api server,寻找等待调度的pod,然后通过一系列调度算法寻找哪个node适合跑这个pod,然后将这个pod和node的绑定关系发给api server,从而完成了调度的过程。
2. 源码层级
从高level看,scheduler的源码可以分为3层:
cmd/kube-scheduler/scheduler.go: main() 函数入口位置,在scheduler过程开始被调用前的一系列初始化工作。pkg/scheduler/scheduler.go: 调度框架的整体逻辑,在具体的调度算法之上的框架性的代码。pkg/scheduler/core/generic_scheduler.go: 具体的计算哪些node适合跑哪些pod的算法。
3. 调度算法
调度过程整体如下图所示(官文里这个图没对齐,逼疯强迫症了!!!当然由于中文显示的问题,下图有中文的行也没法完全对齐,这个地方让我很抓狂。。。):
对于一个给定的pod
+---------------------------------------------+
| 可用于调度的nodes如下: |
| +--------+ +--------+ +--------+ |
| | node 1 | | node 2 | | node 3 | |
| +--------+ +--------+ +--------+ |
+----------------------+----------------------+
|
v
+----------------------+----------------------+
初步过滤: node 3 资源不足
+----------------------+----------------------+
|
v
+----------------------+----------------------+
| 剩下的nodes: |
| +--------+ +--------+ |
| | node 1 | | node 2 | |
| +--------+ +--------+ |
+----------------------+----------------------+
|
v
+----------------------+----------------------+
优先级算法计算结果: node 1: 分数=2
node 2: 分数=5
+----------------------+----------------------+
|
v
选择分值最高的节点 = node 2
Scheduler为每个pod寻找一个适合其运行的node,大体分成三步:
- 通过一系列的“predicates”过滤掉不能运行pod的node,比如一个pod需要500M的内存,有些节点剩余内存只有100M了,就会被剔除;
- 通过一系列的“priority functions”给剩下的node排一个等级,分出三六九等,寻找能够运行pod的若干node中最合适的一个node;
- 得分最高的一个node,也就是被“priority functions”选中的node胜出了,获得了跑对应pod的资格。
4. Predicates 和 priorities 策略
Predicates是一些用于过滤不合适node的策略 . Priorities是一些用于区分node排名(分数)的策略(作用在通过predicates过滤的node上). K8s默认内建了一些predicates 和 priorities 策略,官方文档介绍地址: scheduler_algorithm.md. Predicates 和 priorities 的代码分别在:
- pkg/scheduler/algorithm/predicates/predicates.go
- pkg/scheduler/algorithm/priorities.
5. Scheduler 的拓展性
我们可以选择哪些预置策略生效,也可以添加自己的策略。几个月前我司有个奇葩调度需求,当时我就是通过增加一个priorities策略,然后重新编译了一个Scheduler来实现的需求。
6. 调度策略的修改
默认调度策略是通过defaultPredicates() 和 defaultPriorities()函数定义的,源码在 pkg/scheduler/algorithmprovider/defaults/defaults.go,我们可以通过命令行flag --policy-config-file来覆盖默认行为。所以我们可以通过配置文件的方式或者修改pkg/scheduler/algorithm/predicates/predicates.go/pkg/scheduler/algorithm/priorities,然后注册到defaultPredicates()/defaultPriorities()来实现。配置文件类似下面这个样子:
{
"kind" : "Policy",
"apiVersion" : "v1",
"predicates" : [
{"name" : "PodFitsHostPorts"},
{"name" : "PodFitsResources"},
{"name" : "NoDiskConflict"},
{"name" : "NoVolumeZoneConflict"},
{"name" : "MatchNodeSelector"},
{"name" : "HostName"}
],
"priorities" : [
{"name" : "LeastRequestedPriority", "weight" : 1},
{"name" : "BalancedResourceAllocation", "weight" : 1},
{"name" : "ServiceSpreadingPriority", "weight" : 1},
{"name" : "EqualPriority", "weight" : 1}
],
"hardPodAffinitySymmetricWeight" : 10,
"alwaysCheckAllPredicates" : false
}
ok,看到这里大伙应该在流程上对Scheduler的原理有个感性的认识了,下一节我们就开始看一下Scheduler源码是怎么写的。

《k8s-1.13版本源码分析》- 调度器设计的更多相关文章
- 《k8s-1.13版本源码分析》-调度器初始化
源码分析系列文章已经开源到github,地址如下: github:https://github.com/farmer-hutao/k8s-source-code-analysis gitbook:ht ...
- 《k8s-1.13版本源码分析》-调度预选
本文大纲 预选流程 predicate的并发 一个node的predicate predicates的顺序 单个predicate执行过程 具体的predicate函数 本系列文章已经开源到githu ...
- 《k8s-1.13版本源码分析》-抢占调度
源码分析系列文章已经开源到github,地址如下: github:https://github.com/farmer-hutao/k8s-source-code-analysis gitbook:ht ...
- 《k8s-1.13版本源码分析》-调度器框架
本文原始地址(gitbook格式):https://farmer-hutao.github.io/k8s-source-code-analysis/core/scheduler/scheduler-f ...
- 《k8s-1.13版本源码分析》-调度优选
源码分析系列文章已经开源到github,地址如下: github:https://github.com/farmer-hutao/k8s-source-code-analysis gitbook:ht ...
- 《k8s-1.13版本源码分析》-源码调试
源码分析系列文章已经开源到github,地址如下: github:https://github.com/farmer-hutao/k8s-source-code-analysis gitbook:ht ...
- 《k8s-1.13版本源码分析》- Scheduler启动前逻辑
本文原始地址(gitbook格式):https://farmer-hutao.github.io/k8s-source-code-analysis/core/scheduler/before-sche ...
- 《k8s-1.13版本源码分析》- Informer 机制
源码分析系列文章已经开源到github,地址如下: github:https://github.com/farmer-hutao/k8s-source-code-analysis gitbook:ht ...
- 《k8s-1.13版本源码分析》上github
要干嘛? 猪年新气象,今年开始,kubernetes源码分析系列文章主战场从微信公众号转至github,完全使用Markdown重写,使用gitbook生成web页面,支持在线阅读,导出pdf等各种玩 ...
随机推荐
- ubuntu16+zabbix3.4+grafana环境搭建记录
最近研究了zabbix,稍后放上环境搭建教程,建议想学习搭建的同学记得参考zabbix官网
- 安装ubuntu系统及ubuntu安装Python的几点心得
一.安装ubuntu系统 1.ubuntu系统是Linux系统的一种,和centos差别不大,但是个人还是建议大家安装ubuntu,它更适合国内使用习惯,换句话说更亲切. 2.安装方法不再赘述,网上有 ...
- Spring Cloud分布式微服务系统中利用redssion实现分布式锁
在非分布式系统中要实现锁的机制很简单,利用java.util.concurrent.locks包下的Lock和关键字synchronized都可以实现.但是在分布式系统中,如何实现各个单独的微服务需要 ...
- LoadRunner 11 中Analysis分析
原文:http://www.cnblogs.com/Chilam007/p/6445165.html analysis简介 分析器就是对测试结果数据进行分析的组件,它是LR三大组件之一,保存着大量用来 ...
- git学习(持续踩坑中🤣)
https://segmentfault.com/q/1010000002457936 常见指令: 一.创建版本库 $ mkdir learngit 创建文件夹 $ cd learngit 进入文件夹 ...
- Python中str()与repr()函数的区别
在 Python 中要将某一类型的变量或者常量转换为字符串对象通常有两种方法,即str()或者 repr() . >>> a = 10 >>> type(str(a ...
- CSS3实现轴心为x轴的3D数字圆环
当做混合开发时,总有各种意想不到的酷炫效果的需求等着你.不过这个还好,先备着方便以后用. 先上效果图: 总结一下:此效果的完成基于以下几个关键点: 1.DOM结构,为每个DIV设置旋转后,一次也会影响 ...
- 自动化测试基础二(Python基础)
1.为什么学习Python 1)简单.易学 2)强大:交互性.解释性.编译性.跨平台 3)市场需求上升快.顺应市场需要 4)自动化测试需要使用编程语言来写脚本 2.需要学习Python哪些内容? 1) ...
- HashMap和LinkedHashMap的区别
参考:https://blog.csdn.net/a822631129/article/details/78520111 java为数据结构中的映射定义了一个接口java.util.Map;它有四个实 ...
- USACO JAN14 奶牛冰壶运动 凸包+判定
满足条件的一定是在凸包内的,直接判断 恬不知耻的加了特判,2333 #include<cstdio> #include<iostream> #include<cstrin ...