1、etcd没有启动的

[root@mcwk8s03 ~]# kubectl get nodes
Unable to connect to the server: context deadline exceeded

启动之后就可以使用了

[root@mcwk8s03 ~]# kubectl get nodes
NAME STATUS ROLES AGE VERSION
mcwk8s05 NotReady <none> 404d v1.15.12
mcwk8s06 NotReady <none> 404d v1.15.12
[root@mcwk8s03 ~]#

2、pod一直重启。首先排查oom,上次重启原因

Containers:
fab-browser-api:
Container ID: docker://9xx
Image: roc.xx79
Image ID: docxxd
Port: 9090/TCP
Host Port: 0/TCP
Command:
java
-Xms1G
-Xmx2G
-XX:MetaspaceSize=64M
-XX:MaxMetaspaceSize=128M
-Xss256K
-XX:+UseConcMarkSweepGC
-XX:CMSFullGCsBeforeCompaction=5
-XX:+UseCMSCompactAtFullCollection
-XX:CMSInitiatingOccupancyFraction=80
-XX:+HeapDumpOnOutOfMemoryError
-XX:HeapDumpPath=./logs/
-DserverName=fxx-api
-jar
/app.jar
State: Running
Started: Mon, 18 Dec 2023 10:12:11 +0800
Last State: Terminated
Reason: OOMKilled
Exit Code: 137
Started: Mon, 18 Dec 2023 04:09:38 +0800
Finished: Mon, 18 Dec 2023 10:12:09 +0800
Ready: True
Restart Count: 36
Limits:
cpu: 1
memory: 2000Mi
Requests:
cpu: 300m
memory: 800Mi
Liveness: http-get http://:9090/argus/health delay=120s timeout=1s period=20s #success=1 #failure=6
Readiness: http-get http://:9090/argus/health delay=120s timeout=1s period=20s #success=1 #failure=6

3、k8s排查问题思路

https://zhuanlan.zhihu.com/p/421693641

https://zhuanlan.zhihu.com/p/651299187

https://blog.csdn.net/weixin_45727359/article/details/128024686

4、有些服务启动慢,默认的健康检查时间需要调整长一些,等服务启动之后再健康检查

现象:发布应用,新起的pod,一直没有启动起来,反复重启。

kubectl describe pod ,查看上次报错,并且事件里提示健康检查没有通过

    State:          Running
Started: Tue, 09 Jan 2024 10:32:56 +0800
Last State: Terminated
Reason: Error
Exit Code: 143
Started: Tue, 09 Jan 2024 10:29:03 +0800
Finished: Tue, 09 Jan 2024 10:32:55 +0800
Ready: True
Restart Count: 1

Warning  Unhealthy  6m30s (x22 over 10m)  kubelet, qa-kube003.xx.x.com  Readiness probe failed:
Get http://10.96.x.x:9090/argus/health: dial tcp 10.x.x.x:9090: connect: connection refused

解决方法:容器的健康检查失败,容器多次重启,偶尔才起来。这次这个是服务启动需要3分钟多,而健康检查200s的时候就开始了。服务还没正常启动起来就检测,导致探测失败。将探测时间延长到250s之后,再次发布,就没有发生重启的现象了,直接就好了

kubectl edit deploy ai-xxl-deploy

复制配置,然后在服务发布里面添加上配置,并且将时间改为250s,发布应用

k8s错误集合的更多相关文章

  1. springboot整合mybatis步骤以及错误集合

    1.首先在springboot项目中的pomx文件引入官方的依赖 <groupId>org.mybatis.spring.boot</groupId> <artifact ...

  2. AndroidStudio NDK配置使用以及错误集合

    Error:Execution failed for task ':app:transformNative_libsWithStripDebugSymbolForDebug'. > java.l ...

  3. jq ajax遇到的错误集合

    一.错误: Uncaught InvalidStateError: Failed to read the 'selectionDirection' property from 'HTMLInputEl ...

  4. ssh框架搭建错误集合

    1,把jsp放入到WEB-INF/view目录下,struts2.xml配置<result name="success">/WEB-INF/view/home.jsp& ...

  5. VS(C++)编程遇到的错误集合

    编译错误 1.error C1010: 原因:没有在文件开头添加include "stdafx.h". 2.error C2440: "=": 无法从" ...

  6. SQL访问EXCEL错误集合

    --行集函数 --1, OPENDATASOURCE 环境:WIN7,SQL 2014,OFFICE 2013 SELECT * FROM OPENDATASOURCE('Microsoft.ACE. ...

  7. Hibernate学习笔记--Hibernate框架错误集合及解决

    错误1:MappingException: Unknown entity解决方案 http://jingyan.baidu.com/article/e75aca8552761b142edac6cf.h ...

  8. IOS 错误集合以及解决办法(持续整理中)

    1 . 如下错误: app:resource fork, Finder information, or similar detritus not al site:forums.developer.ap ...

  9. Spring《错误集合,总结更新》

    1.这几天配置springmvc 使用注解,并且自动扫描注解,当我单个配置,不用自动扫描,出现下面错误,找了很多人跟我看,配置也没问题,但是就是显示不出东西,所说的类也去看了,没有问题 這是我的模拟数 ...

  10. 【Android应用开发】Android Studio 错误集锦 -- 将所有的 AS 错误集合到本文

    . 一. 编译错误 1. "AndroidManifest.xml file not found" 错误 (1) 报错信息 报错信息 : -- Message Make : Inf ...

随机推荐

  1. C#.Net WinForm学习笔记

    .Net WinForm学习笔记 1,MDI窗体设有两个窗体frmMain,frmChild,则:frmMain:  设IsMdiContainer属性为true 打开子窗口:  在相关事件中写如下代 ...

  2. 牛蛙!GoFrame2.7正式版的监控组件真是及时雨

    声明:本文首发在同名公众号:王中阳Go,未经授权禁止转载. GoFrame框架今天发布了v2.7.0正式版本啦! 最大看点 本次版本最大的看点是提供了metric监控组件,主库提供了接口化的metri ...

  3. .gitignore 基础

    前言 gitignore文件有几种方式生成. 1.在创建版本库的时候生成. 2.自己手动添加: windows环境下,不能把文件直接改名为.gitignore,会提示你必须输入文件名.所以我们先新建一 ...

  4. 从LLaMA-Factory项目认识微调

    概述 什么是LLaMA-Factory? LLaMA-Factory是一个在github上开源的,专为大模型训练设计的平台.项目提供中文说明,可以参考官方文档:https://github.com/h ...

  5. 对于小程序canvas在某些情况下touchmove 不能触发导致的签名不连续替代方案(企微)

    1.问题 微信开放社区链接 尝试过新版canvas,在企业微信中签名依然是依然断触,有问题的手机是iphoe15,系统版本以及企微版本微信版本均与签名正常的手机一致,但是那个手机就是无法正常签字,在微 ...

  6. vue 商品sku添加,笛卡尔算法,商品添加。动态生成table,table添加值后 再生成的table 不改变table之前输入的值

    <!DOCTYPE html> <html lang="en"> <head> <meta charset="UTF-8&quo ...

  7. 力扣175(MySQL)-组合两个表(简单)

    题目: 表: Person 表: Address 编写一个SQL查询来报告 Person 表中每个人的姓.名.城市和州.如果 personId 的地址不在 Address 表中,则报告为空  null ...

  8. 力扣453(java)-最小操作次数使数组元素相等(简单)

    题目: 给你一个长度为 n 的整数数组,每次操作将会使 n - 1 个元素增加 1 .返回让数组所有元素相等的最小操作次数. 示例 1: 输入:nums = [1,2,3]输出:3解释:只需要3次操作 ...

  9. 力扣419(java)-甲板上的战舰(中等)

    题目: 给你一个大小为 m x n 的矩阵 board 表示甲板,其中,每个单元格可以是一艘战舰 'X' 或者是一个空位 '.' ,返回在甲板 board 上放置的 战舰 的数量. 战舰 只能水平或者 ...

  10. 牛客网-SQL专项训练16

    ①在book表中,将工具书类型(tool)的书的书架序号都减少2,下列语句正确的是(C) 解析: 题目要求的批量更改,insert 是更改数据,排除B,update与set搭配使用,排除选项D,whe ...