企业级运维之云原生与Kubernetes实战课程 - 第四章第5讲 ACK集群故障处理与疑难处置

本文涉及的产品
日志服务 SLS,月写入数据量 50GB 1个月
应用型负载均衡 ALB,每月750个小时 15LCU
文件存储 NAS,50GB 3个月
简介: ACK集群故障处理与疑难处置

企业级运维之云原生与Kubernetes实战课程

第四章第5 ACK集群故障处理与疑难处置

 

视频地址:

https://developer.aliyun.com/learning/course/913/detail/14609

 

一、存储疑难与故障

 

1.   在存储方面,常见的问题及可能的原因如下:

 

a.  Pod挂载不上云盘

  • 云盘卷是非共享存储,已经被其他Pod挂载;
  • 云盘和ECS不在一个可用区;
  • flexvolume/csi驱动使用错误;

 

b.  Pod卸载不了云盘

  • Pod所在的ECS将计费方式变为了包年包月(连带云盘也变成包年包月),导致云盘无法从ECS卸载。

 

c.  Pod挂载不了NAS

  • NAS的权限组设置不对;
  • 挂载点或者NAS挂载地址不存在;

 

2.   问题定位:查看驱动日志

 

为了准确定位问题原因,可以先查看驱动日志,阿里云提供的两个主要的存储组件是FlexvolumCSI

 

a.   flexvolume:/var/loq/alicloud/flexvolume*;csi:

flexvolume插件是Kubernetes社区较早实现的存储卷扩展机制,插件包括以下三部分:

  • Flexvolume:负责数据卷的挂载、卸载功能。ACK默认提供云盘、NASOSS三种存储卷的挂载能力;
  • Disk-Controller:负责云盘卷的自动创建能力;
  • Nas-Controller:负责NAS卷的自动创建能力;

 

b.   CSI

CSI插件是当前Kubernetes社区推荐的插件实现方案,ACK集群提供的CSI存储插件兼容社区的CSI特性,插件包括以下两部分:

  • CSI-Plugin:实现数据卷的挂载、卸载功能。ACK默认提供云盘、NASOSS三种存储卷的挂载能力;
  • CSI-Provisioner:实现数据卷的自动创建能力,目前支持云盘、NAS两种存储卷创建能力;

查看csi-plugin Pod的日志;如果是动态存储,还需要查看nas-controller/disk-controller/csi-provisioner的日志。

 

3.   其他存储相关问题

 

a.   NAS存储

  • 现象:PVC无法创建,报错`waitingfor a volume to be created,either by external provisioner "nasplugin.csi.alibabacloud.com" or manually created by system administrator
  • 原因:创建阿里云Kubernetes 1.16之前版本的集群时,若存储插件选择为Flexvolume,则控制台默认安装FlexvolumeDisk-Controller组件,但控制台不会默认安装alicloud-nas-controller组件。

 

参考文档:https://help.aliyun.com/document_detail/86785.html

 

b.   挂载NASPod无法启动

  • 现象:查看pvpvc同时为bound状态,describe pod显示挂载超时;
  • 方法:查看flexvolume日志是否存在FsGroup字段;
  • 原因:FsGroup:1000,表示mount使用uid=1000的特定用户进行挂载,Pod启动的时候,会把NAS挂载的目录下所有的文件权限改成1000,当文件较多的时候,会超过Pod的启动超时时间,导致Pod无法启动。

 

参考文档:https://help.aliyun.com/document_detail/286496.html

 

二、网络疑难与故障

 

常见的网络问题和可能的原因如下:

 

1.  访问slb不通

 

  • 集群内访问不通,ServiceexternalTrafficPolicy策略为Local,非Service的后端Pod所在节点访问Serviceslb IP就会不通;
  • slb配置了黑白名单访问控制(常见的apiserverslb配置了访问控制,控制台查看集群等信息失败)
  • ECS安全组出方向没有放通slbIP

 

2.  访问Ingress不通

 

  • 集群内访问不通,原因同问题1中的第一种原因,因为Ingress IP也是Loadbalancer类型的Serviceslb IP
  • nginx-ingress-controller所在的节点入方向安全组没有放通集群Pod网段;
  • Ingress手动设置了白名单;
  • Ingressyaml配置有问题,导致ingress-controller无法正确加载配置,访问502

 

3.  控制台访问异常

 

  • apiserver出异常,或者apiserverslb流量/连接数超过规格;
  • apiserverslb上设置了黑白名单;

 

4.  Pod 不通

 

  • Pod所在节点的网络设备没有开启forward
  • Pod里进程监听的回环地址;

 

三、Kubectl命令问题

 

Kubectl命令常见的问题和可能的原因如下:

 

1.  ** is forbidden;User ** cannot **错误

 

帐号的集群RBAC权限不够,从报错可以看到是缺少集群范围内的list某个资源的权限,且API Group为核心API组。

 

2.  kubectl get可以,logs/exec不行

 

节点的安全组入方向没有放通kubelet10250端口,kubectlkubelet建联失败。kubectl会先和apiserver建连,然后 apiserver会访问Pod所在节点的kubelet(通过kubelet10250端口)建立连接,kubelet再和Pod通信。

 

3.  kubectl 执行超时

 

  • apiserver服务异常;
  • apiserverslb设置了访问控制;
  • 其他问题:可以通过kubectl --v=8指定命令返回的日志级别来定位。

 

四、 节点自动伸缩问题

 

在节点自动伸缩方面,常见的问题和可能的原因如下:

 

1.  自动伸缩组件kube-autoscale异常

 

集群自动伸缩组件依赖集群的KubernetesWorkerRole-***的角色没有权限去调用弹性伸缩的相关接口。

 

2.  节点不自动扩容

 

  • 集群未达到节点扩容的条件:pod因为节点资源不足而导致状态未pending的情况下才会触发节点扩容,而并非超过自动伸缩设定的阈值;
  • 集群已经达到扩容的条件,但是由于自动伸缩的伸缩组配置的节点不满足Pod的要求,比如:
  • Pod要求创建在杭州可用区D,但是配置的节点的交换机是可用区A
  • Podrequest.cpu4,但是伸缩组节点规格是2C
  • 如果上述两种情况都没有问题,可以通过检查cluster-autoscaler组件日志判断。

 

五、 Service问题

 

Service方面常见的问题和可能的原因如下:

 

1.  lb类型的service一直创建中

 

  • slb可以挂载的backend server的数量已满;
  • ECS可以重复挂载到slb的次数配额已满;
  • cloud-controller-manager组件异常;

 

2.  Service负载不均

 

  • lb类型的service,是按照节点上Pod的数量比例来设置权重,保证Pod负载均衡,但是节点上会负载不均;
  • 使用了长链接以及会话保持功能;

 

如下图所示,在V1.9.3.164-g2105d2e-aliyun之前版本,Local模式的Service其所有后端权重均为100,即所有流量平均分配到这三台ECS上,造成ECS1Pod负载较重而ECS3上的Pod负载较轻,导致Pod负载不均。

 image.png

解决方案:

 

  • 如图所示,在V1.9.3.164-g2105d2e-aliyun之后及V1.9.3.276-g372aa98-aliyun之前版本,CCM会根据Node上部署的Pod数量计算Node权重。经计算三台ECS权重分别为163350,因此流量将大致按照123的比例分配给三台ECSPod负载更加均衡。

 image.png 

计算公式如下:

image.png

  • V1.9.3.276-g372aa98-aliyun及之后版本,CCMNode上部署的Pod数量设置为Node权重,如下图所示,三台ECS的权重分别为123,流量会按照123的比例分配给三台ECSPod负载比上一种方式更加均衡。

 image.png  

计算公式如下:

image.png

3.  无法访问Service的虚拟IP

 

  • 集群外无法访问:Service的虚拟IP在集群内是通过iptables或者ipvs转发来完成的,是虚拟IP,集群外不存在虚拟IP的路由,所以访问不通;
  • 集群内无法ping通:ServiceclusterlP是虚拟IP,只提供端口的转发,不提供icmp转发,所以访问不通;
  • 集群内无法访问ServiceServiceendpoint是空的,或者虽然有endpoint,但是Pod端口不对,或者Pod端口监听绑定的是回环地址。

 

相关实践学习
通过Ingress进行灰度发布
本场景您将运行一个简单的应用,部署一个新的应用用于新的发布,并通过Ingress能力实现灰度发布。
容器应用与集群管理
欢迎来到《容器应用与集群管理》课程,本课程是“云原生容器Clouder认证“系列中的第二阶段。课程将向您介绍与容器集群相关的概念和技术,这些概念和技术可以帮助您了解阿里云容器服务ACK/ACK Serverless的使用。同时,本课程也会向您介绍可以采取的工具、方法和可操作步骤,以帮助您了解如何基于容器服务ACK Serverless构建和管理企业级应用。 学习完本课程后,您将能够: 掌握容器集群、容器编排的基本概念 掌握Kubernetes的基础概念及核心思想 掌握阿里云容器服务ACK/ACK Serverless概念及使用方法 基于容器服务ACK Serverless搭建和管理企业级网站应用
相关文章
|
1天前
|
人工智能 分布式计算 调度
打破资源边界、告别资源浪费:ACK One 多集群Spark和AI作业调度
ACK One多集群Spark作业调度,可以帮助您在不影响集群中正在运行的在线业务的前提下,打破资源边界,根据各集群实际剩余资源来进行调度,最大化您多集群中闲置资源的利用率。
|
12天前
|
Prometheus Kubernetes 监控
OpenAI故障复盘丨如何保障大规模K8s集群稳定性
OpenAI故障复盘丨如何保障大规模K8s集群稳定性
|
14天前
|
Cloud Native 安全 Serverless
云原生应用实战:基于阿里云Serverless的API服务开发与部署
随着云计算的发展,Serverless架构日益流行。阿里云函数计算(Function Compute)作为Serverless服务,让开发者无需管理服务器即可运行代码,按需付费,简化开发运维流程。本文从零开始,介绍如何使用阿里云函数计算开发简单的API服务,并探讨其核心优势与最佳实践。通过Python示例,演示创建、部署及优化API的过程,涵盖环境准备、代码实现、性能优化和安全管理等内容,帮助读者快速上手Serverless开发。
|
16天前
|
运维 分布式计算 Kubernetes
ACK One多集群Service帮助大批量应用跨集群无缝迁移
ACK One多集群Service可以帮助您,在无需关注服务间的依赖,和最小化迁移风险的前提下,完成跨集群无缝迁移大批量应用。
|
2月前
|
缓存 容灾 网络协议
ACK One多集群网关:实现高效容灾方案
ACK One多集群网关可以帮助您快速构建同城跨AZ多活容灾系统、混合云同城跨AZ多活容灾系统,以及异地容灾系统。
|
3月前
|
Kubernetes Ubuntu 网络安全
ubuntu使用kubeadm搭建k8s集群
通过以上步骤,您可以在 Ubuntu 系统上使用 kubeadm 成功搭建一个 Kubernetes 集群。本文详细介绍了从环境准备、安装 Kubernetes 组件、初始化集群到管理和使用集群的完整过程,希望对您有所帮助。在实际应用中,您可以根据具体需求调整配置,进一步优化集群性能和安全性。
185 12
|
3月前
|
Prometheus Kubernetes 监控
OpenAI故障复盘 - 阿里云容器服务与可观测产品如何保障大规模K8s集群稳定性
聚焦近日OpenAI的大规模K8s集群故障,介绍阿里云容器服务与可观测团队在大规模K8s场景下我们的建设与沉淀。以及分享对类似故障问题的应对方案:包括在K8s和Prometheus的高可用架构设计方面、事前事后的稳定性保障体系方面。
|
3月前
|
Kubernetes 网络协议 应用服务中间件
Kubernetes Ingress:灵活的集群外部网络访问的利器
《Kubernetes Ingress:集群外部访问的利器-打造灵活的集群网络》介绍了如何通过Ingress实现Kubernetes集群的外部访问。前提条件是已拥有Kubernetes集群并安装了kubectl工具。文章详细讲解了Ingress的基本组成(Ingress Controller和资源对象),选择合适的版本,以及具体的安装步骤,如下载配置文件、部署Nginx Ingress Controller等。此外,还提供了常见问题的解决方案,例如镜像下载失败的应对措施。最后,通过部署示例应用展示了Ingress的实际使用方法。
103 2
|
3月前
|
存储 Kubernetes 开发者
容器化时代的领航者:Docker 和 Kubernetes 云原生时代的黄金搭档
Docker 是一种开源的应用容器引擎,允许开发者将应用程序及其依赖打包成可移植的镜像,并在任何支持 Docker 的平台上运行。其核心概念包括镜像、容器和仓库。镜像是只读的文件系统,容器是镜像的运行实例,仓库用于存储和分发镜像。Kubernetes(k8s)则是容器集群管理系统,提供自动化部署、扩展和维护等功能,支持服务发现、负载均衡、自动伸缩等特性。两者结合使用,可以实现高效的容器化应用管理和运维。Docker 主要用于单主机上的容器管理,而 Kubernetes 则专注于跨多主机的容器编排与调度。尽管 k8s 逐渐减少了对 Docker 作为容器运行时的支持,但 Doc
215 5
容器化时代的领航者:Docker 和 Kubernetes 云原生时代的黄金搭档
|
3月前
|
存储 Kubernetes 关系型数据库
阿里云ACK备份中心,K8s集群业务应用数据的一站式灾备方案
本文源自2024云栖大会苏雅诗的演讲,探讨了K8s集群业务为何需要灾备及其重要性。文中强调了集群与业务高可用配置对稳定性的重要性,并指出人为误操作等风险,建议实施周期性和特定情况下的灾备措施。针对容器化业务,提出了灾备的新特性与需求,包括工作负载为核心、云资源信息的备份,以及有状态应用的数据保护。介绍了ACK推出的备份中心解决方案,支持命名空间、标签、资源类型等维度的备份,并具备存储卷数据保护功能,能够满足GitOps流程企业的特定需求。此外,还详细描述了备份中心的使用流程、控制台展示、灾备难点及解决方案等内容,展示了备份中心如何有效应对K8s集群资源和存储卷数据的灾备挑战。

热门文章

最新文章