企业级运维之云原生与Kubernetes实战课程 - 第四章第5讲 ACK集群故障处理与疑难处置

简介: ACK集群故障处理与疑难处置

企业级运维之云原生与Kubernetes实战课程

第四章第5 ACK集群故障处理与疑难处置

 

视频地址:

https://developer.aliyun.com/learning/course/913/detail/14609

 

一、存储疑难与故障

 

1.   在存储方面,常见的问题及可能的原因如下:

 

a.  Pod挂载不上云盘

  • 云盘卷是非共享存储,已经被其他Pod挂载;
  • 云盘和ECS不在一个可用区;
  • flexvolume/csi驱动使用错误;

 

b.  Pod卸载不了云盘

  • Pod所在的ECS将计费方式变为了包年包月(连带云盘也变成包年包月),导致云盘无法从ECS卸载。

 

c.  Pod挂载不了NAS

  • NAS的权限组设置不对;
  • 挂载点或者NAS挂载地址不存在;

 

2.   问题定位:查看驱动日志

 

为了准确定位问题原因,可以先查看驱动日志,阿里云提供的两个主要的存储组件是FlexvolumCSI

 

a.   flexvolume:/var/loq/alicloud/flexvolume*;csi:

flexvolume插件是Kubernetes社区较早实现的存储卷扩展机制,插件包括以下三部分:

  • Flexvolume:负责数据卷的挂载、卸载功能。ACK默认提供云盘、NASOSS三种存储卷的挂载能力;
  • Disk-Controller:负责云盘卷的自动创建能力;
  • Nas-Controller:负责NAS卷的自动创建能力;

 

b.   CSI

CSI插件是当前Kubernetes社区推荐的插件实现方案,ACK集群提供的CSI存储插件兼容社区的CSI特性,插件包括以下两部分:

  • CSI-Plugin:实现数据卷的挂载、卸载功能。ACK默认提供云盘、NASOSS三种存储卷的挂载能力;
  • CSI-Provisioner:实现数据卷的自动创建能力,目前支持云盘、NAS两种存储卷创建能力;

查看csi-plugin Pod的日志;如果是动态存储,还需要查看nas-controller/disk-controller/csi-provisioner的日志。

 

3.   其他存储相关问题

 

a.   NAS存储

  • 现象:PVC无法创建,报错`waitingfor a volume to be created,either by external provisioner "nasplugin.csi.alibabacloud.com" or manually created by system administrator
  • 原因:创建阿里云Kubernetes 1.16之前版本的集群时,若存储插件选择为Flexvolume,则控制台默认安装FlexvolumeDisk-Controller组件,但控制台不会默认安装alicloud-nas-controller组件。

 

参考文档:https://help.aliyun.com/document_detail/86785.html

 

b.   挂载NASPod无法启动

  • 现象:查看pvpvc同时为bound状态,describe pod显示挂载超时;
  • 方法:查看flexvolume日志是否存在FsGroup字段;
  • 原因:FsGroup:1000,表示mount使用uid=1000的特定用户进行挂载,Pod启动的时候,会把NAS挂载的目录下所有的文件权限改成1000,当文件较多的时候,会超过Pod的启动超时时间,导致Pod无法启动。

 

参考文档:https://help.aliyun.com/document_detail/286496.html

 

二、网络疑难与故障

 

常见的网络问题和可能的原因如下:

 

1.  访问slb不通

 

  • 集群内访问不通,ServiceexternalTrafficPolicy策略为Local,非Service的后端Pod所在节点访问Serviceslb IP就会不通;
  • slb配置了黑白名单访问控制(常见的apiserverslb配置了访问控制,控制台查看集群等信息失败)
  • ECS安全组出方向没有放通slbIP

 

2.  访问Ingress不通

 

  • 集群内访问不通,原因同问题1中的第一种原因,因为Ingress IP也是Loadbalancer类型的Serviceslb IP
  • nginx-ingress-controller所在的节点入方向安全组没有放通集群Pod网段;
  • Ingress手动设置了白名单;
  • Ingressyaml配置有问题,导致ingress-controller无法正确加载配置,访问502

 

3.  控制台访问异常

 

  • apiserver出异常,或者apiserverslb流量/连接数超过规格;
  • apiserverslb上设置了黑白名单;

 

4.  Pod 不通

 

  • Pod所在节点的网络设备没有开启forward
  • Pod里进程监听的回环地址;

 

三、Kubectl命令问题

 

Kubectl命令常见的问题和可能的原因如下:

 

1.  ** is forbidden;User ** cannot **错误

 

帐号的集群RBAC权限不够,从报错可以看到是缺少集群范围内的list某个资源的权限,且API Group为核心API组。

 

2.  kubectl get可以,logs/exec不行

 

节点的安全组入方向没有放通kubelet10250端口,kubectlkubelet建联失败。kubectl会先和apiserver建连,然后 apiserver会访问Pod所在节点的kubelet(通过kubelet10250端口)建立连接,kubelet再和Pod通信。

 

3.  kubectl 执行超时

 

  • apiserver服务异常;
  • apiserverslb设置了访问控制;
  • 其他问题:可以通过kubectl --v=8指定命令返回的日志级别来定位。

 

四、 节点自动伸缩问题

 

在节点自动伸缩方面,常见的问题和可能的原因如下:

 

1.  自动伸缩组件kube-autoscale异常

 

集群自动伸缩组件依赖集群的KubernetesWorkerRole-***的角色没有权限去调用弹性伸缩的相关接口。

 

2.  节点不自动扩容

 

  • 集群未达到节点扩容的条件:pod因为节点资源不足而导致状态未pending的情况下才会触发节点扩容,而并非超过自动伸缩设定的阈值;
  • 集群已经达到扩容的条件,但是由于自动伸缩的伸缩组配置的节点不满足Pod的要求,比如:
  • Pod要求创建在杭州可用区D,但是配置的节点的交换机是可用区A
  • Podrequest.cpu4,但是伸缩组节点规格是2C
  • 如果上述两种情况都没有问题,可以通过检查cluster-autoscaler组件日志判断。

 

五、 Service问题

 

Service方面常见的问题和可能的原因如下:

 

1.  lb类型的service一直创建中

 

  • slb可以挂载的backend server的数量已满;
  • ECS可以重复挂载到slb的次数配额已满;
  • cloud-controller-manager组件异常;

 

2.  Service负载不均

 

  • lb类型的service,是按照节点上Pod的数量比例来设置权重,保证Pod负载均衡,但是节点上会负载不均;
  • 使用了长链接以及会话保持功能;

 

如下图所示,在V1.9.3.164-g2105d2e-aliyun之前版本,Local模式的Service其所有后端权重均为100,即所有流量平均分配到这三台ECS上,造成ECS1Pod负载较重而ECS3上的Pod负载较轻,导致Pod负载不均。

 image.png

解决方案:

 

  • 如图所示,在V1.9.3.164-g2105d2e-aliyun之后及V1.9.3.276-g372aa98-aliyun之前版本,CCM会根据Node上部署的Pod数量计算Node权重。经计算三台ECS权重分别为163350,因此流量将大致按照123的比例分配给三台ECSPod负载更加均衡。

 image.png 

计算公式如下:

image.png

  • V1.9.3.276-g372aa98-aliyun及之后版本,CCMNode上部署的Pod数量设置为Node权重,如下图所示,三台ECS的权重分别为123,流量会按照123的比例分配给三台ECSPod负载比上一种方式更加均衡。

 image.png  

计算公式如下:

image.png

3.  无法访问Service的虚拟IP

 

  • 集群外无法访问:Service的虚拟IP在集群内是通过iptables或者ipvs转发来完成的,是虚拟IP,集群外不存在虚拟IP的路由,所以访问不通;
  • 集群内无法ping通:ServiceclusterlP是虚拟IP,只提供端口的转发,不提供icmp转发,所以访问不通;
  • 集群内无法访问ServiceServiceendpoint是空的,或者虽然有endpoint,但是Pod端口不对,或者Pod端口监听绑定的是回环地址。

 

相关实践学习
深入解析Docker容器化技术
Docker是一个开源的应用容器引擎,让开发者可以打包他们的应用以及依赖包到一个可移植的容器中,然后发布到任何流行的Linux机器上,也可以实现虚拟化,容器是完全使用沙箱机制,相互之间不会有任何接口。Docker是世界领先的软件容器平台。开发人员利用Docker可以消除协作编码时“在我的机器上可正常工作”的问题。运维人员利用Docker可以在隔离容器中并行运行和管理应用,获得更好的计算密度。企业利用Docker可以构建敏捷的软件交付管道,以更快的速度、更高的安全性和可靠的信誉为Linux和Windows Server应用发布新功能。 在本套课程中,我们将全面的讲解Docker技术栈,从环境安装到容器、镜像操作以及生产环境如何部署开发的微服务应用。本课程由黑马程序员提供。     相关的阿里云产品:容器服务 ACK 容器服务 Kubernetes 版(简称 ACK)提供高性能可伸缩的容器应用管理能力,支持企业级容器化应用的全生命周期管理。整合阿里云虚拟化、存储、网络和安全能力,打造云端最佳容器化应用运行环境。 了解产品详情: https://www.aliyun.com/product/kubernetes
相关文章
|
8月前
|
Kubernetes Devops 应用服务中间件
基于 Azure DevOps 与阿里云 ACK 构建企业级 CI/CD 流水线
本文介绍如何结合阿里云 ACK 与 Azure DevOps 搭建自动化部署流程,涵盖集群创建、流水线配置、应用部署与公网暴露,助力企业高效落地云原生 DevOps 实践。
941 2
|
7月前
|
Cloud Native Serverless API
微服务架构实战指南:从单体应用到云原生的蜕变之路
🌟蒋星熠Jaxonic,代码为舟的星际旅人。深耕微服务架构,擅以DDD拆分服务、构建高可用通信与治理体系。分享从单体到云原生的实战经验,探索技术演进的无限可能。
微服务架构实战指南:从单体应用到云原生的蜕变之路
|
存储 Kubernetes 测试技术
企业级LLM推理部署新范式:基于ACK的DeepSeek蒸馏模型生产环境落地指南
企业级LLM推理部署新范式:基于ACK的DeepSeek蒸馏模型生产环境落地指南
807 12
|
存储 Kubernetes 测试技术
企业级LLM推理部署新范式:基于ACK的DeepSeek蒸馏模型生产环境落地指南
本教程演示如何在ACK中使用vLLM框架快速部署DeepSeek R1模型推理服务。
|
Cloud Native 安全 Serverless
云原生应用实战:基于阿里云Serverless的API服务开发与部署
随着云计算的发展,Serverless架构日益流行。阿里云函数计算(Function Compute)作为Serverless服务,让开发者无需管理服务器即可运行代码,按需付费,简化开发运维流程。本文从零开始,介绍如何使用阿里云函数计算开发简单的API服务,并探讨其核心优势与最佳实践。通过Python示例,演示创建、部署及优化API的过程,涵盖环境准备、代码实现、性能优化和安全管理等内容,帮助读者快速上手Serverless开发。
|
Kubernetes 持续交付 数据库
阿里云ACK+GitLab企业级部署实战教程
GitLab 是一个功能强大的基于 Web 的 DevOps 生命周期平台,整合了源代码管理、持续集成/持续部署(CI/CD)、项目管理等多种工具。其一体化设计使得开发团队能够在同一平台上进行代码协作、自动化构建与部署及全面的项目监控,极大提升了开发效率和项目透明度。 GitLab 的优势在于其作为一体化平台减少了工具切换,高度可定制以满足不同项目需求,并拥有活跃的开源社区和企业级功能,如高级权限管理和专业的技术支持。借助这些优势,GitLab 成为许多开发团队首选的 DevOps 工具,实现从代码编写到生产部署的全流程自动化和优化。
|
存储 Kubernetes 开发者
容器化时代的领航者:Docker 和 Kubernetes 云原生时代的黄金搭档
Docker 是一种开源的应用容器引擎,允许开发者将应用程序及其依赖打包成可移植的镜像,并在任何支持 Docker 的平台上运行。其核心概念包括镜像、容器和仓库。镜像是只读的文件系统,容器是镜像的运行实例,仓库用于存储和分发镜像。Kubernetes(k8s)则是容器集群管理系统,提供自动化部署、扩展和维护等功能,支持服务发现、负载均衡、自动伸缩等特性。两者结合使用,可以实现高效的容器化应用管理和运维。Docker 主要用于单主机上的容器管理,而 Kubernetes 则专注于跨多主机的容器编排与调度。尽管 k8s 逐渐减少了对 Docker 作为容器运行时的支持,但 Doc
775 5
容器化时代的领航者:Docker 和 Kubernetes 云原生时代的黄金搭档
|
存储 Cloud Native 数据处理
从嵌入式状态管理到云原生架构:Apache Flink 的演进与下一代增量计算范式
本文整理自阿里云资深技术专家、Apache Flink PMC 成员梅源在 Flink Forward Asia 新加坡 2025上的分享,深入解析 Flink 状态管理系统的发展历程,从核心设计到 Flink 2.0 存算分离架构,并展望未来基于流批一体的通用增量计算方向。
576 0
从嵌入式状态管理到云原生架构:Apache Flink 的演进与下一代增量计算范式
|
9月前
|
运维 监控 Cloud Native
从本土到全球,云原生架构护航灵犀互娱游戏出海
本文内容整理自「 2025 中企出海大会·游戏与互娱出海分论坛」,灵犀互娱基础架构负责人朱晓靖的演讲内容,从技术层面分享云原生架构护航灵犀互娱游戏出海经验。
753 15
|
9月前
|
运维 监控 Cloud Native
从本土到全球,云原生架构护航灵犀互娱游戏出海
内容整理自「 2025 中企出海大会·游戏与互娱出海分论坛」,灵犀互娱基础架构负责人朱晓靖的演讲内容,从技术层面分享云原生架构护航灵犀互娱游戏出海经验。

热门文章

最新文章