企业级运维之云原生与Kubernetes实战课程 - 第四章第5讲 ACK集群故障处理与疑难处置

本文涉及的产品
网络型负载均衡 NLB,每月750个小时 15LCU
传统型负载均衡 CLB,每月750个小时 15LCU
日志服务 SLS,月写入数据量 50GB 1个月
简介: ACK集群故障处理与疑难处置

企业级运维之云原生与Kubernetes实战课程

第四章第5 ACK集群故障处理与疑难处置

 

视频地址:

https://developer.aliyun.com/learning/course/913/detail/14609

 

一、存储疑难与故障

 

1.   在存储方面,常见的问题及可能的原因如下:

 

a.  Pod挂载不上云盘

  • 云盘卷是非共享存储,已经被其他Pod挂载;
  • 云盘和ECS不在一个可用区;
  • flexvolume/csi驱动使用错误;

 

b.  Pod卸载不了云盘

  • Pod所在的ECS将计费方式变为了包年包月(连带云盘也变成包年包月),导致云盘无法从ECS卸载。

 

c.  Pod挂载不了NAS

  • NAS的权限组设置不对;
  • 挂载点或者NAS挂载地址不存在;

 

2.   问题定位:查看驱动日志

 

为了准确定位问题原因,可以先查看驱动日志,阿里云提供的两个主要的存储组件是FlexvolumCSI

 

a.   flexvolume:/var/loq/alicloud/flexvolume*;csi:

flexvolume插件是Kubernetes社区较早实现的存储卷扩展机制,插件包括以下三部分:

  • Flexvolume:负责数据卷的挂载、卸载功能。ACK默认提供云盘、NASOSS三种存储卷的挂载能力;
  • Disk-Controller:负责云盘卷的自动创建能力;
  • Nas-Controller:负责NAS卷的自动创建能力;

 

b.   CSI

CSI插件是当前Kubernetes社区推荐的插件实现方案,ACK集群提供的CSI存储插件兼容社区的CSI特性,插件包括以下两部分:

  • CSI-Plugin:实现数据卷的挂载、卸载功能。ACK默认提供云盘、NASOSS三种存储卷的挂载能力;
  • CSI-Provisioner:实现数据卷的自动创建能力,目前支持云盘、NAS两种存储卷创建能力;

查看csi-plugin Pod的日志;如果是动态存储,还需要查看nas-controller/disk-controller/csi-provisioner的日志。

 

3.   其他存储相关问题

 

a.   NAS存储

  • 现象:PVC无法创建,报错`waitingfor a volume to be created,either by external provisioner "nasplugin.csi.alibabacloud.com" or manually created by system administrator
  • 原因:创建阿里云Kubernetes 1.16之前版本的集群时,若存储插件选择为Flexvolume,则控制台默认安装FlexvolumeDisk-Controller组件,但控制台不会默认安装alicloud-nas-controller组件。

 

参考文档:https://help.aliyun.com/document_detail/86785.html

 

b.   挂载NASPod无法启动

  • 现象:查看pvpvc同时为bound状态,describe pod显示挂载超时;
  • 方法:查看flexvolume日志是否存在FsGroup字段;
  • 原因:FsGroup:1000,表示mount使用uid=1000的特定用户进行挂载,Pod启动的时候,会把NAS挂载的目录下所有的文件权限改成1000,当文件较多的时候,会超过Pod的启动超时时间,导致Pod无法启动。

 

参考文档:https://help.aliyun.com/document_detail/286496.html

 

二、网络疑难与故障

 

常见的网络问题和可能的原因如下:

 

1.  访问slb不通

 

  • 集群内访问不通,ServiceexternalTrafficPolicy策略为Local,非Service的后端Pod所在节点访问Serviceslb IP就会不通;
  • slb配置了黑白名单访问控制(常见的apiserverslb配置了访问控制,控制台查看集群等信息失败)
  • ECS安全组出方向没有放通slbIP

 

2.  访问Ingress不通

 

  • 集群内访问不通,原因同问题1中的第一种原因,因为Ingress IP也是Loadbalancer类型的Serviceslb IP
  • nginx-ingress-controller所在的节点入方向安全组没有放通集群Pod网段;
  • Ingress手动设置了白名单;
  • Ingressyaml配置有问题,导致ingress-controller无法正确加载配置,访问502

 

3.  控制台访问异常

 

  • apiserver出异常,或者apiserverslb流量/连接数超过规格;
  • apiserverslb上设置了黑白名单;

 

4.  Pod 不通

 

  • Pod所在节点的网络设备没有开启forward
  • Pod里进程监听的回环地址;

 

三、Kubectl命令问题

 

Kubectl命令常见的问题和可能的原因如下:

 

1.  ** is forbidden;User ** cannot **错误

 

帐号的集群RBAC权限不够,从报错可以看到是缺少集群范围内的list某个资源的权限,且API Group为核心API组。

 

2.  kubectl get可以,logs/exec不行

 

节点的安全组入方向没有放通kubelet10250端口,kubectlkubelet建联失败。kubectl会先和apiserver建连,然后 apiserver会访问Pod所在节点的kubelet(通过kubelet10250端口)建立连接,kubelet再和Pod通信。

 

3.  kubectl 执行超时

 

  • apiserver服务异常;
  • apiserverslb设置了访问控制;
  • 其他问题:可以通过kubectl --v=8指定命令返回的日志级别来定位。

 

四、 节点自动伸缩问题

 

在节点自动伸缩方面,常见的问题和可能的原因如下:

 

1.  自动伸缩组件kube-autoscale异常

 

集群自动伸缩组件依赖集群的KubernetesWorkerRole-***的角色没有权限去调用弹性伸缩的相关接口。

 

2.  节点不自动扩容

 

  • 集群未达到节点扩容的条件:pod因为节点资源不足而导致状态未pending的情况下才会触发节点扩容,而并非超过自动伸缩设定的阈值;
  • 集群已经达到扩容的条件,但是由于自动伸缩的伸缩组配置的节点不满足Pod的要求,比如:
  • Pod要求创建在杭州可用区D,但是配置的节点的交换机是可用区A
  • Podrequest.cpu4,但是伸缩组节点规格是2C
  • 如果上述两种情况都没有问题,可以通过检查cluster-autoscaler组件日志判断。

 

五、 Service问题

 

Service方面常见的问题和可能的原因如下:

 

1.  lb类型的service一直创建中

 

  • slb可以挂载的backend server的数量已满;
  • ECS可以重复挂载到slb的次数配额已满;
  • cloud-controller-manager组件异常;

 

2.  Service负载不均

 

  • lb类型的service,是按照节点上Pod的数量比例来设置权重,保证Pod负载均衡,但是节点上会负载不均;
  • 使用了长链接以及会话保持功能;

 

如下图所示,在V1.9.3.164-g2105d2e-aliyun之前版本,Local模式的Service其所有后端权重均为100,即所有流量平均分配到这三台ECS上,造成ECS1Pod负载较重而ECS3上的Pod负载较轻,导致Pod负载不均。

 image.png

解决方案:

 

  • 如图所示,在V1.9.3.164-g2105d2e-aliyun之后及V1.9.3.276-g372aa98-aliyun之前版本,CCM会根据Node上部署的Pod数量计算Node权重。经计算三台ECS权重分别为163350,因此流量将大致按照123的比例分配给三台ECSPod负载更加均衡。

 image.png 

计算公式如下:

image.png

  • V1.9.3.276-g372aa98-aliyun及之后版本,CCMNode上部署的Pod数量设置为Node权重,如下图所示,三台ECS的权重分别为123,流量会按照123的比例分配给三台ECSPod负载比上一种方式更加均衡。

 image.png  

计算公式如下:

image.png

3.  无法访问Service的虚拟IP

 

  • 集群外无法访问:Service的虚拟IP在集群内是通过iptables或者ipvs转发来完成的,是虚拟IP,集群外不存在虚拟IP的路由,所以访问不通;
  • 集群内无法ping通:ServiceclusterlP是虚拟IP,只提供端口的转发,不提供icmp转发,所以访问不通;
  • 集群内无法访问ServiceServiceendpoint是空的,或者虽然有endpoint,但是Pod端口不对,或者Pod端口监听绑定的是回环地址。

 

相关实践学习
通过Ingress进行灰度发布
本场景您将运行一个简单的应用,部署一个新的应用用于新的发布,并通过Ingress能力实现灰度发布。
容器应用与集群管理
欢迎来到《容器应用与集群管理》课程,本课程是“云原生容器Clouder认证“系列中的第二阶段。课程将向您介绍与容器集群相关的概念和技术,这些概念和技术可以帮助您了解阿里云容器服务ACK/ACK Serverless的使用。同时,本课程也会向您介绍可以采取的工具、方法和可操作步骤,以帮助您了解如何基于容器服务ACK Serverless构建和管理企业级应用。 学习完本课程后,您将能够: 掌握容器集群、容器编排的基本概念 掌握Kubernetes的基础概念及核心思想 掌握阿里云容器服务ACK/ACK Serverless概念及使用方法 基于容器服务ACK Serverless搭建和管理企业级网站应用
相关文章
|
1天前
|
缓存 容灾 网络协议
ACK One多集群网关:实现高效容灾方案
ACK One多集群网关可以帮助您快速构建同城跨AZ多活容灾系统、混合云同城跨AZ多活容灾系统,以及异地容灾系统。
|
14天前
|
Prometheus Kubernetes 监控
OpenAI故障复盘 - 阿里云容器服务与可观测产品如何保障大规模K8s集群稳定性
聚焦近日OpenAI的大规模K8s集群故障,介绍阿里云容器服务与可观测团队在大规模K8s场景下我们的建设与沉淀。以及分享对类似故障问题的应对方案:包括在K8s和Prometheus的高可用架构设计方面、事前事后的稳定性保障体系方面。
|
11天前
|
Kubernetes Ubuntu 网络安全
ubuntu使用kubeadm搭建k8s集群
通过以上步骤,您可以在 Ubuntu 系统上使用 kubeadm 成功搭建一个 Kubernetes 集群。本文详细介绍了从环境准备、安装 Kubernetes 组件、初始化集群到管理和使用集群的完整过程,希望对您有所帮助。在实际应用中,您可以根据具体需求调整配置,进一步优化集群性能和安全性。
52 12
|
16天前
|
Kubernetes 网络协议 应用服务中间件
Kubernetes Ingress:灵活的集群外部网络访问的利器
《Kubernetes Ingress:集群外部访问的利器-打造灵活的集群网络》介绍了如何通过Ingress实现Kubernetes集群的外部访问。前提条件是已拥有Kubernetes集群并安装了kubectl工具。文章详细讲解了Ingress的基本组成(Ingress Controller和资源对象),选择合适的版本,以及具体的安装步骤,如下载配置文件、部署Nginx Ingress Controller等。此外,还提供了常见问题的解决方案,例如镜像下载失败的应对措施。最后,通过部署示例应用展示了Ingress的实际使用方法。
32 2
|
28天前
|
存储 Kubernetes 关系型数据库
阿里云ACK备份中心,K8s集群业务应用数据的一站式灾备方案
本文源自2024云栖大会苏雅诗的演讲,探讨了K8s集群业务为何需要灾备及其重要性。文中强调了集群与业务高可用配置对稳定性的重要性,并指出人为误操作等风险,建议实施周期性和特定情况下的灾备措施。针对容器化业务,提出了灾备的新特性与需求,包括工作负载为核心、云资源信息的备份,以及有状态应用的数据保护。介绍了ACK推出的备份中心解决方案,支持命名空间、标签、资源类型等维度的备份,并具备存储卷数据保护功能,能够满足GitOps流程企业的特定需求。此外,还详细描述了备份中心的使用流程、控制台展示、灾备难点及解决方案等内容,展示了备份中心如何有效应对K8s集群资源和存储卷数据的灾备挑战。
|
2月前
|
运维 Cloud Native 云计算
云原生之旅:Docker容器化实战
本文将带你走进云原生的世界,深入理解Docker技术如何改变应用部署与运维。我们将通过实际案例,展示如何利用Docker简化开发流程,提升应用的可移植性和伸缩性。文章不仅介绍基础概念,还提供操作指南和最佳实践,帮助你快速上手Docker,开启云原生的第一步。
|
2月前
|
Kubernetes 监控 Cloud Native
Kubernetes集群的高可用性与伸缩性实践
Kubernetes集群的高可用性与伸缩性实践
83 1
|
3月前
|
JSON Kubernetes 容灾
ACK One应用分发上线:高效管理多集群应用
ACK One应用分发上线,主要介绍了新能力的使用场景
|
3月前
|
Kubernetes 持续交付 开发工具
ACK One GitOps:ApplicationSet UI简化多集群GitOps应用管理
ACK One GitOps新发布了多集群应用控制台,支持管理Argo CD ApplicationSet,提升大规模应用和集群的多集群GitOps应用分发管理体验。
|
3月前
|
Kubernetes Cloud Native 云计算
云原生之旅:Kubernetes 集群的搭建与实践
【8月更文挑战第67天】在云原生技术日益成为IT行业焦点的今天,掌握Kubernetes已成为每个软件工程师必备的技能。本文将通过浅显易懂的语言和实际代码示例,引导你从零开始搭建一个Kubernetes集群,并探索其核心概念。无论你是初学者还是希望巩固知识的开发者,这篇文章都将为你打开一扇通往云原生世界的大门。
152 17

热门文章

最新文章