首批!阿里云容器服务 ACK 顺利通过信通院云原生混部项目评估

本文涉及的产品
性能测试 PTS,5000VUM额度
可观测监控 Prometheus 版,每月50GB免费额度
应用实时监控服务-应用监控,每月50GB免费额度
简介: 云原生混部解决方案依托容器、微服务、编排调度等云原生技术,可以帮助用户将业务应用与大数据分析、人工智能计算等不同类型和不同优先级的应用混合部署到共享的基础设施上,提高资源利用率,实现“降本增效”。

作者:OSCAR


为了分享过去一年云原生产业联盟(CNIA)在标准建设、评估认证、技术研究、实践合作等方面的工作成果、探索行业最新趋势动态,云原生产业联盟于 2023 年 1 月举办了 2022 年度线上年会,并发布了“云原生混部”首批评测结果,阿里云容器服务ACK顺利通过首批“云原生混部”项目评估。


云原生混部解决方案依托容器、微服务、编排调度等云原生技术,可以帮助用户将业务应用与大数据分析、人工智能计算等不同类型和不同优先级的应用混合部署到共享的基础设施上,提高资源利用率,实现“降本增效”。


1.png


中国信通院联合阿里云等企业单位,经过多轮研讨,形成了《云原生混部技术能力要求》标准。标准内容涉及基础设施能力要求、平台混部能力要求、业务应用能力要求,以及混部效果评价共四个部分,具体从资源隔离、资源复用、干扰检测、负载反馈、任务调度、资源预测、应用服务质量等不同维度,对混部产品及解决方案进行全面评估。


2.png


阿里云容器服务 Kubernetes 版(Alibaba Cloud Container Service for Kubernetes,简称容器服务ACK)是全球首批通过 Kubernetes 一致性认证的服务平台,提供高性能的容器应用管理服务,支持企业级 Kubernetes 容器化应用的生命周期管理。

阿里巴巴早在 2016 年就启动了云原生混部技术研发,历经多轮技术架构升级、多年双11锤炼,目前已实现全业务规模超千万核的云原生混部,日常 CPU 利用率在 50% 左右。ACK 在“公共云”和“专有云”场景下提供不同的产品形态,可以让各行业的用户轻松高效地在云端运行 Kubernetes 容器化应用。在 ACK 产品中,一个重要理念是支持多种工作负载同时运行在一个集群中,通过弹性和混部技术满足各类工作负载的资源效率、稳定性和成本优化诉求。


3.png


针对不同类型工作负载混部场景,ACK 提供了一套完整的混部调度增强的能力,主要包含三个部分:


  • 任务调度
  • 差异化 SLO
  • QoS 感知调度、重调度


任务调度,主要解决工作负载运行在 Kubernetes 之上的问题。ACK 针对微服务、大数据任务、AI 任务类型的负载提供了非常丰富的调度扩展,解决负载之间资源精细化的隔离与共享,具体包括:


  • 延迟敏感服务的调优、CPU 绑核、CPU burst、Memory QoS 等
  • 弹性额度控制,支持任务类型典型的弹性资源调度(min/max 模型)
  • 任务协同调度,AllorNothing
  • 异构设备的拓扑感知,GPU share,NvLink拓扑感知等


4.png


差异化 SLO,主要提供一套提供部署密度和整体资源利用率的资源模型,用于支持资源调度的 overcommit。ACK 提供了在阿里内部被广泛验证使用的差异化 SLO 技术能力,支持用户在 Kubernetes 之上以资源超卖的方式运行混部任务,进一步提高资源利用率。其核心的包含两部分内容:


  • 资源分级调度,根据 Pod 真实负载运行情况进行资源画像,并将模型预估可用的资源进行二次分配,以满足具备容灾能力的计算任务的资源诉求
  • 资源隔离与干扰抑制,对于二次分配的任务,提供 CPU、Memory、Disk、Network 多个维度配套的资源隔离保障机制,将计算任务对原延迟敏感任务的干扰控制在非常小的范围


5.png


QoS 感知调度、重调度,主要解决高水位状态下工作负载对运行质量的敏感的问题。ACK 提供了一套增强的负载感知调度与重调度框架:


  • 负载感知调度,在调度打分阶段引入对于节点运行时状态的判断,避免节点负载过高导致机器出现热点响应慢等影响稳定性的问题
  • 重调度,提供了具备资源确定性、腾挪安全保护的重调度器,支持用户在特定时间段执行设定的重调度策略,持续的调整集群资源编排以达到理想状态


6.png


基于 ACK 上提供的混部解决方案,阿里云于 2022 年 4 月正式开源 Koordinator 项目,帮助企业更快速获取云原生混部带来的资源效率红利,实现公共云、混合云一致的云原生混部架构,降低系统运维成本,保持长期可持续发展的健康形态。


随着企业数字化转型工作深入推进,精细化的资源管理、跨集群跨地域资源协同、灵活快捷的资源编排调度,以及异构资源共享复用等能力,正在帮助企业实现更加灵活的弹性资源供给、更加智能的应用自动部署,以及更大规模节点的算力协同。


自 2022 年 4 月开源以来,Koordinator 已在阿里自研业务、小红书、爱奇艺、360、趣丸网络等企业生产系统中得到应用,得到来自业界十几个企业优秀工程师的贡献。


后续,阿里云云原生团队将持续在云原生混部方向的投入,推进更多的负载类型融入 Koordinator 生态,不断丰富容器服务 ACK 任务混部解决方案,帮助企业取得更好的资源运行效率。同时,持续参与到中国信通院开展的“云原生混部”相关评估和研究工作中,助力混部技术发展和行业创新应用。欢迎大家加入 Koordinator 社区钉钉群,共同推进混部的标准化进程。


7.png

钉钉扫码


点击此处,快速了解如何使用 ack-koordinator 搭建在离线混部环境

相关实践学习
巧用云服务器ECS制作节日贺卡
本场景带您体验如何在一台CentOS 7操作系统的ECS实例上,通过搭建web服务器,上传源码到web容器,制作节日贺卡网页。
容器应用与集群管理
欢迎来到《容器应用与集群管理》课程,本课程是“云原生容器Clouder认证“系列中的第二阶段。课程将向您介绍与容器集群相关的概念和技术,这些概念和技术可以帮助您了解阿里云容器服务ACK/ACK Serverless的使用。同时,本课程也会向您介绍可以采取的工具、方法和可操作步骤,以帮助您了解如何基于容器服务ACK Serverless构建和管理企业级应用。 学习完本课程后,您将能够: 掌握容器集群、容器编排的基本概念 掌握Kubernetes的基础概念及核心思想 掌握阿里云容器服务ACK/ACK Serverless概念及使用方法 基于容器服务ACK Serverless搭建和管理企业级网站应用
相关文章
|
10天前
|
供应链 安全 Cloud Native
阿里云飞天企业版获【可信云·容器平台安全能力】先进级认证
阿里云飞天企业版容器系列产品获中国信息通信研究院【可信云·容器平台安全能力】先进级认证,这是飞天企业版容器产品获得《等保四级PaaS平台》和《 云原生安全配置基线规范V2.0》之后,本年度再一次获得行业权威认可,证明飞天企业版的容器解决方案具备符合行业标准的最高等级容器安全能力。
阿里云飞天企业版获【可信云·容器平台安全能力】先进级认证
|
14天前
|
人工智能 运维 Kubernetes
阿里云容器服务AI助手2.0 - 新一代容器智能运维能力
2024年11月,阿里云容器服务团队进一步深度融合现有运维可观测体系,在场景上覆盖了K8s用户的全生命周期,正式推出升级版AI助手2.0,旨在更好地为用户使用和运维K8S保驾护航。
|
21天前
|
存储 Kubernetes 开发者
容器化时代的领航者:Docker 和 Kubernetes 云原生时代的黄金搭档
Docker 是一种开源的应用容器引擎,允许开发者将应用程序及其依赖打包成可移植的镜像,并在任何支持 Docker 的平台上运行。其核心概念包括镜像、容器和仓库。镜像是只读的文件系统,容器是镜像的运行实例,仓库用于存储和分发镜像。Kubernetes(k8s)则是容器集群管理系统,提供自动化部署、扩展和维护等功能,支持服务发现、负载均衡、自动伸缩等特性。两者结合使用,可以实现高效的容器化应用管理和运维。Docker 主要用于单主机上的容器管理,而 Kubernetes 则专注于跨多主机的容器编排与调度。尽管 k8s 逐渐减少了对 Docker 作为容器运行时的支持,但 Doc
108 5
容器化时代的领航者:Docker 和 Kubernetes 云原生时代的黄金搭档
|
27天前
|
关系型数据库 应用服务中间件 PHP
实战~如何组织一个多容器项目docker-compose
本文介绍了如何使用Docker搭建Nginx、PHP和MySQL的环境。首先启动Nginx容器并查看IP地址,接着启动Alpine容器并安装curl测试连通性。通过`--link`方式或`docker-compose`配置文件实现服务间的通信。最后展示了Nginx配置文件和PHP代码示例,验证了各服务的正常运行。
50 3
实战~如何组织一个多容器项目docker-compose
|
1月前
|
人工智能 运维 监控
阿里云ACK容器服务生产级可观测体系建设实践
本文整理自2024云栖大会冯诗淳(花名:行疾)的演讲,介绍了阿里云容器服务团队在生产级可观测体系建设方面的实践。冯诗淳详细阐述了容器化架构带来的挑战及解决方案,强调了可观测性对于构建稳健运维体系的重要性。文中提到,阿里云作为亚洲唯一蝉联全球领导者的容器管理平台,其可观测能力在多项关键评测中表现优异,支持AI、容器网络、存储等多个场景的高级容器可观测能力。此外,还介绍了阿里云容器服务在多云管理、成本优化等方面的最新进展,以及即将推出的ACK AI助手2.0,旨在通过智能引擎和专家诊断经验,简化异常数据查找,缩短故障响应时间。
阿里云ACK容器服务生产级可观测体系建设实践
|
19天前
|
Prometheus Kubernetes 监控
OpenAI故障复盘 - 阿里云容器服务与可观测产品如何保障大规模K8s集群稳定性
聚焦近日OpenAI的大规模K8s集群故障,介绍阿里云容器服务与可观测团队在大规模K8s场景下我们的建设与沉淀。以及分享对类似故障问题的应对方案:包括在K8s和Prometheus的高可用架构设计方面、事前事后的稳定性保障体系方面。
|
13天前
|
存储 人工智能 调度
容器服务:智算时代云原生操作系统及月之暗面Kimi、深势科技实践分享
容器技术已经发展成为云计算操作系统的关键组成部分,向下高效调度多样化异构算力,向上提供统一编程接口,支持多样化工作负载。阿里云容器服务在2024年巴黎奥运会中提供了稳定高效的云上支持,实现了子弹时间特效等创新应用。此外,容器技术还带来了弹性、普惠的计算能力升级,如每分钟创建1万Pod和秒级CPU资源热变配,以及针对大数据与AI应用的弹性临时盘和跨可用区云盘等高性能存储解决方案。智能运维方面,推出了即时弹性节点池、智能应用弹性策略和可信赖集群托管运维等功能,进一步简化了集群管理和优化了资源利用率。
|
11天前
|
监控 安全 Cloud Native
阿里云容器服务&云安全中心团队荣获信通院“云原生安全标杆案例”奖
2024年12月24日,阿里云容器服务团队与云安全中心团队获得中国信息通信研究院「云原生安全标杆案例」奖。
|
1月前
|
供应链 安全 Cloud Native
阿里云容器服务助力企业构建云原生软件供应链安全
本文基于2024云栖大会演讲,探讨了软件供应链攻击的快速增长趋势及对企业安全的挑战。文中介绍了如何利用阿里云容器服务ACK、ACR和ASM构建云原生软件供应链安全,涵盖容器镜像的可信生产、管理和分发,以及服务网格ASM实现应用无感的零信任安全,确保企业在软件开发和部署过程中的安全性。
|
1月前
|
人工智能 Cloud Native 调度
阿里云容器服务在AI智算场景的创新与实践
本文源自张凯在2024云栖大会的演讲,介绍了阿里云容器服务在AI智算领域的创新与实践。从2018年推出首个开源GPU容器共享调度方案至今,阿里云容器服务不断推进云原生AI的发展,包括增强GPU可观测性、实现多集群跨地域统一调度、优化大模型推理引擎部署、提供灵活的弹性伸缩策略等,旨在为客户提供高效、低成本的云原生AI解决方案。

相关产品

  • 容器计算服务
  • 容器服务Kubernetes版