首批!阿里云容器服务 ACK 顺利通过信通院云原生混部项目评估

本文涉及的产品
Serverless 应用引擎 SAE,800核*时 1600GiB*时
容器镜像服务 ACR,镜像仓库100个 不限时长
容器服务 Serverless 版 ACK Serverless,317元额度 多规格
简介: 首批!阿里云容器服务 ACK 顺利通过信通院云原生混部项目评估

为了分享过去一年云原生产业联盟(CNIA)在标准建设、评估认证、技术研究、实践合作等方面的工作成果、探索行业最新趋势动态,云原生产业联盟于 2023 年 1 月举办了 2022 年度线上年会,并发布了“云原生混部”首批评测结果,阿里云容器服务ACK顺利通过首批“云原生混部”项目评估。


云原生混部解决方案依托容器、微服务、编排调度等云原生技术,可以帮助用户将业务应用与大数据分析、人工智能计算等不同类型和不同优先级的应用混合部署到共享的基础设施上,提高资源利用率,实现“降本增效”。

image.png

中国信通院联合阿里云等企业单位,经过多轮研讨,形成了《云原生混部技术能力要求》标准。标准内容涉及基础设施能力要求、平台混部能力要求、业务应用能力要求,以及混部效果评价共四个部分,具体从资源隔离、资源复用、干扰检测、负载反馈、任务调度、资源预测、应用服务质量等不同维度,对混部产品及解决方案进行全面评估。

image.png

阿里云容器服务 Kubernetes 版(Alibaba Cloud Container Service for Kubernetes,简称容器服务ACK)是全球首批通过 Kubernetes 一致性认证的服务平台,提供高性能的容器应用管理服务,支持企业级 Kubernetes 容器化应用的生命周期管理。


阿里巴巴早在 2016 年就启动了云原生混部技术研发,历经多轮技术架构升级、多年双11锤炼,目前已实现全业务规模超千万核的云原生混部,日常 CPU 利用率在 50% 左右。ACK 在“公共云”和“专有云”场景下提供不同的产品形态,可以让各行业的用户轻松高效地在云端运行 Kubernetes 容器化应用。在 ACK 产品中,一个重要理念是支持多种工作负载同时运行在一个集群中,通过弹性和混部技术满足各类工作负载的资源效率、稳定性和成本优化诉求。

image.png

针对不同类型工作负载混部场景,ACK 提供了一套完整的混部调度增强的能力,主要包含三个部分:

  • 任务调度
  • 差异化 SLO
  • QoS 感知调度、重调度


任务调度,主要解决工作负载运行在 Kubernetes 之上的问题。ACK 针对微服务、大数据任务、AI 任务类型的负载提供了非常丰富的调度扩展,解决负载之间资源精细化的隔离与共享,具体包括:

  • 延迟敏感服务的调优、CPU 绑核、CPU burst、Memory QoS 等
  • 弹性额度控制,支持任务类型典型的弹性资源调度(min/max 模型)
  • 任务协同调度,AllorNothing
  • 异构设备的拓扑感知,GPU share,NvLink拓扑感知等

image.png

差异化 SLO,主要提供一套提供部署密度和整体资源利用率的资源模型,用于支持资源调度的 overcommit。ACK 提供了在阿里内部被广泛验证使用的差异化 SLO 技术能力,支持用户在 Kubernetes 之上以资源超卖的方式运行混部任务,进一步提高资源利用率。其核心的包含两部分内容:

  • 资源分级调度,根据 Pod 真实负载运行情况进行资源画像,并将模型预估可用的资源进行二次分配,以满足具备容灾能力的计算任务的资源诉求
  • 资源隔离与干扰抑制,对于二次分配的任务,提供 CPU、Memory、Disk、Network 多个维度配套的资源隔离保障机制,将计算任务对原延迟敏感任务的干扰控制在非常小的范围

image.png

QoS 感知调度、重调度,主要解决高水位状态下工作负载对运行质量的敏感的问题。ACK 提供了一套增强的负载感知调度与重调度框架:

  • 负载感知调度,在调度打分阶段引入对于节点运行时状态的判断,避免节点负载过高导致机器出现热点响应慢等影响稳定性的问题
  • 重调度,提供了具备资源确定性、腾挪安全保护的重调度器,支持用户在特定时间段执行设定的重调度策略,持续的调整集群资源编排以达到理想状态

image.png

基于 ACK 上提供的混部解决方案,阿里云于 2022 年 4 月正式开源 Koordinator 项目,帮助企业更快速获取云原生混部带来的资源效率红利,实现公共云、混合云一致的云原生混部架构,降低系统运维成本,保持长期可持续发展的健康形态。


随着企业数字化转型工作深入推进,精细化的资源管理、跨集群跨地域资源协同、灵活快捷的资源编排调度,以及异构资源共享复用等能力,正在帮助企业实现更加灵活的弹性资源供给、更加智能的应用自动部署,以及更大规模节点的算力协同。


自 2022 年 4 月开源以来,Koordinator 已在阿里自研业务、小红书、爱奇艺、360、趣丸网络等企业生产系统中得到应用,得到来自业界十几个企业优秀工程师的贡献。后续,阿里云云原生团队将持续在云原生混部方向的投入,推进更多的负载类型融入 Koordinator 生态,不断丰富容器服务 ACK 任务混部解决方案,帮助企业取得更好的资源运行效率。同时,持续参与到中国信通院开展的“云原生混部”相关评估和研究工作中,助力混部技术发展和行业创新应用。欢迎大家加入 Koordinator 社区钉钉群,共同推进混部的标准化进程。

image.png

钉钉扫码


点击此处,快速了解如何使用 ack-koordinator 搭建在离线混部环境

相关实践学习
巧用云服务器ECS制作节日贺卡
本场景带您体验如何在一台CentOS 7操作系统的ECS实例上,通过搭建web服务器,上传源码到web容器,制作节日贺卡网页。
容器应用与集群管理
欢迎来到《容器应用与集群管理》课程,本课程是“云原生容器Clouder认证“系列中的第二阶段。课程将向您介绍与容器集群相关的概念和技术,这些概念和技术可以帮助您了解阿里云容器服务ACK/ACK Serverless的使用。同时,本课程也会向您介绍可以采取的工具、方法和可操作步骤,以帮助您了解如何基于容器服务ACK Serverless构建和管理企业级应用。 学习完本课程后,您将能够: 掌握容器集群、容器编排的基本概念 掌握Kubernetes的基础概念及核心思想 掌握阿里云容器服务ACK/ACK Serverless概念及使用方法 基于容器服务ACK Serverless搭建和管理企业级网站应用
相关文章
|
26天前
|
Cloud Native 测试技术 开发者
终于!我找到了开发的得力助手!阿里云天池云原生编程挑战赛参赛攻略
在比赛过程中,通义灵码插件成为了我开发工作的得力助手。这个插件提供了智能代码补全和错误提示功能,大大提高了我的编码效率。尤其是通义灵码能够实时分析代码,给出优化建议,让我避免了很多潜在的错误。
204 64
|
26天前
|
人工智能 缓存 Cloud Native
用 Higress AI 网关降低 AI 调用成本 - 阿里云天池云原生编程挑战赛参赛攻略
《Higress AI 网关挑战赛》正在火热进行中,Higress 社区邀请了目前位于排行榜 top5 的选手杨贝宁同学分享他的心得。本文是他整理的参赛攻略。
517 68
|
1天前
|
人工智能 Kubernetes Cloud Native
阿里云容器服务,全面助力云上体育盛会
本文讲述了阿里云容器服务,通过安全稳定的产品能力和成熟的稳定性保障体系,全面助力云上体育赛场,促进科技之光与五环之光交相辉映。
阿里云容器服务,全面助力云上体育盛会
|
4天前
|
人工智能 Prometheus 监控
使用 NVIDIA NIM 在阿里云容器服务(ACK)中加速 LLM 推理
本文介绍了在阿里云容器服务 ACK 上部署 NVIDIA NIM,结合云原生 AI 套件和 KServe 快速构建高性能模型推理服务的方法。通过阿里云 Prometheus 和 Grafana 实现实时监控,并基于排队请求数配置弹性扩缩容策略,提升服务稳定性和效率。文章提供了详细的部署步骤和示例,帮助读者快速搭建和优化模型推理服务。
43 7
使用 NVIDIA NIM 在阿里云容器服务(ACK)中加速 LLM 推理
|
2月前
|
数据采集 运维 Cloud Native
Flink+Paimon在阿里云大数据云原生运维数仓的实践
构建实时云原生运维数仓以提升大数据集群的运维能力,采用 Flink+Paimon 方案,解决资源审计、拓扑及趋势分析需求。
18450 54
Flink+Paimon在阿里云大数据云原生运维数仓的实践
|
1天前
|
运维 Cloud Native 应用服务中间件
阿里云微服务引擎 MSE 及 云原生 API 网关 2024 年 08 月产品动态
阿里云微服务引擎 MSE 面向业界主流开源微服务项目, 提供注册配置中心和分布式协调(原生支持 Nacos/ZooKeeper/Eureka )、云原生网关(原生支持Higress/Nginx/Envoy,遵循Ingress标准)、微服务治理(原生支持 Spring Cloud/Dubbo/Sentinel,遵循 OpenSergo 服务治理规范)能力。API 网关 (API Gateway),提供 APl 托管服务,覆盖设计、开发、测试、发布、售卖、运维监测、安全管控、下线等 API 生命周期阶段。帮助您快速构建以 API 为核心的系统架构.满足新技术引入、系统集成、业务中台等诸多场景需要
|
9天前
|
Cloud Native 关系型数据库 Serverless
基于阿里云函数计算(FC)x 云原生 API 网关构建生产级别 LLM Chat 应用方案最佳实践
本文带大家了解一下如何使用阿里云Serverless计算产品函数计算构建生产级别的LLM Chat应用。该最佳实践会指导大家基于开源WebChat组件LobeChat和阿里云函数计算(FC)构建企业生产级别LLM Chat应用。实现同一个WebChat中既可以支持自定义的Agent,也支持基于Ollama部署的开源模型场景。
|
18天前
|
Cloud Native 数据库 开发者
云原生数据库2.0问题之帮助阿里云数据库加速技术更新如何解决
云原生数据库2.0问题之帮助阿里云数据库加速技术更新如何解决
|
30天前
|
人工智能 Cloud Native 安全
统一多层网关好处多,阿里云云原生 API 网关打造全能型网关
本文分享了作为一款全能型网关【云原生 API 网关】是如何帮助企业落地统一网关架构的。
7696 7
|
25天前
|
Kubernetes 负载均衡 安全
【技术揭秘】阿里云容器服务Ingress高级玩法:如何轻松实现客户端原始IP透传,提升应用安全性与用户体验!
【8月更文挑战第17天】本文介绍如何在阿里云容器服务中配置Ingress以透传客户端原始IP地址。通过Ingress可实现HTTP负载均衡等功能。需在Ingress定义文件中添加特定注解,如`nginx.ingress.kubernetes.io/real-ip-header: X-Real-IP`。创建并应用Ingress配置后,后端服务可通过读取`X-Real-IP`头获取真实IP。此举有助于安全审计及流量分析。
36 2

相关产品

  • 容器计算服务
  • 容器服务Kubernetes版