龙蜥社区智算联盟发布《智算集群基础设施运维通用技术要求》(附下载链接)

简介: 该技术要求的制定旨在打通智算软硬件、跨主体运维断点,补齐 AI 智能体底层算力协同短板,为支撑智算集群基础设施稳定运行,提供运维体系架构、关键运维功能的标准化建议。

随着全国一体化算力网建设、算力互联互通行动计划的稳步推进,2026 年“十五五”规划纲要对算力基础设施建设提出了更高的要求:加快国家枢纽算力设施集群建设,论证建设超大规模智算集群,推动绿色电力与算力协同布局,降低中小企业用算成本。

然而,在智算基础设施建设飞速发展、集群规模不断扩大的同时,基础设施运维的痛点也日益突显。软硬件协同断层、跨产品运维壁垒、智能运维技术应用碎片化、面向 AI 智能体的算力支撑功能缺失等问题,正成为制约产业高质量发展的关键瓶颈。

为破解上述难题龙蜥社区智算联盟以社区为平台,联合智算硬件设备商、集群软件厂商、软件集成商、科研院校单位,深入研究智算集群基础设施运维体系。联盟通过分析具体应用场景,结合实际运维痛点,总结发布了《智算集群基础设施运维通用技术要求》(以下简称“技术要求”)。该技术要求的制定旨在打通智算软硬件、跨主体运维断点,补齐 AI 智能体底层算力协同短板,为支撑智算集群基础设施稳定运行,提供运维体系架构、关键运维功能的标准化建议。

技术要求首先提出了面向用户、端到端、可异构、可扩展的智算集群基础设施运维参考架构,明确了四大设计原则:分层解耦——运维能力按对象分层,组件间松耦合,可分可合;可扩展——覆盖智算项目建设全场景与业务全流程;云原生化——支持微服务化部署;面向用户——按需提供场景化、可组装的运维解决方案。

(图/智算集群基础设施运维参考架构)

主要运维组件包括:

  • 硬件管理:提供计算、存储、网络硬件基础设施统一管理与运维功能。
  • GPU 运维:提供 GPU 关键算力资源的基础监控,故障诊断、性能压测等增强运维功能。
  • 智算集群运维:提供虚拟化、云原生智算集群软件底座平台运维管理功能。
  • 网络运维:提供多层次、多平面的网络拓扑监控,网络故障诊断、网络性能调优等增强运维功能。
  • 作业运维:提供训推任务关联模型、算子、网络以及云原生工作负载监控数据的跨域整合,从业务视角跨层联动软硬件基础设施,实现端到端运维。

该技术要求能为智算集群软硬件产品生产商、系统集成商在系统设计、产品制造、运维集成方面提供指导,为第三方测评机构实施智算集群运维体系和功能的测试与评价提供参考。

随着超大规模智算集群的建设加速和 AI 智能体技术的快速演进,智算集群基础设施运维将面临更加复杂的挑战。龙蜥社区智算联盟将持续迭代技术要求,在智能化运维、AI 智能体算力协同、绿色运维等方向深入探索,推动智算运维生态的标准化与成熟化。

《智算集群基础设施运维通用技术要求》下载链接:

https://openanolis.cn/assets/static/AI_Infra_O&M_GTR.pdf

—— 完 ——


相关文章
|
8月前
|
存储 人工智能 监控
《生成式AI卓越架构设计指导原则》:从"能用AI"到"用好AI"
阿里云发布《生成式AI卓越架构设计指导原则》,围绕安全、稳定、效率、成本与性能五大支柱,助力企业构建可信赖、可持续演进的AI应用体系,推动AI从“能用”到“用好”的关键跨越。
《生成式AI卓越架构设计指导原则》:从"能用AI"到"用好AI"
|
Shell 容器 Perl
Back-off restarting failed container 问题解决
Back-off restarting failed container 问题解决
4293 0
|
人工智能 固态存储 安全
一文告诉你CXL是什么,有什么新的机会 (上)
> 1. 大数据AI/ML应用爆发驱动大内存需求,但内存增长受限,CXL互联方案应运而生 > 2. CXL分为1.0/2.0/3.0版本,分别提供直连、池化、Fabric能力,预计在2022年/203年/2025年之后市场可用,目前看来池化对于软件的影响最大 > 3. CXL更多是对于已有架构的性能优化,全新的机会不多,较大的机会在于系统软件、内存即服务,以及内存数据库和内存云结构 > 4. CXL大概率将成为跨计算引擎的内存结构标准,短期利好云厂商,长期会数据中心架构产生结构性的变革
5042 0
|
3月前
|
人工智能 小程序 程序员
Skill详解(2万字详细教程),Skills是什么,如何安装并使用Skills
AI时代必备技能!Skills(智能体技能)是Anthropic提出的可复用能力包,以文件夹形式封装指令、脚本与资源,实现“按需加载”,大幅节省Token。它让大模型从聊天工具升级为专业助手——非技术岗也能零代码快速上手,真正实现人人可用、岗岗必备。
23720 22
Skill详解(2万字详细教程),Skills是什么,如何安装并使用Skills
|
2月前
|
安全 Java 数据安全/隐私保护
|
3月前
|
缓存 人工智能 调度
当 AI 从“对话”走向“协作”,谁来管理百万级 Token 的工作记忆?
系统性地拆解了多智能体时代面临的内存与延迟挑战,并深入展示了 Mooncake 作为 KVCache 数据基座的分离架构设计与大规模生产实践。
|
2月前
|
人工智能 开发工具 开发者
龙蜥 AI Infra 新力量:T-Head SAIL 软件栈正式开源
T-Head SAIL 已基于龙蜥 Anolis Cloud Kernel (ANCK)内核完成原生驱动适配,支持开箱即用。

热门文章

最新文章