阿里云灵骏超节点GP9A实例基于自研真武M890芯片,采用超节点架构面向万亿参数规模模型高性能推理设计,实例规格efg3.GP9A(M890P),9216 GB显存、1024核CPU、18.4TB 内存,阿小云分享阿里云灵骏超节点GP9A实例优势、实例规格、网络及应用场景全解析,在阿里云CLUB中心免费领取优惠券。详细参考阿里云智能计算灵骏官网:https://www.aliyun.com/product/lingjun
超节点GP9A实例优势
超节点GP9A实例具有故障自愈、MoE模型训推、高效推理及生态兼容优势:
- 超节点架构故障自愈:面向 ICN64 超节点架构,支持故障自愈能力,2^n卡持续可用。
- 万亿参数MoE模型训推:每卡 144 GB 显存,实例 64 卡共 9,216 GB 显存池,承载万亿参数级模型。
- MXFP4 高效推理:新增 MXFP4 精度,相比 BF16 可提供数倍吞吐提升,适用于 LLM 推理、推荐系统等追求极致吞吐的场景。同时兼容 BF16 / FP16 / FP8 / FP32。
- 主流生态全兼容:T-Head SAIL™ 软件栈(Interface / SDK / OS 三层架构)全面兼容主流 AI 生态,业务迁移零代码修改。PyTorch / vLLM / SGLang / Megatron-LM / DeepSpeed 开箱即用。
灵骏超节点实例efg3.GP9A
灵骏超节点efg3.GP9A实例适用于万亿参数MoE推理、具身智能、自动驾驶及搜索推荐,灵骏超节点GP9A实例规格对比如下表:
| 实例 | efg2.P16EN (810E) | efg3.GP9A (M890P) |
| 芯片代际 | 真武 810E(PPU 1.1) | 真武 M890P(PPU 1.5) |
| 支持精度 | FP32 / BF16 / INT8 | FP32 / FP16 / BF16 / FP8 / MXFP4 |
| 显存容量 | 1536 GB | 9216 GB |
| CPU | 96 核 | 1024 核 |
| 内存 | 2 TB | 18.4 TB |
| 本地存储 | 15.36 TB NVMe + 960 GB SATA SSD | 122.88 TB NVMe |
| 前端网络 | 400 Gbps | 3.2 Tbps |
| Scale‑up 卡间互联 | 11.2 TB/s | 51.2 TB/s |
| Scale‑out 实例间互联 | 1.6 Tbps | 12.8 Tbps |
| 每实例 GPU | 16 卡 | 64 卡 |
| 最小售卖单元 | 裸金属(16 卡) | 超节点(64 卡 / 8 节点) |
| 开服地域 | 北京、杭州、上海、乌兰察布 | 乌兰察布(可用区 D),中卫(规划中) |
灵骏超节点GP9A实例适用场景
GP9A实例覆盖从大模型训练到自动驾驶的全场景AI工作负载,可用于高性能推理、自动驾驶、搜推广与多模态及MXFP4 高效推理等使用场景:
- 高性能推理:原生支持 vLLM、SGLang 推理引擎,自研 HolmesLLM 提供极致加速。支持 PD 分离推理架构,满足不同推理阶段需求。
- 自动驾驶:已验证兼容 50+ 自动驾驶模型(感知、预测、端到端)环境部署训练与推理。
- 搜推广与多模态:支持推荐系统、搜索排序、广告模型等核心场景。同时支持视觉-语言模型、图像生成、视频理解等多模态任务。
- MXFP4高效推理:MXFP4 精度相比 BF16 可提供数倍吞吐提升,适用于 LLM 推理、推荐系统、实时图像处理和自动驾驶等极致吞吐场景。
更多配置信息及精准报价,在阿里云智能计算灵骏官网:https://www.aliyun.com/product/lingjun 查询精准报价。

