万卡集群怎么保持 96% 线性加速?拆解阿里云 AI 训练网络三层引擎
系列二 · 训练网络篇 |阿里云 AI 网络白皮书解读
Scale-Up + Scale-Out + Scale-Across,训练网络的"三级火箭"
从一个反直觉的现象说起
先问一个数字:训练一个千亿参数模型,一次 AllReduce 要传多少数据?
答案是:每次几十 GB 到几百 GB,每秒可能要做几十次。
如果网络跟不上,会发生什么?——万卡集群里,只有 30% 的时间 GPU 在算,剩下 70% 在等对方传参数。这就是行业内著名的 "GPU 空转陷阱"。
要打破这个陷阱,训练网络必须做到三件事:
- 单机内的 GPU 之间通信要极快(Scale-Up)
- 多机之间的 GPU 通信要几乎不损失(Scale-Out)
- 跨地域的资源要能够协同调度(Scale-Across)
这三层,对应三种截然不同的网络技术。阿里云 AI 网络白皮书里把它总结为"三层引擎"。

[AI 训练网络三层引擎]
类比:电梯 + 班车 + 高铁
如果把 GPU 集群比作一座跨城的智能园区,这三层网络就分别是三种交通工具:
- Scale-Up = 楼内电梯:同一栋楼里,从 1 楼到 20 楼,几秒钟就到,运力极大
- Scale-Out = 园区大巴:园区内几十栋楼之间的往返,班次密、路线固定、专用车道
- Scale-Across = 城际高铁:跨城市的协同,速度快但有距离限制
看懂这个类比,下面每一层的技术选型就有了直觉。
第一层:Scale-Up —— NVLink / NVSwitch
问题:一台 GPU 服务器里塞了 8 张 H800,它们之间要不要过 PCIe?过 PCIe 会怎样?
答案:过 PCIe,带宽从 900 GB/s 掉到 64 GB/s,一下降 15 倍。
解决方案:NVLink + NVSwitch,让 8 张 GPU 组成一个"全互联"的小网络。
| 指标 | NVLink(Scale-Up) | PCIe Gen5 |
|---|---|---|
| 单向带宽 | 900 GB/s | 64 GB/s |
| 时延 | < 100 ns | ~500 ns |
| 拓扑 | Full Mesh | 树形 |
| 典型用途 | Tensor Parallelism | 磁盘/网卡 |
阿里云选型:ecs.ebmgn8v(8×H800,NVLink 全互联)或 ecs.gn9gc(Blackwell,NVLink5)。
关键设计:一台机器 = 一个"Tensor 并行域"。模型的一层权重切在这 8 张卡上,靠 NVLink 快速交换 activation。
第二层:Scale-Out —— HPN + eRDMA
问题:8 张卡装不下千亿模型。要 4096 张、甚至更多。多机之间怎么通信?
传统 TCP/IP 网络的问题:CPU 参与、多次拷贝、协议开销大。跨机 AllReduce 时延经常在 100μs 以上,GPU 大部分时间在等。
阿里云的方案是两个技术叠加:
HPN 7.0(高性能网络)
- 51.2T 单芯片交换:目前业界最高的单颗交换机吞吐
- 400 Gbps 单端口:直连 GPU 网卡
- 轨道优化拓扑(Rail-Optimized):同 rank 的 GPU 走同一条"轨道",避免拥塞
- 端到端时延 2μs:接近单机内 NVLink 时代的时延感受
- 万卡线性扩展 > 96%:意思是"1 万张卡的实际速度 ≥ 单卡速度 × 9600"
eRDMA(弹性 RDMA)
RDMA = 远程直接内存访问,跳过 CPU 和内核,网卡直接读写对端内存。传统 RDMA 需要专门的硬件(IB),成本高、锁死。阿里云 eRDMA 把 RDMA 跑在标准以太网上,兼容 VPC 网络,是"云化 RDMA"的代表:
- 单卡 360 Gbps eRDMA ENI(
ecs.gn9gc) - 硬件卸载:CPU 参与度接近 0
- 故障 < 1s 收敛:这是万卡训练里救命的能力——出问题的节点被瞬间隔离,训练继续
两个必须知道的细节:
- HPN 网络是独立的物理网络,不和 VPC 网络共用交换机。所以灵骏节点通常有两张网卡:一张 VPC ENI 走数据加载和管控,一张 eRDMA ENI 走参数同步。
- NCCL / DeepSpeed / Megatron-LM 都已经原生适配 eRDMA,业务代码零改动。
第三层:Scale-Across —— CEN + TR + 高速通道
问题:为什么要跨地域?训练不是应该在同一个集群里做吗?
现实是:大模型训练场景经常需要跨地域,比如:
- Checkpoint 备份到另一个 Region(防单点故障)
- 训练集群在张家口(电价低),推理集群在杭州(离用户近),模型要跨域同步
- 冷数据在西部集群,热训练在东部集群,需要数据迁移
- 多 Region 联邦训练(Federated Learning)
跨地域网络的挑战是带宽 + 时延 + 成本的三角平衡。
阿里云的方案:
- CEN(云企业网) + TR(转发路由器):全球 30+ Region 一张网,跨域带宽 Tbps 级
- 高速通道 Express Connect:物理专线,单端口 400 Gbps
- VPN 网关(增强型):低成本备用通道,可挂到 TR 上做主备
典型部署:
杭州训练集群 北京推理集群
[灵骏 4096 卡] [PAI-EAS 集群]
| |
VPC-hz VPC-bj
| |
└─────── CEN + TR ─────────┘
Tbps 带宽
跨域 20-30ms
Checkpoint 每 15 分钟从杭州同步到北京,走 CEN 内网走跨域带宽包,比公网稳定 100 倍,成本降 70%+。
三层协同:一个完整的训练网络长什么样
假设你要跑一个 175B 的稠密模型训练,4096 张 H800:
| 层级 | 使用技术 | 承担的流量 |
|---|---|---|
| Scale-Up | NVLink | 8 卡内 TP(Tensor Parallel)activation 交换 |
| Scale-Out | HPN + eRDMA | 512 台机器间 DP(Data Parallel)+ PP(Pipeline Parallel)梯度同步 |
| Scale-Across | CEN + TR | Checkpoint 跨 Region 备份 · 冷数据回流 |
每一层的流量特征完全不同,所以用了完全不同的网络技术。这也是"三层引擎"这个说法真正的价值——它把复杂的问题按物理边界切开了,让每一层都能用最匹配的技术去解。
与传统云网络的关键区别
很多人问:HPN 和普通 VPC 网络到底差在哪?
一张表说清楚:
| 维度 | 传统 VPC 网络 | HPN + eRDMA |
|---|---|---|
| 单端口带宽 | 25-100 Gbps | 400 Gbps |
| 端到端时延 | 100-500 μs | 2 μs |
| 拥塞控制 | ECN / DCQCN | PFC + 端到端反压 |
| CPU 参与 | 高(内核态) | 极低(硬件卸载) |
| 故障收敛 | 秒级到分钟级 | < 1 秒 |
| 拓扑 | Clos + 通用负载 | 轨道优化 + 无阻塞 |
| 定位 | 通用互联 | AI 训练专用 |
记住一句话:HPN 不是"更快的 VPC",它是为 AI 训练重新设计的专用网络。你不会拿高铁去送外卖,同样,普通业务也用不到 HPN。
一线经验:三个必知的踩坑点
坑一:NCCL 参数没调对
默认 NCCL 参数是通用配置,跑在 HPN 上必须调整:
export NCCL_IB_HCA=erdma_0,erdma_1
export NCCL_IB_GID_INDEX=3
export NCCL_NET_GDR_LEVEL=2
export NCCL_IB_QPS_PER_CONNECTION=8
不调这个,实测吞吐能少 40%。
坑二:Checkpoint 打爆跨域带宽包
一次 Checkpoint 几百 GB,如果配置成"每 5 分钟同步一次",跨域带宽包会瞬间打满。建议:
- 增量 Checkpoint(只传 diff)
- 分层保存(每小时全量 + 每 5 分钟增量)
- 用 OSS 跨区域复制 CRR 做异步复制
坑三:混部 VPC 和 eRDMA 流量
灵骏节点两张网卡各司其职:VPC ENI 走管控 + 数据加载,eRDMA ENI 只走 NCCL。绑错网卡后果严重——PFC 反压会把 VPC 网卡也打瘫。
一个数字感受一下"三层引擎"的威力
某头部 AI 公司做过一次对比实验:
- 场景:4096 张 H800,训练 175B 模型
- 方案 A:普通 VPC 网络 + TCP/IP → 线性加速比 68%(等效 2785 卡)
- 方案 B:HPN + eRDMA + NVLink 三层引擎 → 线性加速比 96%(等效 3932 卡)
同样的钱、同样的卡数,训练速度差了 40%。 折算下来一年多训练几十次的量,直接决定谁能先发出下一代模型。
下一篇预告
模型训完了,要上线服务。用户的请求怎么进来?流式响应怎么保活?Prefill 和 Decode 怎么分离?KV Cache 怎么跨节点共享?
下一篇《AI 推理网络:ALB AI 扩展版与 P/D 分离实战》,聊聊阿里云为大模型推理专门造的这套 AI 原生网关。
📖 延伸阅读
- 原文白皮书:《阿里云 AI 网络白皮书》 — 完整技术架构与选型参考
- 相关产品:
💬 你在多机训练中用什么策略打满带宽?欢迎评论区分享 NCCL 调参经验。下一篇我们把镜头切到推理侧。