【洛神公开课】第6期:AI网络白皮书-02训练网络篇

简介: 阿里云AI训练网络“三层引擎”(Scale-Up/Out/Across)突破万卡集群瓶颈:NVLink实现单机8卡全互联,HPN+eRDMA将跨机通信时延压至2μs,CEN+TR支撑跨域Tbps级协同。三者协同达成96%线性加速比,显著破解GPU空转难题。(239字)

万卡集群怎么保持 96% 线性加速?拆解阿里云 AI 训练网络三层引擎

系列二 · 训练网络篇 |阿里云 AI 网络白皮书解读
Scale-Up + Scale-Out + Scale-Across,训练网络的"三级火箭"

从一个反直觉的现象说起

先问一个数字:训练一个千亿参数模型,一次 AllReduce 要传多少数据?

答案是:每次几十 GB 到几百 GB,每秒可能要做几十次。

如果网络跟不上,会发生什么?——万卡集群里,只有 30% 的时间 GPU 在算,剩下 70% 在等对方传参数。这就是行业内著名的 "GPU 空转陷阱"。

要打破这个陷阱,训练网络必须做到三件事:

  1. 单机内的 GPU 之间通信要极快(Scale-Up)
  2. 多机之间的 GPU 通信要几乎不损失(Scale-Out)
  3. 跨地域的资源要能够协同调度(Scale-Across)

这三层,对应三种截然不同的网络技术。阿里云 AI 网络白皮书里把它总结为"三层引擎"。

02-training-three-layers.png
[AI 训练网络三层引擎]

类比:电梯 + 班车 + 高铁

如果把 GPU 集群比作一座跨城的智能园区,这三层网络就分别是三种交通工具:

  • Scale-Up = 楼内电梯:同一栋楼里,从 1 楼到 20 楼,几秒钟就到,运力极大
  • Scale-Out = 园区大巴:园区内几十栋楼之间的往返,班次密、路线固定、专用车道
  • Scale-Across = 城际高铁:跨城市的协同,速度快但有距离限制

看懂这个类比,下面每一层的技术选型就有了直觉。

第一层:Scale-Up —— NVLink / NVSwitch

问题:一台 GPU 服务器里塞了 8 张 H800,它们之间要不要过 PCIe?过 PCIe 会怎样?

答案:过 PCIe,带宽从 900 GB/s 掉到 64 GB/s,一下降 15 倍。

解决方案:NVLink + NVSwitch,让 8 张 GPU 组成一个"全互联"的小网络。

指标 NVLink(Scale-Up) PCIe Gen5
单向带宽 900 GB/s 64 GB/s
时延 < 100 ns ~500 ns
拓扑 Full Mesh 树形
典型用途 Tensor Parallelism 磁盘/网卡

阿里云选型:ecs.ebmgn8v(8×H800,NVLink 全互联)或 ecs.gn9gc(Blackwell,NVLink5)。

关键设计:一台机器 = 一个"Tensor 并行域"。模型的一层权重切在这 8 张卡上,靠 NVLink 快速交换 activation。

第二层:Scale-Out —— HPN + eRDMA

问题:8 张卡装不下千亿模型。要 4096 张、甚至更多。多机之间怎么通信?

传统 TCP/IP 网络的问题:CPU 参与、多次拷贝、协议开销大。跨机 AllReduce 时延经常在 100μs 以上,GPU 大部分时间在等。

阿里云的方案是两个技术叠加:

HPN 7.0(高性能网络)

  • 51.2T 单芯片交换:目前业界最高的单颗交换机吞吐
  • 400 Gbps 单端口:直连 GPU 网卡
  • 轨道优化拓扑(Rail-Optimized):同 rank 的 GPU 走同一条"轨道",避免拥塞
  • 端到端时延 2μs:接近单机内 NVLink 时代的时延感受
  • 万卡线性扩展 > 96%:意思是"1 万张卡的实际速度 ≥ 单卡速度 × 9600"

eRDMA(弹性 RDMA)

RDMA = 远程直接内存访问,跳过 CPU 和内核,网卡直接读写对端内存。传统 RDMA 需要专门的硬件(IB),成本高、锁死。阿里云 eRDMA 把 RDMA 跑在标准以太网上,兼容 VPC 网络,是"云化 RDMA"的代表:

  • 单卡 360 Gbps eRDMA ENI(ecs.gn9gc)
  • 硬件卸载:CPU 参与度接近 0
  • 故障 < 1s 收敛:这是万卡训练里救命的能力——出问题的节点被瞬间隔离,训练继续

两个必须知道的细节:

  1. HPN 网络是独立的物理网络,不和 VPC 网络共用交换机。所以灵骏节点通常有两张网卡:一张 VPC ENI 走数据加载和管控,一张 eRDMA ENI 走参数同步。
  2. NCCL / DeepSpeed / Megatron-LM 都已经原生适配 eRDMA,业务代码零改动。

第三层:Scale-Across —— CEN + TR + 高速通道

问题:为什么要跨地域?训练不是应该在同一个集群里做吗?

现实是:大模型训练场景经常需要跨地域,比如:

  • Checkpoint 备份到另一个 Region(防单点故障)
  • 训练集群在张家口(电价低),推理集群在杭州(离用户近),模型要跨域同步
  • 冷数据在西部集群,热训练在东部集群,需要数据迁移
  • 多 Region 联邦训练(Federated Learning)

跨地域网络的挑战是带宽 + 时延 + 成本的三角平衡。

阿里云的方案:

  • CEN(云企业网) + TR(转发路由器):全球 30+ Region 一张网,跨域带宽 Tbps 级
  • 高速通道 Express Connect:物理专线,单端口 400 Gbps
  • VPN 网关(增强型):低成本备用通道,可挂到 TR 上做主备

典型部署:

    杭州训练集群                北京推理集群
   [灵骏 4096 卡]              [PAI-EAS 集群]
        |                            |
     VPC-hz                      VPC-bj
        |                            |
        └───────  CEN + TR  ─────────┘
                   Tbps 带宽
                   跨域 20-30ms

Checkpoint 每 15 分钟从杭州同步到北京,走 CEN 内网走跨域带宽包,比公网稳定 100 倍,成本降 70%+。

三层协同:一个完整的训练网络长什么样

假设你要跑一个 175B 的稠密模型训练,4096 张 H800:

层级 使用技术 承担的流量
Scale-Up NVLink 8 卡内 TP(Tensor Parallel)activation 交换
Scale-Out HPN + eRDMA 512 台机器间 DP(Data Parallel)+ PP(Pipeline Parallel)梯度同步
Scale-Across CEN + TR Checkpoint 跨 Region 备份 · 冷数据回流

每一层的流量特征完全不同,所以用了完全不同的网络技术。这也是"三层引擎"这个说法真正的价值——它把复杂的问题按物理边界切开了,让每一层都能用最匹配的技术去解。

与传统云网络的关键区别

很多人问:HPN 和普通 VPC 网络到底差在哪?

一张表说清楚:

维度 传统 VPC 网络 HPN + eRDMA
单端口带宽 25-100 Gbps 400 Gbps
端到端时延 100-500 μs 2 μs
拥塞控制 ECN / DCQCN PFC + 端到端反压
CPU 参与 高(内核态) 极低(硬件卸载)
故障收敛 秒级到分钟级 < 1 秒
拓扑 Clos + 通用负载 轨道优化 + 无阻塞
定位 通用互联 AI 训练专用

记住一句话:HPN 不是"更快的 VPC",它是为 AI 训练重新设计的专用网络。你不会拿高铁去送外卖,同样,普通业务也用不到 HPN。

一线经验:三个必知的踩坑点

坑一:NCCL 参数没调对
默认 NCCL 参数是通用配置,跑在 HPN 上必须调整:

export NCCL_IB_HCA=erdma_0,erdma_1
export NCCL_IB_GID_INDEX=3
export NCCL_NET_GDR_LEVEL=2
export NCCL_IB_QPS_PER_CONNECTION=8

不调这个,实测吞吐能少 40%。

坑二:Checkpoint 打爆跨域带宽包
一次 Checkpoint 几百 GB,如果配置成"每 5 分钟同步一次",跨域带宽包会瞬间打满。建议:

  • 增量 Checkpoint(只传 diff)
  • 分层保存(每小时全量 + 每 5 分钟增量)
  • 用 OSS 跨区域复制 CRR 做异步复制

坑三:混部 VPC 和 eRDMA 流量
灵骏节点两张网卡各司其职:VPC ENI 走管控 + 数据加载,eRDMA ENI 只走 NCCL。绑错网卡后果严重——PFC 反压会把 VPC 网卡也打瘫。

一个数字感受一下"三层引擎"的威力

某头部 AI 公司做过一次对比实验:

  • 场景:4096 张 H800,训练 175B 模型
  • 方案 A:普通 VPC 网络 + TCP/IP → 线性加速比 68%(等效 2785 卡)
  • 方案 B:HPN + eRDMA + NVLink 三层引擎 → 线性加速比 96%(等效 3932 卡)

同样的钱、同样的卡数,训练速度差了 40%。 折算下来一年多训练几十次的量,直接决定谁能先发出下一代模型。

下一篇预告

模型训完了,要上线服务。用户的请求怎么进来?流式响应怎么保活?Prefill 和 Decode 怎么分离?KV Cache 怎么跨节点共享?

下一篇《AI 推理网络:ALB AI 扩展版与 P/D 分离实战》,聊聊阿里云为大模型推理专门造的这套 AI 原生网关。


📖 延伸阅读

💬 你在多机训练中用什么策略打满带宽?欢迎评论区分享 NCCL 调参经验。下一篇我们把镜头切到推理侧。

相关文章
|
4月前
|
弹性计算 负载均衡 安全
【洛神公开课】第1期:如何设计一套安全、高可用、可扩展的 VPC 网络架构
从单 VPC 起步到多 VPC 互联的真实组网难题出发,拆解 VPC 划分原则、IP 规划十步法、TR 多场景互通、PrivateLink 共享服务、DMZ 统一公网出入口五大主题,并附产品选型对照表,帮你少踩弯路、把架构一次画对。
426 0
|
3月前
|
数据采集 存储 人工智能
【洛神公开课】第5期:AI网络白皮书-01数据采集篇
AI训练常卡在“数据没到位”——PB级语料散落多源,搬运慢则每小时损失数十万元。本文详解阿里云AI数据采集网络:从高速专线、多云互联到OSS/CPFS分层存储,再到eRDMA直通GPU,构建稳定、高效、低成本的数据输送起跑线。(239字)
352 1
|
4月前
|
运维 安全 容灾
【洛神公开课】第3期:阿里云全球化网络方案实操选型
本文系统解析阿里云全球化网络四大核心方案(专线、VPN、CEN、SD-WAN),覆盖企业出海、多云互联、跨境合规、低时延组网等典型场景,聚焦落地要点与避坑指南,助您高效构建安全、稳定、弹性的一张全球虚拟网。(239字)
560 0
|
4月前
|
运维 Prometheus 监控
【洛神公开课】第4期:云网络智能运维方案
云网络运维告别“盯屏救火”!本文详解阿里云推荐的智能运维四件套:大盘(全局监控)、告警(主动感知)、巡检(隐患前置排查)、工具(NIS深度诊断),助你从被动响应升级为可视、可管、可控的主动运营中心。(239字)
305 0
|
4月前
|
人工智能 Kubernetes 应用服务中间件
🚀【技术直播 · 重磅】Nginx Ingress 退役后,如何选对生产级网关?6月24日14:00-15:30,请锁定开发者社区直播间
"Nginx Ingress 不更新了,我该咋办?" 这场直播就是答案。 阿里云专家在线拆解迁移全流程,手把手教你不踩坑、不停服、不背锅。
398 2
|
26天前
|
存储 人工智能 缓存
【新版】阿里云 百炼大模型平台 产品功能介绍及配置价格表
大模型应用开发链路包含模型选型、推理调用、数据集处理、模型调优、知识库构建、智能体编排、业务上线、成本管控等大量环节,如果分散在多个不同平台完成整套流程,会带来账号管理复杂、接口不统一、数据流转繁琐、成本难以统计等诸多痛点。阿里云百炼是面向开发者与企业打造的一站式大模型开发服务平台,把模型调用、数据集管理、模型微调、专属部署、向量知识库、智能体应用、MCP工具广场、用量计费管控全部整合到统一控制台,既提供开箱即用的海量预训练模型,也支持开发者完成自定义模型优化与业务应用搭建,降低AI应用从原型验证走向正式业务的技术门槛。
300 0
|
6月前
|
人工智能 运维 安全
别让“龙虾”裸奔!企业规模化“养虾”亟需新一代云网架构护航
本文深入分析了千级 AI Agent 规模化部署时面临的网络架构挑战,包括单 VPC 带宽天花板、安全组规则爆炸、混合云互通复杂等三大硬伤。基于阿里云 ACS+VPC+TR+CEN 的分层隔离架构,提供按业务域划分 VPC、TR 统一路由枢纽、CEN 全球互联的完整解决方案,实现性能隔离、故障隔离、安全合规、弹性扩展和成本优化五大核心价值。适用于 Agent 数量>500、多地域部署、强合规行业及混合云架构的企业场景。
773 6
别让“龙虾”裸奔!企业规模化“养虾”亟需新一代云网架构护航
|
自然语言处理 开发者 监控
云大使推广常见问题Q&A
随着越来越多云大使的加入,推广过程中遇到的问题增加,云大使运营团队特此整理出一系列常见的推广问题以及逐一进行解答。
|
3月前
|
数据采集 人工智能 搜索推荐
AI搜索引用监测实战:基于数据采集与分析的4步技术方案
本文提出基于数据驱动的AI搜索引用监测方案,涵盖4个核心指标(引用频次、位置、竞品对比、AI流量)、4大主流AI引擎(豆包/Kimi/DeepSeek/元宝)定期采集及时间序列分析,助力技术团队量化内容在AI搜索中的可见性与竞争力。
381 0
|
3月前
|
人工智能 运维 数据中心
拆解光模块:从传统分立器件到硅光芯片的集成革命
本文揭秘光模块核心构成(TOSA/ROSA、激光器、调制器、探测器、DSP等),对比传统分立器件与硅光集成技术:前者成熟稳定,后者依托CMOS工艺将光器件“刻”入硅芯片,实现高集成、低功耗,但需外置光源。二者按距离、成本互补共存。(239字)

热门文章

最新文章