【洛神公开课】第6期:AI网络白皮书-02训练网络篇

简介: 阿里云AI训练网络“三层引擎”(Scale-Up/Out/Across)突破万卡集群瓶颈:NVLink实现单机8卡全互联,HPN+eRDMA将跨机通信时延压至2μs,CEN+TR支撑跨域Tbps级协同。三者协同达成96%线性加速比,显著破解GPU空转难题。(239字)

万卡集群怎么保持 96% 线性加速?拆解阿里云 AI 训练网络三层引擎

系列二 · 训练网络篇 |阿里云 AI 网络白皮书解读
Scale-Up + Scale-Out + Scale-Across,训练网络的"三级火箭"

从一个反直觉的现象说起

先问一个数字:训练一个千亿参数模型,一次 AllReduce 要传多少数据?

答案是:每次几十 GB 到几百 GB,每秒可能要做几十次。

如果网络跟不上,会发生什么?——万卡集群里,只有 30% 的时间 GPU 在算,剩下 70% 在等对方传参数。这就是行业内著名的 "GPU 空转陷阱"。

要打破这个陷阱,训练网络必须做到三件事:

  1. 单机内的 GPU 之间通信要极快(Scale-Up)
  2. 多机之间的 GPU 通信要几乎不损失(Scale-Out)
  3. 跨地域的资源要能够协同调度(Scale-Across)

这三层,对应三种截然不同的网络技术。阿里云 AI 网络白皮书里把它总结为"三层引擎"。

02-training-three-layers.png
[AI 训练网络三层引擎]

类比:电梯 + 班车 + 高铁

如果把 GPU 集群比作一座跨城的智能园区,这三层网络就分别是三种交通工具:

  • Scale-Up = 楼内电梯:同一栋楼里,从 1 楼到 20 楼,几秒钟就到,运力极大
  • Scale-Out = 园区大巴:园区内几十栋楼之间的往返,班次密、路线固定、专用车道
  • Scale-Across = 城际高铁:跨城市的协同,速度快但有距离限制

看懂这个类比,下面每一层的技术选型就有了直觉。

第一层:Scale-Up —— NVLink / NVSwitch

问题:一台 GPU 服务器里塞了 8 张 H800,它们之间要不要过 PCIe?过 PCIe 会怎样?

答案:过 PCIe,带宽从 900 GB/s 掉到 64 GB/s,一下降 15 倍

解决方案:NVLink + NVSwitch,让 8 张 GPU 组成一个"全互联"的小网络。

指标 NVLink(Scale-Up) PCIe Gen5
单向带宽 900 GB/s 64 GB/s
时延 < 100 ns ~500 ns
拓扑 Full Mesh 树形
典型用途 Tensor Parallelism 磁盘/网卡

阿里云选型ecs.ebmgn8v(8×H800,NVLink 全互联)或 ecs.gn9gc(Blackwell,NVLink5)。

关键设计:一台机器 = 一个"Tensor 并行域"。模型的一层权重切在这 8 张卡上,靠 NVLink 快速交换 activation

第二层:Scale-Out —— HPN + eRDMA

问题:8 张卡装不下千亿模型。要 4096 张、甚至更多。多机之间怎么通信?

传统 TCP/IP 网络的问题:CPU 参与、多次拷贝、协议开销大。跨机 AllReduce 时延经常在 100μs 以上,GPU 大部分时间在等

阿里云的方案是两个技术叠加:

HPN 7.0(高性能网络)

  • 51.2T 单芯片交换:目前业界最高的单颗交换机吞吐
  • 400 Gbps 单端口:直连 GPU 网卡
  • 轨道优化拓扑(Rail-Optimized):同 rank 的 GPU 走同一条"轨道",避免拥塞
  • 端到端时延 2μs:接近单机内 NVLink 时代的时延感受
  • 万卡线性扩展 > 96%:意思是"1 万张卡的实际速度 ≥ 单卡速度 × 9600"

eRDMA(弹性 RDMA)

RDMA = 远程直接内存访问,跳过 CPU 和内核,网卡直接读写对端内存。传统 RDMA 需要专门的硬件(IB),成本高、锁死。阿里云 eRDMA 把 RDMA 跑在标准以太网上,兼容 VPC 网络,是"云化 RDMA"的代表:

  • 单卡 360 Gbps eRDMA ENI(ecs.gn9gc
  • 硬件卸载:CPU 参与度接近 0
  • 故障 < 1s 收敛:这是万卡训练里救命的能力——出问题的节点被瞬间隔离,训练继续

两个必须知道的细节

  1. HPN 网络是独立的物理网络,不和 VPC 网络共用交换机。所以灵骏节点通常有两张网卡:一张 VPC ENI 走数据加载和管控,一张 eRDMA ENI 走参数同步。
  2. NCCL / DeepSpeed / Megatron-LM 都已经原生适配 eRDMA,业务代码零改动。

第三层:Scale-Across —— CEN + TR + 高速通道

问题:为什么要跨地域?训练不是应该在同一个集群里做吗?

现实是:大模型训练场景经常需要跨地域,比如:

  • Checkpoint 备份到另一个 Region(防单点故障)
  • 训练集群在张家口(电价低),推理集群在杭州(离用户近),模型要跨域同步
  • 冷数据在西部集群,热训练在东部集群,需要数据迁移
  • 多 Region 联邦训练(Federated Learning)

跨地域网络的挑战是带宽 + 时延 + 成本的三角平衡。

阿里云的方案

  • CEN(云企业网) + TR(转发路由器):全球 30+ Region 一张网,跨域带宽 Tbps 级
  • 高速通道 Express Connect:物理专线,单端口 400 Gbps
  • VPN 网关(增强型):低成本备用通道,可挂到 TR 上做主备

典型部署

    杭州训练集群                北京推理集群
   [灵骏 4096 卡]              [PAI-EAS 集群]
        |                            |
     VPC-hz                      VPC-bj
        |                            |
        └───────  CEN + TR  ─────────┘
                   Tbps 带宽
                   跨域 20-30ms

Checkpoint 每 15 分钟从杭州同步到北京,走 CEN 内网走跨域带宽包,比公网稳定 100 倍,成本降 70%+

三层协同:一个完整的训练网络长什么样

假设你要跑一个 175B 的稠密模型训练,4096 张 H800:

层级 使用技术 承担的流量
Scale-Up NVLink 8 卡内 TP(Tensor Parallel)activation 交换
Scale-Out HPN + eRDMA 512 台机器间 DP(Data Parallel)+ PP(Pipeline Parallel)梯度同步
Scale-Across CEN + TR Checkpoint 跨 Region 备份 · 冷数据回流

每一层的流量特征完全不同,所以用了完全不同的网络技术。这也是"三层引擎"这个说法真正的价值——它把复杂的问题按物理边界切开了,让每一层都能用最匹配的技术去解

与传统云网络的关键区别

很多人问:HPN 和普通 VPC 网络到底差在哪?

一张表说清楚:

维度 传统 VPC 网络 HPN + eRDMA
单端口带宽 25-100 Gbps 400 Gbps
端到端时延 100-500 μs 2 μs
拥塞控制 ECN / DCQCN PFC + 端到端反压
CPU 参与 高(内核态) 极低(硬件卸载)
故障收敛 秒级到分钟级 < 1 秒
拓扑 Clos + 通用负载 轨道优化 + 无阻塞
定位 通用互联 AI 训练专用

记住一句话HPN 不是"更快的 VPC",它是为 AI 训练重新设计的专用网络。你不会拿高铁去送外卖,同样,普通业务也用不到 HPN。

一线经验:三个必知的踩坑点

坑一:NCCL 参数没调对
默认 NCCL 参数是通用配置,跑在 HPN 上必须调整:

export NCCL_IB_HCA=erdma_0,erdma_1
export NCCL_IB_GID_INDEX=3
export NCCL_NET_GDR_LEVEL=2
export NCCL_IB_QPS_PER_CONNECTION=8

不调这个,实测吞吐能少 40%。

坑二:Checkpoint 打爆跨域带宽包
一次 Checkpoint 几百 GB,如果配置成"每 5 分钟同步一次",跨域带宽包会瞬间打满。建议:

  • 增量 Checkpoint(只传 diff)
  • 分层保存(每小时全量 + 每 5 分钟增量)
  • 用 OSS 跨区域复制 CRR 做异步复制

坑三:混部 VPC 和 eRDMA 流量
灵骏节点两张网卡各司其职:VPC ENI 走管控 + 数据加载eRDMA ENI 只走 NCCL。绑错网卡后果严重——PFC 反压会把 VPC 网卡也打瘫。

一个数字感受一下"三层引擎"的威力

某头部 AI 公司做过一次对比实验:

  • 场景:4096 张 H800,训练 175B 模型
  • 方案 A:普通 VPC 网络 + TCP/IP → 线性加速比 68%(等效 2785 卡)
  • 方案 B:HPN + eRDMA + NVLink 三层引擎 → 线性加速比 96%(等效 3932 卡)

同样的钱、同样的卡数,训练速度差了 40%。 折算下来一年多训练几十次的量,直接决定谁能先发出下一代模型。

下一篇预告

模型训完了,要上线服务。用户的请求怎么进来?流式响应怎么保活?Prefill 和 Decode 怎么分离?KV Cache 怎么跨节点共享?

下一篇《AI 推理网络:ALB AI 扩展版与 P/D 分离实战》,聊聊阿里云为大模型推理专门造的这套 AI 原生网关。


📖 延伸阅读

💬 你在多机训练中用什么策略打满带宽?欢迎评论区分享 NCCL 调参经验。下一篇我们把镜头切到推理侧。

相关文章
|
4月前
|
人工智能 运维 安全
别让“龙虾”裸奔!企业规模化“养虾”亟需新一代云网架构护航
本文深入分析了千级 AI Agent 规模化部署时面临的网络架构挑战,包括单 VPC 带宽天花板、安全组规则爆炸、混合云互通复杂等三大硬伤。基于阿里云 ACS+VPC+TR+CEN 的分层隔离架构,提供按业务域划分 VPC、TR 统一路由枢纽、CEN 全球互联的完整解决方案,实现性能隔离、故障隔离、安全合规、弹性扩展和成本优化五大核心价值。适用于 Agent 数量>500、多地域部署、强合规行业及混合云架构的企业场景。
645 6
别让“龙虾”裸奔!企业规模化“养虾”亟需新一代云网架构护航
|
人工智能 安全 Apache
QwenPaw:你的私人 AI 助理 —— 数据归你、记忆进化、多端触达的开源个人智能体
QwenPaw 是一款开源、本地优先的AI个人智能体(Apache 2.0),数据归属用户、记忆自主进化、支持钉钉/飞书/微信等多端触达。3行命令即可部署,内置Coding IDE、Persona人格、定时任务、MCP工具生态与多Agent协作,真正属于你的私有AI助理。
QwenPaw:你的私人 AI 助理 —— 数据归你、记忆进化、多端触达的开源个人智能体
|
2月前
|
机器学习/深度学习 人工智能 调度
🐴 HappyHorse 1.1 现已上线阿里云百炼!快来查收模型使用指南,现在调用享 6 折~
HappyHorse 1.1 是新一代视频生成大模型,全面升级动态表现力、角色一致性、指令遵循、视觉质感与音画协同能力。支持I2V/T2V/R2V三类生成,适配短剧、电商广告、品牌营销等场景,提供高质、流畅、可控的AI视频生产力。
1394 6
🐴 HappyHorse 1.1 现已上线阿里云百炼!快来查收模型使用指南,现在调用享 6 折~
|
2月前
|
人工智能 运维 自然语言处理
阿里云Agent Infra香港首秀:170+机构到场,1700+人次互动
2025年5月21日,阿里云应邀出席由香港生产力促进局(HKPC)主办的"Innovating Public Services, Driving the AI Transformation" 大型人工智能主题盛会。本次活动汇聚香港政产学研各界力量,聚焦人工智能技术在政府治理、社会服务及产业转型中的创新应用。阿里云作为亚太地区领先的云计算与人工智能全栈服务商,深度参与本次活动,通过展台展示、技术分享及高层对话等多种形式,全面呈现阿里云在Agent Infra及智能体应用领域的最新成果,进一步夯实了阿里云在香港及粤港澳大湾区市场的影响力。
321 2
|
5月前
|
数据采集 人工智能 API
从空壳到印钞机!OpenClaw公众号Agent技能开发手册(阿里云+本地部署+免费API+爆款Skill拆解)
“装上OpenClaw却只会聊天?别人已经靠它实现公众号全自动运营,你还在手动找选题、排版、发布”——2026年,这只红色“大龙虾”的爆火,让无数人陷入“有工具不会用”的困境。参考文章一语道破核心:OpenClaw的灵魂不是模型,而是Skill(技能)。没有Skill的OpenClaw只是空壳,而搭载了专属Skill的OpenClaw,能变身“全自动公众号印钞机”,从选题、创作、配图到发布,全程无需人工干预。
973 7
|
2月前
|
人工智能 Kubernetes 应用服务中间件
🚀【技术直播 · 重磅】Nginx Ingress 退役后,如何选对生产级网关?6月24日14:00-15:30,请锁定开发者社区直播间
"Nginx Ingress 不更新了,我该咋办?" 这场直播就是答案。 阿里云专家在线拆解迁移全流程,手把手教你不踩坑、不停服、不背锅。
243 2
|
2月前
|
弹性计算 负载均衡 安全
【洛神公开课】第1期:如何设计一套安全、高可用、可扩展的 VPC 网络架构
从单 VPC 起步到多 VPC 互联的真实组网难题出发,拆解 VPC 划分原则、IP 规划十步法、TR 多场景互通、PrivateLink 共享服务、DMZ 统一公网出入口五大主题,并附产品选型对照表,帮你少踩弯路、把架构一次画对。
237 0
|
3月前
|
弹性计算 安全 关系型数据库
阿里云服务器2核2G、2核4G、4核8G、8核16G怎么选实例?最新活动价格对比与实例规格选择指南
本文介绍了2026年阿里云服务器2核2G、2核4G、4核8G、8核16G配置的最新活动价格及选购指南。阿里云为个人开发者、初创团队及轻量级业务企业提供多样入门配置选择,如2核2G轻量应用服务器仅38元一年,2核4G配置199元包年。对于业务规模扩大或应用复杂度提升的用户,阿里云提供4核8G与8核16G配置,价格从1252.63元到5958.52元一年不等,满足不同性能需求。用户可根据业务需求和预算,在阿里云丰富产品线与优惠策略中选配最合适的云服务器实例。
|
4月前
|
缓存 数据安全/隐私保护 Windows
windows远程,使用微软账号,密码正确,但是提示登录没有成功
微软账户远程桌面失败?主因是目标机未缓存云端凭据。解决方法:在被控电脑用 `runas /user:MicrosoftAccount\邮箱 notepad` 命令手动缓存账户,输入密码后记事本成功启动即生效,无需改账户类型。(239字)

热门文章

最新文章