【洛神公开课】第5期:AI网络白皮书-01数据采集篇

简介: AI训练常卡在“数据没到位”——PB级语料散落多源,搬运慢则每小时损失数十万元。本文详解阿里云AI数据采集网络:从高速专线、多云互联到OSS/CPFS分层存储,再到eRDMA直通GPU,构建稳定、高效、低成本的数据输送起跑线。(239字)

PB 级数据搬运,才是大模型训练的隐形起跑线 —— 聊聊 AI 数据采集网络

系列一 · 数据采集篇 |阿里云 AI 网络白皮书解读
从多源到 GPU 集群,数据是怎么"跑"进训练场的?

一个被严重低估的问题

跟做大模型的团队聊,你会发现一个反常识的现象:很多训练任务真正的瓶颈,不在 GPU,也不在算法,而在"数据还没到位"。

一个典型的千亿参数训练任务,需要吃进几十 TB 到几百 PB 的原始语料。这些数据可能散落在:

  • 公司自建 IDC 的 HDFS 里
  • 三方数据公司的对象存储桶里
  • 全球十几个 Region 的业务日志里
  • 公网上待爬取的开源数据集里

而 GPU 集群等着开工,每小时的算力成本以万计。只要数据没到位一小时,就是几十万的钱在等。

于是问题就变成了:怎么把 PB 级数据,快速、稳定、私密地喂到训练集群门口?

这就是"AI 数据采集网络"要解决的事。它不是 AI 网络最耀眼的那一层,但它是整个链路的起跑线——起跑没抢好,后面 HPN、eRDMA 再强也没用。

AI 数据采集网络长什么样

先看一张全景图,感受一下数据从多源到 GPU 集群的完整路径:

01-data-ingestion.png
从左到右,四层结构清晰:

  1. 数据源层:线下 IDC、多云、公网、跨地域业务,是异构的
  2. 高速接入层:把不同来源的数据"翻译"成阿里云私网可达
  3. 存储与数据湖层:OSS/CPFS/NAS 三种介质分别承担冷热数据
  4. GPU 训练集群:灵骏智算,通过高吞吐通道从存储层拉数据

下面挨个拆一下每一层的关键设计。

第一层:数据从哪里来?先解决"接得进来"

不同来源的数据,对应不同的入云通道。用错了通道,成本可能差 10 倍,稳定性可能差一个数量级。

场景 A:线下 IDC → 阿里云(PB 级、周期性、企业内部)

✅ 推荐:高速通道 Express Connect + ECR(Express Connect Router)

  • 单端口 400 Gbps 物理专线,多个专线可组池
  • 端到端时延 < 5ms,比公网稳定 100 倍
  • 与 CEN 结合可打通全球 Region
  • 适合日常大数据搬运、Checkpoint 回传、跨地域灾备

避坑:如果只是偶尔搬一次数据(比如项目启动初期一次性把 100TB 灌进 OSS),不要急着开专线,先用 闪电立方(离线迁移)或 OSSUtil 并行上传,成本更低。

场景 B:多云 → 阿里云(AWS/GCP 数据回流)

✅ 推荐:VPN 网关(增强型)多云互联

  • IPsec VPN 增强型单隧道 1 Gbps,可绑 TR 做多隧道叠加
  • 若数据量巨大(> 100TB/月),直接用高速通道对接对端云的 Direct Connect
  • 若是"实时同步"型(如日志),用 PrivateLink 反向暴露 API 服务

场景 C:公网数据(爬虫、开源数据集)

✅ 推荐:NAT 网关 + 弹性公网 IP + 共享带宽包

  • NAT 网关支持 SNAT 出向,避免为每台爬虫机分配独立 EIP
  • 共享带宽包按 95 计费,爬虫场景成本降 60%+
  • 抓完的数据直接写 OSS,走 VPC 内网 0 流量费

场景 D:跨 Region 业务数据回流

✅ 推荐:CEN 云企业网 + TR 转发路由器

  • 跨 Region 带宽 Tbps 级,全球 30+ Region 一张网
  • 支持按需购买跨域带宽包,弹性伸缩
  • 与 CDT(云数据传输)配合,跨域内网流量结算清晰

一个关键决策训练集群该放在数据侧,还是数据该往训练集群走? 答案取决于数据规模:

数据量 建议
< 10 TB 一次性搬到 GPU 集群所在 Region
10 TB - 1 PB CEN 打通,按需拉取
> 1 PB 训练集群靠近数据源部署,减少搬运

第二层:数据落到哪里?存储介质分层是关键

数据入云之后,不是所有数据都要"上热盘"。合理分层,成本可以差 5-10 倍。

OSS 对象存储 —— 温冷数据的默认位:所有原始语料、去重后的 Corpus、多轮清洗的中间产物,先无脑丢 OSS 标准存储。冷了自动下沉到低频/归档层。训练时通过 VPC 私网直通读,不走公网、不产生跨域流量费。

CPFS 并行文件存储 —— 训练时的"高速热盘":真正投喂给 GPU 的数据集,训练开始前用 OSS-CPFS 数据加载器批量预热到 CPFS。智算版单客户端 25 GB/s、系统级 2 TB/s 吞吐,走 eRDMA 直通 GPU。这是 GPU 不空转的关键。

NAS 极速版 —— 元数据密集型场景:需要频繁 lsstat 小文件的场景(比如图像数据集有几千万张小图),NAS 极速版比 CPFS 更合适。

踩坑提示:CPFS 智算版只能被 PAI-Lingjun 和 ACS 挂载,普通 ECS 挂不上。如果你的架构是"自建 K8s + 灵骏节点",需要走 PAI-DLC 或用 CPFS 通用版。

第三层:如何避免"数据慢过 GPU"?

有了数据、有了存储,最后一公里是把数据从存储层高吞吐地送进 GPU

关键设计一:ENI 高带宽

灵骏节点默认配备 ecs.gn9gc(Blackwell)或 ebmgn8v(H800),单机 200 Gbps VPC ENI + 360 Gbps eRDMA ENI。数据加载时用 VPC ENI 拉 CPFS,训练时用 eRDMA ENI 做参数同步,互不干扰

关键设计二:多流并发

单个连接吃不满 200 Gbps。用 多进程 DataLoader + 多 TCP 流并发,或者直接用 CPFS 的 POSIX 客户端(内部走多 QP 并发),实测可以把 200 Gbps 打满 92%+。

关键设计三:Prefetch 流水线

CPU 预取 + GPU 计算流水化。当前 batch 还在算,下一 batch 已经在网络上飞过来了。这是掩盖数据延迟的经典手段,配合 CPFS 的 25 GB/s 单客户端吞吐,可以把 GPU 数据饥饿率压到 3% 以下。

一个真实场景:某大模型公司 300B 训练数据 pipeline

  • 数据源:自建 IDC 有 800 TB 中文语料,AWS S3 有 200 TB 英文数据
  • 入云方式:IDC 用两条 400G 高速通道池化,AWS 用高速通道对 Direct Connect
  • 落地存储:先入 OSS 标准存储,去重清洗后 1 PB → 训练前一次性预热到 CPFS 智算版
  • 训练时读取:4096 张 H800,每卡从 CPFS 直读,聚合吞吐 1.6 TB/s,GPU 利用率 93%
  • 总耗时:数据搬运 6 天,训练 21 天,总周期节省 40%+

核心 takeaway:数据采集网络不是单点技术,而是一个从源头到 GPU 门口的系统工程。规划时优先想清楚这三件事:

  1. 数据规模决定入云通道(专线 / VPN / NAT / CEN)
  2. 数据生命周期决定存储介质(OSS 冷 / CPFS 热 / NAS 元数据)
  3. 加载模式决定网络设计(多流 / 多 ENI / Prefetch)

下一篇预告

数据到位了,训练要开跑。8 张卡里 GPU 怎么通信?4096 张卡怎么保持 96% 线性加速?跨地域怎么协同?

下一篇《训练网络篇》,我们聊 Scale-Up、Scale-Out、Scale-Across 三层是如何配合的,以及 HPN 7.0 + eRDMA 到底解决了哪些经典难题。


📖 延伸阅读

💬 你在 AI 数据 pipeline 里踩过哪些网络坑?评论区聊聊,下一篇我们从"训练集群内部"接着讲。

相关文章
|
2月前
|
人工智能 网络协议 网络性能优化
【洛神公开课】第6期:AI网络白皮书-02训练网络篇
阿里云AI训练网络“三层引擎”(Scale-Up/Out/Across)突破万卡集群瓶颈:NVLink实现单机8卡全互联,HPN+eRDMA将跨机通信时延压至2μs,CEN+TR支撑跨域Tbps级协同。三者协同达成96%线性加速比,显著破解GPU空转难题。(239字)
519 1
|
3月前
|
人工智能 运维 自然语言处理
阿里云Agent Infra香港首秀:170+机构到场,1700+人次互动
2025年5月21日,阿里云应邀出席由香港生产力促进局(HKPC)主办的"Innovating Public Services, Driving the AI Transformation" 大型人工智能主题盛会。本次活动汇聚香港政产学研各界力量,聚焦人工智能技术在政府治理、社会服务及产业转型中的创新应用。阿里云作为亚太地区领先的云计算与人工智能全栈服务商,深度参与本次活动,通过展台展示、技术分享及高层对话等多种形式,全面呈现阿里云在Agent Infra及智能体应用领域的最新成果,进一步夯实了阿里云在香港及粤港澳大湾区市场的影响力。
440 2
|
3月前
|
弹性计算 负载均衡 安全
【洛神公开课】第1期:如何设计一套安全、高可用、可扩展的 VPC 网络架构
从单 VPC 起步到多 VPC 互联的真实组网难题出发,拆解 VPC 划分原则、IP 规划十步法、TR 多场景互通、PrivateLink 共享服务、DMZ 统一公网出入口五大主题,并附产品选型对照表,帮你少踩弯路、把架构一次画对。
394 0
|
5月前
|
存储 人工智能 弹性计算
揭秘千问 APP 千万级 AI 订单背后的记忆存储实践
2026年春节,千问 APP “春节请客计划” 9 小时破 1000 万单,依赖 Tablestore 构建的一站式记忆系统:支持短期/长期记忆统一管理、毫秒级读写、Serverless 弹性伸缩、多模态数据融合及原生向量检索,实现数十亿条记忆的高效存储与实时流转。
1208 118
|
3月前
|
人工智能 Kubernetes 应用服务中间件
🚀【技术直播 · 重磅】Nginx Ingress 退役后,如何选对生产级网关?6月24日14:00-15:30,请锁定开发者社区直播间
"Nginx Ingress 不更新了,我该咋办?" 这场直播就是答案。 阿里云专家在线拆解迁移全流程,手把手教你不踩坑、不停服、不背锅。
367 2
|
5月前
|
人工智能 运维 安全
别让“龙虾”裸奔!企业规模化“养虾”亟需新一代云网架构护航
本文深入分析了千级 AI Agent 规模化部署时面临的网络架构挑战,包括单 VPC 带宽天花板、安全组规则爆炸、混合云互通复杂等三大硬伤。基于阿里云 ACS+VPC+TR+CEN 的分层隔离架构,提供按业务域划分 VPC、TR 统一路由枢纽、CEN 全球互联的完整解决方案,实现性能隔离、故障隔离、安全合规、弹性扩展和成本优化五大核心价值。适用于 Agent 数量>500、多地域部署、强合规行业及混合云架构的企业场景。
741 6
别让“龙虾”裸奔!企业规模化“养虾”亟需新一代云网架构护航
|
3月前
|
运维 Prometheus 监控
【洛神公开课】第4期:云网络智能运维方案
云网络运维告别“盯屏救火”!本文详解阿里云推荐的智能运维四件套:大盘(全局监控)、告警(主动感知)、巡检(隐患前置排查)、工具(NIS深度诊断),助你从被动响应升级为可视、可管、可控的主动运营中心。(239字)
268 0
|
3月前
|
运维 安全 容灾
【洛神公开课】第3期:阿里云全球化网络方案实操选型
本文系统解析阿里云全球化网络四大核心方案(专线、VPN、CEN、SD-WAN),覆盖企业出海、多云互联、跨境合规、低时延组网等典型场景,聚焦落地要点与避坑指南,助您高效构建安全、稳定、弹性的一张全球虚拟网。(239字)
503 0
|
6月前
|
Kubernetes 应用服务中间件 API
【重磅推荐】告别Ingress NGINX后,我们的思考和建议
K8s社区宣布Ingress NGINX将于2026年3月正式退役:虽API仍受支持,但停止更新与安全修复。主因是高危漏洞频发(如CVE-2025-1974)、维护者严重不足及架构技术债沉重。推荐生产环境平滑迁移至阿里云ALB Ingress——免运维、高SLA、兼容NGINX注解,并迈向Gateway API标准化未来
1192 2