新一代全栈自研 CPFS 正式商业化: 为下一代 AI 训练集群设计

简介: 2026年9月,阿里云发布全栈自研新一代CPFS存储,支持百TB/s吞吐、亿级IOPS及100PiB单文件系统,显著提升大模型训练效率:启动耗时降50%、算力利用率升30%、存储成本降69%,已落地小鹏汽车等企业。

2026 年 9 月,阿里云正式推出面向下一代 AI 训练集群的新一代全栈自研存储 CPFS(Cloud Parallel File Storage)。随后,CPFS 于 9 月 30 日在北京、乌兰察布、新加坡三地正式推出商业化服务。

随着大模型迈入十万亿级参数规模,预训练阶段如何持续提升模型 Checkpoint 的读写性能成为大模型训练企业的核心关切。新一代全栈自研 CPFS 提供高达百 TB/s 级吞吐和亿级 IOPS,单文件系统规模提升 5 倍至 100 PiB,可支撑大规模模型训练和多模态数据处理。在实际模型训练中,可将模型启动平均耗时降低 50%、峰值算力利用率提升 30%、AI存储成本降低 69%,业务承载能力翻倍,使 GPU 从“等待数据”转向持续高效计算。


面向百万 GPU 卡训练负载,新一代 CPFS 基于飞天盘古底座和高性能存储网络,通过从后端存储到 DPU 加速通道,再到 EFC 弹性客户端全链路自研链路,形成从客户端、协议处理到数据落盘的全链路能力。


其中在数据与元数据侧,CPFS 采用数据与原数据相分离、独立 Scale-out 的分布式架构。相较于上一代 CPFS 架构,新一代 CPFS 文件系统容量规模提升 5 倍、元数据性能提升 10 倍、文件数量规模提升 100 倍,单文件系统可扩展至百 PiB 并承载万亿级文件。


弹性客户端侧,通过软硬一体优化的全链路零拷贝与 RDMA 网络,单客户端吞吐可达 40GB/s。CPFS 的 EFC 弹性客户端提供与本地文件系统一致的时延体验,最大提供单客户端 100 万 IOPS。


在成本方面,新一代 CPFS 支持按需加载 OSS 数据(Lazyload),配合元数据自动同步与智能淘汰机制,将训练数据就绪时间从小时级缩短至分钟级,冷数据常驻低成本对象存储,降低整对文章存在错误之处体存储成本。


针对冷热数据长期并存带来的成本压力,CPFS还提供智能生命周期管理和冷热分层存储,使不同访问频率的数据自动匹配合适的存储介质,在保障训练性能的同时,整体存储成本最高降低 69%。


面向大规模 AI 训练与数据治理方面,新一代 CPFS 以统一命名空间与数据洞察两大能力承接生产负载:前者聚合分散在多套文件系统中的训练数据,简化数据管理与调度,后者覆盖热点分析、容量分析与元数据投递三维度,由此,CPFS 让存储成本治理从经验驱动转向数据驱动。企业无需为不同训练阶段反复拆分或迁移数据,即可在统一文件系统中管理训练语料、模型参数、Checkpoint 和实验结果,并随 GPU 集群同步扩展容量与吞吐。以 Qwen 大模型训练为例,采用新一代 CPFS 后,模型启动平均耗时降低 50%,峰值算力利用率提升 30%,业务承载能力翻倍。


目前,新一代 CPFS 已在小鹏汽车、黑芝麻智能、爱诗科技等客户生产环境投入使用,支撑智驾模型训练、芯片研发与大规模仿真验证、多模态模型训练等业务场景。


新架构 CPFS 的商业化,标志着阿里云 AI 智算存储底座又一次完成架构级换代。未来,阿里云存储继续为 AI 而生,延续全栈自研路线,追求性能和成本的极致突破。与 AI 共长,阿里云存储持续支撑数百万家 AI 大模型公司客户跑通从数据集处理、模型训练到推理落地的全流程,为大模型训练和 AI 应用提供高性能、可扩展且成本可持续优化的存储底座。

相关文章
|
8天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
7382 12
|
6天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
1545 4
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
7天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
998 8
|
3天前
|
人工智能 JavaScript 芯片
DeepSeek 官方偷偷上传 Harness 桌面端安装包,我已经用上了。。附最新下载地址
DeepSeek Harness 官方的桌面端安装包被网友扒出来了,2 分钟讲明白如何使用,体验如何,适合作为 AI 编程工具么?附最新 Windows 和 Mac 双端的下载地址
1196 1
|
20天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
3579 10
|
15天前
|
缓存 IDE Java
【保姆级】Android Studio下载、安装和汉化教程(2026最新)
Android Studio 是 Google 官方推出的免费 Android 应用开发集成环境,基于 IntelliJ IDEA,内置模拟器、调试器、性能分析及 Compose 界面工具,功能全面,文档丰富,是安卓开发首选工具。(239字)
1611 1
|
4天前
|
编解码 缓存 PyTorch
16G 显卡能跑 Qwen-Image 2.1 吗?
9月20日,阿里Qwen开源Qwen-Image-2.1:7B DiT图像模型+8B文本编码器+VAE,单模型支持文生图与图像编辑,原生输出2K PNG(含Alpha通道),支持10张参考图。在自建Qwen-Image-Bench达60.28分(开源模型第一),GenAI Showdown文生图排名7/15。16G显存可跑1024×1024(需INT8量化+ComfyUI优化),但2K需24G以上。注意其Qwen Research License限非商业用途。
506 1
|
5天前
|
人工智能 编解码 并行计算
MiniMax-H3 一键整合包技术文档:8G 显存运行 AI 漫剧制作 —— 角色替换 / 动作迁移 / 文图生视频部署与调参指南
MiniMax H3 是 MiniMax 开源的全模态视频生成模型,支持文/图/音/视多条件输入,输出最高2K、15秒带双声道音频视频。本文档详述其Int8量化版在8GB显存下的本地一键部署、三段式工作流(EDIT/REPLACE/CONTINUE)、参数调优及常见问题排查。(239字)

热门文章

最新文章