大模型竞争进入下半场,存储正在成为 AI Infra 的决胜场

简介: AI时代,存储正从“容量底座”跃升为“智能引擎”。阿里云发布CPFS、KVCacheStore、AgenticFS及OSS/CDE Agent等新品,覆盖训练、推理、Agent全生命周期——百PB级吞吐、亚毫秒KV缓存、百万级Agent空间隔离、自然语言智能运维,全面支撑AI原生与Agent原生演进。

过去一年,AI 的竞争焦点已经从“模型有多大”转向“AI 能在真实业务中走多远”。从训练到推理再到智能体,AI 正在从展示能力的阶段,真正嵌入到企业的真实业务流程中。


这背后是数据规模的指数级跃迁:主流大模型参数量已从千亿级迈向数万亿级,训练数据集在自动驾驶场景中已达数百 PiB 级别,推理阶段的 KV Cache 也在超长上下文窗口下急剧膨胀, Agent 运行环境达到数十万甚至百万级别并发规模。


一直以来,阿里云存储把容量、性能、可用性和可靠性做到了极致,撑起了互联网和云计算的数据底座。当前,AI 带来的新的业务场景和负载特征,是对存储的更高要求,更是 AI 原生时代对阿里云存储提出的全新时代命题。


围绕这三重需求,阿里云于飞天发布时刻推出 CPFS、KVCacheStore、AgenticFS 以及 OSS Agent 和 CDE Agent 等新产品和新能力,构建了一套覆盖 AI 全生命周期的存储产品矩阵。


一、当训练规模重新定义存储的天花板


当前 AI 训练阶段的核心链路是“加载数据、计算、写 Checkpoint、迭代”,每一步都依赖存储,但这条训练链路正在面临多重瓶颈。


Checkpoint 间隔不断缩短至分钟级,模型参数量从千亿迈向数万亿,单次写入量远超之前。数据集规模快速增长。训练数据扩展至百 PiB,数据类型从以文本为主,走向多模态数据。而海量数据冷热混杂,使得全部使用基于 SSD 的高性能存储规格,成本难以持续。


面对这些挑战,阿里云推出了全栈自研的新一代并行文件存储 CPFS,CPFS 从后端存储到 DPU 加速通道,再到 EFC 弹性客户端,全链路基于自研技术,针对训练场景的 IO 特征构建了端到端的加速能力。CPFS 基于阿里云盘古分布式存储底座,采用 Scale-out 分布式架构设计,元数据与数据分离独立扩展,实现容量和性能线性扩展。在计算节点侧通过 DPU 卸载存储协议栈,构建专用的高速存储访问通道,并通过数据零拷贝,来大幅提高计算节点访问存储的性能。


通过这些技术创新,CPFS 单文件系统可提供高达百 TB/s 级别的吞吐和亿级 IOPS,充分满足训练场景对存储的性能需求。在规模上,支持单文件系统线性扩展达百 PiB 容量、万亿级文件。在成本上,CPFS 提供多档存储规格,智能的数据生命周期管理,大幅优化存储成本。

在通义千问大模型训练中,近万卡规模的训练集群覆盖数据预处理、训练、推理全链路。他们面临的痛点是:当近万卡同时读写训练数据,算力分散多地域、异构算力池,模型启动和加载慢会导致算力闲置,高质量语料跟不上训练节奏。使用全栈自研 CPFS 后,异构算力和跨地域资源通过统一 IO 栈访问 CPFS,模型启动平均耗时下降 50%,峰值算力利用率提升 30%,业务承载能力翻倍。语料供给从“等数据”变为“追算力”。


二、当推理速度开始依赖存储的响应


接下来看推理场景。多轮对话与长上下文推理成为趋势,KV Cache 数据量爆发式增长,显存和内存所构建的有限 KV Cache 容量,直接影响缓存命中率与服务吞吐能力。具体而言,推理场景对 KVCache 提出了四大场景的必答题:


一是长上下文推理加速。上下文窗口长度迈向 1M+,KV Cache 数据也在持续膨胀,需要以存代算,将 KV 卸载至高性能、弹性扩展存储层,来突破显存内存墙,降低 TTFT。


二是多轮对话与会话迁移。会话跨节点迁移与故障切换时,KV 状态丢失需整段重算。需要将 KV 状态持久化于共享存储,实现迁移与 Failover 免重算,对话不中断,算力调度更灵活。


三是 P/D 分离架构下,KV 需在两者间高频流转。需要通过共享存储来承接 KVCache 的中转,提供高带宽、亚毫秒级时延,消除数据搬运瓶颈。


四是共享前缀复用。System Prompt 等公共前缀,被大量请求重复 Prefill。需要公共前缀一次写入、全局共享,多请求并发读同一份 KV,提升命中率与 GPU 利用率。


面向大模型推理的 KVCache 加速引擎 KVCacheStore ,交出了自己的答案。它的定位很明确:G3.5 层 KVCache 存储,全球公共云首发。这一层让它贴近算力,性能优于远端 G4 共享存储,单计算节点可提供 40GB/s 吞吐,通过 batch 接口达到百万 QPS。

KVCacheStore 提供高效的 KV 接口,并面向 Mooncake 等主流开源推理框架提供定制化 connector,最大程度简化存储与推理平台的对接。同时 KVCacheStore 独立于算力部署,支持弹性扩容,单实例即可承载千亿级 KV 存储规模。


当前,KVCacheStore 已与客户进行共同验证,KVCacheStore 将缓存命中率提升了 20%,推理服务效率显著改善。


从训练到推理,存储的进化不只是解决单个环节的瓶颈,它在撬动整个算力生态的效率杠杆。存储速度决定了算力转化率:同样的硬件投入,当存储更快更智能,就能产出更多的 AI 能力。


三、当 Agent 成为存储的新用户


当 Agent 时代到来,用户与数据的交互方式正在被重新定义。今年年初个人 Agent 已掀起热潮,如今已拓展至无处不在的企业办公和编码 Agent ,正表明 Agent 赛道已进入了高速发展期。有分析报告显示,2030 年全球 Agent 市场规模会达到 526 亿美金,即增速达到 6 年 10 倍。


Agent 赛道高速增长,规模化落地需要存储跟上发展节奏。每个 Agent 需要独立的工作目录、会话记录和私有文件存储环境,单文件系统租户规模从千级迈向百万级。挂载点规模、配额数、挂载卸载 QPS 会同步放大数个数量级。每个 Agent 实例的生命周期短,压力的波峰波谷快速切换。传统文件系统的弹性和挂载能力无法支撑百万级 Agent 的弹性扩缩容。


而在目录级安全隔离层面,Agent 执行路径由大模型动态生成,易诱发越权访问与误删。每个 Agent 工作目录需要具备独立的权限控制、配额和 QoS 能力,确保数百万 Agent 之间的权限隔离和数据安全。


AgenticFS 专为这些场景而设,这个是一款专为 AI Agent 打造的文件存储全新产品,目前已开放邀测。它引入 AgenticSpace 概念,每个 Agent 拥有独立的命名空间、inode 资源、容量配额和性能隔离,支持百万级 AgenticSpace 动态创建和 10 万 QPS 级挂卸载能力。


AgenticFS 能力层面,可体现在三个维度:


  • 支持多维度资源隔离,让每个 Agent 拥有独立的工作空间 AgenticSpace。每个 AgenticSpace 拥有独立 inode 资源,容量配额与性能隔离,保障多租户环境下的公平性和稳定性。Agent 的会话记录、记忆数据、Markdown、Skills 等持久化数据,都可以安全地存储在 AgenticSpace 中。


  • 规模和弹性方面,AgenticFS 支持百万级 AgenticSpace 的动态创建和 10 万 QPS 级别的挂卸载能力。


  • 安全方面,AgenticSpace 基于 Access Point 和 RAM 访问授权做权限控制,确保不同 Agent 之间的权限隔离和数据安全。

AgenticFS 已经在真实的 Agent 场景中跑起来了。某模型头部客户,作为基于国内领先大模型构建的面向 C 端的 AI 助手应用,提供对话问答、工具调用和 Coding Agent 能力,为海量用户承载多会话并行的智能体服务。这个场景下,存储首当其冲:沙箱随时可能超时、被 Kill 或重建,项目源码和中间产物随之丢失,会话无法续跑。 同时,海量用户和多会话之间需要强隔离、配额可控,任何一个 Agent 的资源异常都不能影响其他会话。


对此,AgenticFS 在这个场景中的解法是:按会话粒度划分 Agent Workspace,每个 Workspace 支持配额管理、访问隔离和性能隔离。沙箱内挂载不同路径,分别承载项目源码、交付物、用户输入和共享 Skill,沙箱随时可重建,数据持久化不丢失。一套存储承载多用户多会话的安全隔离访问,用户之间隔离,同一用户的不同会话之间也隔离。Agent 工作空间真正实现了持久化,会话可以断了再续。


四、当 AI 能力从基础设施走向用户手中


Agent 基础设施就位之后,Agent 能力开始从平台层向用户侧延伸。过去,OSS Agent 更多是控制台里的对话与执行式运维助手,帮助用户完成管控配置、异常定位和数据分析。但 Agent 的价值不止于此,它应该进入客户的核心运维流程,解决高频问题,真正带来智能运维的灵活性与价值。


OSS Agent 也在真实客户场景中得到了验证。 美图作为 OSS 的核心客户之一,在 OSS 上拥有上百个 Bucket,覆盖内部多条业务线。随着图片、视频、素材等非结构化数据持续增长,存储运维的复杂度也在不断攀升。


过去,日常咨询、异常排查、Bucket 管理、元数据分析,很大程度依赖人工逐项排查。既缺全局视角,也难以快速定位问题来源,上百个 Bucket 更谈不上精细化管理。


接入 OSS Agent 后,美图可以用自然语言完成日常咨询和异常排查,比如快速了解某个 Bucket 的配置、容量与状态,或者定位访问异常的原因。基于桶清单的元数据收集,OSS Agent 还能进一步做数据分析和可视化,帮助识别冷热数据分布、资源使用趋势和成本优化空间。


核心变化是从“人工运维”升级为“Agent 驱动的智能分析闭环”。 海量 OSS 资产从“看不清、管不细”变成“可理解、可分析、可优化”,为后续的降本和精细化治理提供了依据。


另外,对于企业来说,企业不缺文件,也不缺模型,缺的是一套能安全地自动处理文件的 Agent 体系。这是 AI 落地的最后一公里,也是企业数据真正产生价值的起点。阿里云盘企业版推出的CDE Agent,其底层能力来自 Qoder 的智能体框架,集成了大模型、记忆、工具链等核心组件。上层依托企业网盘的文件管理、权限审计和组织管理能力,用户通过 CDE Agent 可以完成文件上传下载、多模态检索、安全分享和知识沉淀。


但 CDE Agent 最关键的设计不在能力,在权限。它像员工一样被赋予权限,可复用 AD/LDAP、钉钉、RAM 等既有账号体系,权限粒度精确到文件级。企业不需要为 Agent 重建一套安全体系,数据泄露的风险从架构上就被拦住了。


结尾


从训练、推理到 AI Agent 规模化落地 ,从数据管理到多模态数据语义理解,这套存储产品体系覆盖的是 AI 数据生命周期的完整链路。CPFS 在加速模型训练,KVCacheStore 在提升Token 生产性价比,AgenticFS 在承载百万 Agent 的并发运行环境,OSS Agent 和 CDE Agent 将 AI 能力延伸到存储智能运维和企业知识管理。这不是概念框架,每一个都已经在真实的 AI 场景中跑通。


这不是一个产品方向,它是阿里云存储在 AI Native 和 Agent Native 时代必须面对的基础命题。阿里云正在做的,就是让数据在 AI 时代的每一步都跑得更快、更稳、更远。


相关文章
|
7月前
|
存储 机器学习/深度学习 人工智能
当我们谈论 AI 推理的 KV Cache,我们在说什么?
本文以《Attention Is All You Need》为起点,深入浅出地解析了 Transformer 架构的核心思想与技术细节。
当我们谈论 AI 推理的 KV Cache,我们在说什么?
|
24天前
|
人工智能 数据可视化 测试技术
面试预约电话如何自动化?|阿里云智能联络中心实操指南
阿里云智能联络中心语音智能体,助力招聘高效邀约:AI自动外呼确认候选人意向与时间,支持自然对话、实时打断,准确率95%,1.8秒低延迟,最快1天上线。
125 1
|
28天前
|
存储 人工智能 安全
神眸 x 阿里云-低功耗芯片结合云端,构建百万规模智能摄像头平台
神眸是研极微电子推出的AI智能摄像机品牌,搭载自研超低功耗AI芯片,支持太阳能/电池供电,专为无电无网场景设计。依托阿里云OSS+Tablestore双引擎,提供高可靠云存储、端云协同AI分析(事件检测、智能摘要、自然语言检索等),兼顾安全、智能与易用,已跻身国内监控线上市场TOP5。(239字)
135 1
|
1月前
|
SQL 分布式计算 对象存储
还在自建 Hive Metastore?Spark 直连 OSS Tables 就能跑 Iceberg 【详解 OSS Tables 系列】
本文详解Spark对接OSS Tables数据湖的极简方案:无需自建Hive Metastore,原生兼容Iceberg REST Catalog协议,仅需配置JAR包、凭证及Catalog参数,即可通过标准SQL完成建表、读写、分区、Time Travel等全功能操作。
109 2
|
21天前
|
人工智能 安全 Linux
阿里云无影云电脑与Token Plan组合购活动:Qwen3.8-Max-Preview首发尝鲜,无影组合购享优惠
本文介绍了阿里云无影云电脑与Token Plan联合推出的"快速部署个人AI Agent"活动,主打"Agent托管云电脑,给Agent配个工位"的核心理念,依托无影全栈能力实现ZCode、Hermes Agent、OpenClaw、QwenPaw四大主流AI智能体的一键镜像部署。活动设置Agent入门工位(117.57元起)与Agent高配工位(242.57元起)两档组合购方案,同时提供76.57元起的单产品快速部署选项,支持7×24小时云端稳定运行、多端随时随地接入,解决本地部署环境配置繁琐、任务易中断、数据安全难保障等痛点,为开发者和极客玩家提供开箱即用的专属AI智能体运行环境。
|
25天前
|
SQL 分布式计算 对象存储
Flink 算完的数据存哪?写进 OSS Tables,实时离线读同一张表【详解 OSS Tables 系列】
OSS Tables 是阿里云推出的 Iceberg 数据湖服务,原生兼容 REST Catalog 协议,让 Flink 无需额外部署元数据服务即可直连建表、写入与查询,实现 Exactly-Once 流式入湖,简化实时计算后的数据归宿问题。
|
2月前
|
存储 人工智能 自然语言处理
阿里云盘企业版 CDE Agent 正式发布!企业网盘会思考、能办事,存储即智能
阿里云盘企业版推出CDE Agent,依托Qoder Cloud Agent实现网盘内文件智能处理与内容生成。文件存入即成“可对话、可执行”的智能资产,支持多模态检索、跨格式分析、自动总结与安全分享,全程数据不出域、权限原生继承、操作全程审计,让网盘升级为安全合规的AI智能工作空间。
452 0
|
3月前
|
存储 人工智能 运维
3 人团队零推广获 1.2 万用户:Matrees 如何用 OSS 向量 Bucket 低成本构建 AI 创作平台
Matrees 是 Z 世代创作者的 AI 虚拟世界平台,3 人团队几乎零推广获取 1.2 万用户。依托阿里云 OSS Vector Bucket 实现全托管向量检索,成本降 90%,让创作者专注构建虚拟世界。
407 1
|
3月前
|
存储 人工智能 运维
拍封面,识唱片:UNHEARD 携手阿里云向量 Bucket,用 AI 重新定义实体唱片发现体验
UNHEARD 是一款专为黑胶爱好者打造的数字工具,依托阿里云 OSS 向量 Bucket 与百炼多模态模型,首创“以图搜碟”功能——拍封面即识专辑。集海量唱片数据库、唱片店地图、垂直社区于一体,助力用户轻松发现、识别、管理实体唱片。
828 0
拍封面,识唱片:UNHEARD 携手阿里云向量 Bucket,用 AI 重新定义实体唱片发现体验
|
3月前
|
存储 运维 数据管理
告别“大海捞针”:OSS Vector Bucket 如何赋能媒资管理平台
在 AI 时代,媒资平台面临多模态数据爆炸式增长的管理挑战。阿里云 OSS Vector Bucket 提供统一向量存储与语义检索能力,支持 30 亿级素材秒级精准查找,打破数据孤岛,降低成本,助力内容创作提效降本。
387 11

热门文章

最新文章