
导读:Agentic AI 时代到来,算力需求结构全面重塑,芯片厂商与云厂商的合作也随之升级。
文 / 胡珈萌
当前AI正在经历一个关键转折。随着智能体 (Agent)的规模化落地,Agentic AI 时代已经到来,人们不再满足于“我问你答”的聊天机器人,而是需要“独当一面”的任务执行者。
需求的迭代正深刻重塑底层算力的需求结构,芯片厂商、云计算厂商都在校准坐标,迎接新的挑战。与此同时,双方的关系和合作模式也随之发生改变。
作为两大领域的代表企业,阿里云与 AMD 这对长期深度战略合作伙伴,正进一步加强互动、协作,推动算力供给全面匹配 Agentic AI 时代的新需求。双方的合作也由此进入全新阶段,从提供性能更强的芯片、更高性价比的算力服务,升级为共同定义能够高效运行 Agent 的下一代云计算和 AI 基础设施。
Agentic AI 时代的算力变局
2023 年至 2025 年,AI 的主线是大模型智能水平的跃迁,如何训练出更强的模型,是时代的核心命题。与之对应的,AI 算力竞赛的焦点几乎完全集中在 GPU 上。
2026 年,AI 迎来了“Agent 规模化落地元年”。在算力层面,这大幅推高了推理环节的需求。与此同时, Agent 完成任务时,运行链条也更为复杂,需要自主拆解任务、规划步骤、调用工具、处理数据、多轮推理、校验结果。而 GPU 在其中主要仍负责“调用模型做推理”,更多的编排和调度工作则需要 CPU 处理。
随着 CPU 的角色愈发吃重,其在 AI 基础设施中与 GPU 的配比也在发生变化。AMD 方面指出,数据中心 CPU 与 GPU 的配比正从过去的 1:4、1:8 向 1:1 靠拢。
但 Agentic AI 时代对算力需求结构带来的影响远不止加码 CPU 这么简单。
与传统相对单一的 AI 推理或企业应用负载相比,Agentic AI 的负载特征也更加复杂、碎片化、不可预测。它不仅考验某一个加速器的峰值算力,更会考验整个系统的通用计算能力、并发处理能力、内存访问能力和 I/ O 能力。因此,想要支撑 Agentic AI 的规模化落地,就不能单纯关注 CPU 和 GPU 的数量比例,而是要看整个 AI 系统能否在 CPU、GPU、网络、存储和软件栈之间实现更好的协同,让 Agent 工作流稳定、高效地跑起来。
正是这种根本性转变,让阿里云与 AMD 的合作模式发生质变,早已超越了传统的“采购 - 供应”关系。实际上,双方的合作从第二代 EPYC Rome 时期即已开始芯片定制,到第五代 EPYC Turin 时代,更是演进为从芯片产品定义阶段便深度介入的“共创模式”。
当然,Agentic AI 时代也进一步助推云厂商甚至模型厂商“下场造芯”的浪潮。这主要源于相关厂商需要基于对自身应用场景的业务负载、商业模型和用户需求等特点,通过自研或定制的专用 ASIC,来优化成本、能效或者特定推理场景。
这一定程度上会带来芯片厂商与云厂商的竞争,但 AMD 大中华区销售副总裁周俊杰认为,未来双方会更 近似“既合作、也有局部竞争”的关系。随着AI的发展,还会涌现出更多的合作机会,比如芯片设计服务、平台级联合优化、软件生态共建,以及面向 Agentic AI 的新型基础设施方案等。
他表示,对于 AMD 来说,我们更希望和阿里云等云厂商一起,把通用算力、专用优化和开放软件生态结合起来,共同推动下一代 AI 基础设施落地。
深度协同,全栈共创
时代变革之际,阿里云也在自我迭代。
2026 年 5 月 20 日,阿里云宣布全面迈入 Agentic Cloud 时代,开启了一场“基础设施换底座”式的全栈 革命。
这是一场“从芯到云”的全面重塑,意味着云平台不再只是提供算力资源,而是开始承载大量 Agent 应用的 运行、调度和服务。
对于阿里云和 AMD 的合作来说,这也形成了全新的挑战。阿里云方面,需要更准确地判断未来业务增长和算力需求,才能针对性地给出对芯片的要求;而对 AMD 来说,则要在产品规划、产能准备、交付节奏和生态支持上更早做准备,才能拿出适配的产品。
想要应对这种挑战,双方合作的重点就需要超越单次项目交付,进入深度协同,全栈共创的新阶段。
周俊杰表示,AMD 在合作中会更早参与需求规划,更好理解阿里云未来的业务节奏和算力增长曲线,双方也会一起推动合作方式从短期供货,转向更长期、更稳定的供需协同。在产品路线、产能规划、软件适配、平台验证和部署节奏上更早对齐,以便更好地支撑新一代 AI 应用的规模化落地。
目前,双方合作关系和模式的演进,已经在硬件、软件和生态层面的深度协同中有所展现。
硬件层:深入业务场景,“一芯多用”满足不同需求
在硬件层面,阿里云和 AMD 在多个产品维度都有合作,在合作中,双方会一起探索不同业务负载需要什么样的平台能力,再围绕性能、能效、稳定性和部署效率做硬件的联合优化。
其中最典型的体现当属基于 AMD 第五代 EPYC 处理器 Turin 平台推出的最新一代企业级 ECS 实例。
早在芯片定义阶段,AMD 便与阿里云进行了深度沟通,引入了“场景化设计”思维,最终在 Turin 平台上实现了底层架构的多元化,打造出了能够精准击中不同场景业务痛点的多款实例。
其中,g9a/g9ae 凭借高核心密度的架构,在大数据处理、高并发容器化场景中实现了性能的大幅提升,得以应用在数据库、大数据分析、Web 服务、AI 推理前后处理等高性能和高并发场景,适合对计算能力、稳定性和业务连续性要求比较高的企业级负载,为相关业务运行提供了坚实保障。
例如,某头部社交客户在搜索推荐场景中,借助 g9ae 的物理核设计与混部+开关核策略,实现推荐系统端到端性价比提升;某全球知名电商平台基于 g9ae 运 行大数据 Spark 作业,数据处理整体耗时较上代降低 43%,有效疏通了高算力、高内存带宽与高 I/O 负载下的关键瓶颈。
u2a 实例则是普惠算力的代表,重点是低成本、高性价比和稳定性,适合对成本比较敏感、又希望获得稳定算力的通用场景,为中小企业数字化、开发测试等提供了极具性价比的选择,也尤其契合当前正在兴起的 Agent 编排、工具调用、轻量推理前后处理和云原生服务支撑等 Agentic AI 场景。
性能较上代 u1 基线提升 20%,包月目录价降低 10%,综合性价比最高可提升 50%。
这种“芯云协同”深入业务场景的精细化定制,获得了客户的普遍认可,而在规模化云部署场景中,Turin 平台在性能、能效和总拥有成本(TCO)上的优势也进一步凸显,为客户带来更高的经济效益。
软件层:从“适配验证”到“开源共建”
硬件决定了算力的下限,软件与生态则决定了算力的上限。在 Agentic AI 时代,面对复杂的混合负载,单纯的硬件堆叠已不再适用,软硬件深度融合变得愈发重要。
在 Turin 实例研发中,双方为了让自研的 Alibaba Cloud Linux 3 操作系统与 AMD 平台实现“基因级” 适配,提交了数百个内核补丁,涉及 2 万余行代码的优化,还专门针对多核架构与 I/O 模块进行深度调优,最终实现了性能大幅提升,延迟明显降低,稳定性也显著增强。
此外,AMD 也是阿里云发起并主导的开源操作系统社区龙蜥社区(OpenAnolis)的理事单位,深度参与、贡献,与社区生态伙伴协同使能、优化 AMD 产品和相关软件栈,通过开源共建打破技术边界。通过社区协作,双方也将底层的硬件特性抽象为通用的软件接口,使得上层业务系统得以无缝继承硬件迭代的红利,显著降低客户迁移、部署的适配成本与运维风险。
生态层:打通全链生态,加速 AI 价值落地
在生态层面,阿里云和 AMD 也致力于更加深入地协同、互动,打通硬件平台、操作系统、驱动、开发框架和应用生态,并联合 ISV、模型厂商和开发者社区,帮助客户更快把 AI 能力真正落到业务里。
对于亟需 AI 产生经济价值的客户来说,生态协同最直接的好处,就是可以降低软硬件适配成本,减少迁移风险,缩短从验证到上线的周期,同时在稳定性、性能调优和问题定位上也能获得更完整的支持。
双方也始终锚定更好服务客户的方向,推动开放生态更成熟、更好用、更易用,让阿里云客户能够更方便地使用先进 AI 能力,无需在底层适配和生态兼容上投入过多重复工作。
Agentic Cloud 时代的开启,也意味着阿里云的算力体系将从“以人为中心”进化到“以 Agent 为中心”。
以往的 AI Native Cloud,是“为 AI 打造的云”,强调云本身要为 AI 而设计,能够高效支撑模型训练、推理部署和大规模算力供给。核心评估指标是算力够不够强、资源利用率高不高、训练和推理能不能稳定跑起来。
而在阿里云近期发布的 Agent Native Cloud,则围绕 “AI 原生”的 Agent 设计,进一步强调云平台要能支 撑大量 Agent 持续运行、相互协作,并且和各种工具、数据和业务系统连接起来。这也为 AMD 和阿里云的合作带来了更复杂的挑战。双方也由此展开了更深度的合作,打造完整异构计算平台,实现更强的系统调度能力、资源协同能力,构建更稳定的端到端基础设施,推动 AI Native Cloud 向 Agent Native Cloud 的演进,同时让平台在性能、成本、开放性和可扩展性之间取得更好的平衡。
定义下一代 AI 算力基础设施
AI 变革仍在进行时,Agentic Cloud 和 AI 基础设施也在快速演进。
尤其在上下游持续投入大规模资本支出,技术兑现价值愈发紧迫之际,随着 AI 与真实业务场景的不断碰撞,会涌现出更多新的需求、新的改变。
周俊杰结合 AMD 专家、产业链合作伙伴的观点分析称,AI 领域还有很多变化和未知目前无法完全看清,比如多模态实时交互、多 Agent 协同、长上下文和长期记忆、端边云协同推理,以及 AI 安全和隐私保护等,而这些都会继续影响算力基础设施的演进方向。因此,算力基础设施一定要保持开放和灵活,才能跟上 AI 的发展节奏。
阿里云和 AMD 致力于定义、构建下一代 AI 算力基础设施,双方也在推进更深度的合作,及时适应市场和技术变化,将产品、软件和生态能力更好地对齐到实际业务需求上,更好服务阿里云客户。
目前来看,双方在AI算力基础设施的深度协同共建上,已经出现了很多值得期待的合作方向。
首先是产品路线和客户需求的提前对齐。在 CPU、网络、存储和系统架构等方面,双方计划未来进一步拉通技术路标与时间规划,更早结合阿里云真实业务场景完成产品规划。
第二是软件生态的共建。双方正围绕 AI 软件生态进行深度绑定,推动包括操作系统、驱动、开发框架和工具链的持续优化,进一步降低客户迁移和部署 AI 负载的成本,打造一个更加开放、易用的 AI 开发环境。
第三是在真实云环境中的联合验证和调优。将理论推演与实战场景打通,让新技术不只是停留在实验室性能展示阶段,而是能在客户业务里稳定、高效地跑起来。这也是 Agent 大规模落地,AI 真正嵌入垂直行业、真实场景的关键。
与此同时,阿里云和 AMD 也在“端 - 边 - 云”全栈 AI 解决方案和全球市场的协同拓展上探索更多、更深入的合作。
周俊杰用开放、创新和普惠三个关键词来概括阿里云和 AMD 未来的合作。
开放,是继续推动开放软硬件生态,让客户有更多选择;创新,是一起探索 Agentic AI、大模型推理和行业 AI 解决方案;普惠,则是让更多企业和开发者能够以更低门槛使用先进 AI 能力。
在 Agentic AI 时代到来的关键转折点上,面对 AI 技术的快速迭代与规模化落地中涌现的复杂挑战,阿里云和 AMD 秉持着一致的目标,那就是一起构建更加开放、高效、可持续的下一代云计算和 AI 基础设施,帮助 AI 真正走向规模化应用,为阿里云客户创造更实际的业务价值。