同行致远丨 芯云模协同,定义 Agentic AI 时代算力新底座

简介: Agentic AI 时代到来,算力需求结构全面重塑,芯片厂商与云厂商的合作也随之升级。

image.png

导读:Agentic AI 时代到来,算力需求结构全面重塑,芯片厂商与云厂商的合作也随之升级。

文 / 胡珈萌

当前AI正在经历一个关键转折。随着智能体 (Agent)的规模化落地,Agentic AI 时代已经到来,人们不再满足于“我问你答”的聊天机器人,而是需要“独当一面”的任务执行者。

需求的迭代正深刻重塑底层算力的需求结构,芯片厂商、云计算厂商都在校准坐标,迎接新的挑战。与此同时,双方的关系和合作模式也随之发生改变。

作为两大领域的代表企业,阿里云与 AMD 这对长期深度战略合作伙伴,正进一步加强互动、协作,推动算力供给全面匹配 Agentic AI 时代的新需求。双方的合作也由此进入全新阶段,从提供性能更强的芯片、更高性价比的算力服务,升级为共同定义能够高效运行 Agent 的下一代云计算和 AI 基础设施。

Agentic AI 时代的算力变局

2023 年至 2025 年,AI 的主线是大模型智能水平的跃迁,如何训练出更强的模型,是时代的核心命题。与之对应的,AI 算力竞赛的焦点几乎完全集中在 GPU 上。

2026 年,AI 迎来了“Agent 规模化落地元年”。在算力层面,这大幅推高了推理环节的需求。与此同时, Agent 完成任务时,运行链条也更为复杂,需要自主拆解任务、规划步骤、调用工具、处理数据、多轮推理、校验结果。而 GPU 在其中主要仍负责“调用模型做推理”,更多的编排和调度工作则需要 CPU 处理。

随着 CPU 的角色愈发吃重,其在 AI 基础设施中与 GPU 的配比也在发生变化。AMD 方面指出,数据中心 CPU 与 GPU 的配比正从过去的 1:4、1:8 向 1:1 靠拢。

但 Agentic AI 时代对算力需求结构带来的影响远不止加码 CPU 这么简单。

与传统相对单一的 AI 推理或企业应用负载相比,Agentic AI 的负载特征也更加复杂、碎片化、不可预测。它不仅考验某一个加速器的峰值算力,更会考验整个系统的通用计算能力、并发处理能力、内存访问能力和 I/ O 能力。因此,想要支撑 Agentic AI 的规模化落地,就不能单纯关注 CPU 和 GPU 的数量比例,而是要看整个 AI 系统能否在 CPU、GPU、网络、存储和软件栈之间实现更好的协同,让 Agent 工作流稳定、高效地跑起来。

正是这种根本性转变,让阿里云与 AMD 的合作模式发生质变,早已超越了传统的“采购 - 供应”关系。实际上,双方的合作从第二代 EPYC Rome 时期即已开始芯片定制,到第五代 EPYC Turin 时代,更是演进为从芯片产品定义阶段便深度介入的“共创模式”。

当然,Agentic AI 时代也进一步助推云厂商甚至模型厂商“下场造芯”的浪潮。这主要源于相关厂商需要基于对自身应用场景的业务负载、商业模型和用户需求等特点,通过自研或定制的专用 ASIC,来优化成本、能效或者特定推理场景。

这一定程度上会带来芯片厂商与云厂商的竞争,但 AMD 大中华区销售副总裁周俊杰认为,未来双方会更 近似“既合作、也有局部竞争”的关系。随着AI的发展,还会涌现出更多的合作机会,比如芯片设计服务、平台级联合优化、软件生态共建,以及面向 Agentic AI 的新型基础设施方案等。

他表示,对于 AMD 来说,我们更希望和阿里云等云厂商一起,把通用算力、专用优化和开放软件生态结合起来,共同推动下一代 AI 基础设施落地。

深度协同,全栈共创

时代变革之际,阿里云也在自我迭代。

2026 年 5 月 20 日,阿里云宣布全面迈入 Agentic Cloud 时代,开启了一场“基础设施换底座”式的全栈 革命。

这是一场“从芯到云”的全面重塑,意味着云平台不再只是提供算力资源,而是开始承载大量 Agent 应用的 运行、调度和服务。

对于阿里云和 AMD 的合作来说,这也形成了全新的挑战。阿里云方面,需要更准确地判断未来业务增长和算力需求,才能针对性地给出对芯片的要求;而对 AMD 来说,则要在产品规划、产能准备、交付节奏和生态支持上更早做准备,才能拿出适配的产品。

想要应对这种挑战,双方合作的重点就需要超越单次项目交付,进入深度协同,全栈共创的新阶段。

周俊杰表示,AMD 在合作中会更早参与需求规划,更好理解阿里云未来的业务节奏和算力增长曲线,双方也会一起推动合作方式从短期供货,转向更长期、更稳定的供需协同。在产品路线、产能规划、软件适配、平台验证和部署节奏上更早对齐,以便更好地支撑新一代 AI 应用的规模化落地。

目前,双方合作关系和模式的演进,已经在硬件、软件和生态层面的深度协同中有所展现。

硬件层:深入业务场景,“一芯多用”满足不同需求

在硬件层面,阿里云和 AMD 在多个产品维度都有合作,在合作中,双方会一起探索不同业务负载需要什么样的平台能力,再围绕性能、能效、稳定性和部署效率做硬件的联合优化。

其中最典型的体现当属基于 AMD 第五代 EPYC 处理器 Turin 平台推出的最新一代企业级 ECS 实例。

早在芯片定义阶段,AMD 便与阿里云进行了深度沟通,引入了“场景化设计”思维,最终在 Turin 平台上实现了底层架构的多元化,打造出了能够精准击中不同场景业务痛点的多款实例。

其中,g9a/g9ae 凭借高核心密度的架构,在大数据处理、高并发容器化场景中实现了性能的大幅提升,得以应用在数据库、大数据分析、Web 服务、AI 推理前后处理等高性能和高并发场景,适合对计算能力、稳定性和业务连续性要求比较高的企业级负载,为相关业务运行提供了坚实保障。

例如,某头部社交客户在搜索推荐场景中,借助 g9ae 的物理核设计与混部+开关核策略,实现推荐系统端到端性价比提升;某全球知名电商平台基于 g9ae 运 行大数据 Spark 作业,数据处理整体耗时较上代降低 43%,有效疏通了高算力、高内存带宽与高 I/O 负载下的关键瓶颈。

u2a 实例则是普惠算力的代表,重点是低成本、高性价比和稳定性,适合对成本比较敏感、又希望获得稳定算力的通用场景,为中小企业数字化、开发测试等提供了极具性价比的选择,也尤其契合当前正在兴起的 Agent 编排、工具调用、轻量推理前后处理和云原生服务支撑等 Agentic AI 场景。

性能较上代 u1 基线提升 20%,包月目录价降低 10%,综合性价比最高可提升 50%。

这种“芯云协同”深入业务场景的精细化定制,获得了客户的普遍认可,而在规模化云部署场景中,Turin 平台在性能、能效和总拥有成本(TCO)上的优势也进一步凸显,为客户带来更高的经济效益。

软件层:从“适配验证”到“开源共建”

硬件决定了算力的下限,软件与生态则决定了算力的上限。在 Agentic AI 时代,面对复杂的混合负载,单纯的硬件堆叠已不再适用,软硬件深度融合变得愈发重要。

在 Turin 实例研发中,双方为了让自研的 Alibaba Cloud Linux 3 操作系统与 AMD 平台实现“基因级” 适配,提交了数百个内核补丁,涉及 2 万余行代码的优化,还专门针对多核架构与 I/O 模块进行深度调优,最终实现了性能大幅提升,延迟明显降低,稳定性也显著增强。

此外,AMD 也是阿里云发起并主导的开源操作系统社区龙蜥社区(OpenAnolis)的理事单位,深度参与、贡献,与社区生态伙伴协同使能、优化 AMD 产品和相关软件栈,通过开源共建打破技术边界。通过社区协作,双方也将底层的硬件特性抽象为通用的软件接口,使得上层业务系统得以无缝继承硬件迭代的红利,显著降低客户迁移、部署的适配成本与运维风险。

生态层:打通全链生态,加速 AI 价值落地

在生态层面,阿里云和 AMD 也致力于更加深入地协同、互动,打通硬件平台、操作系统、驱动、开发框架和应用生态,并联合 ISV、模型厂商和开发者社区,帮助客户更快把 AI 能力真正落到业务里。

对于亟需 AI 产生经济价值的客户来说,生态协同最直接的好处,就是可以降低软硬件适配成本,减少迁移风险,缩短从验证到上线的周期,同时在稳定性、性能调优和问题定位上也能获得更完整的支持。

双方也始终锚定更好服务客户的方向,推动开放生态更成熟、更好用、更易用,让阿里云客户能够更方便地使用先进 AI 能力,无需在底层适配和生态兼容上投入过多重复工作。

Agentic Cloud 时代的开启,也意味着阿里云的算力体系将从“以人为中心”进化到“以 Agent 为中心”。

以往的 AI Native Cloud,是“为 AI 打造的云”,强调云本身要为 AI 而设计,能够高效支撑模型训练、推理部署和大规模算力供给。核心评估指标是算力够不够强、资源利用率高不高、训练和推理能不能稳定跑起来。

而在阿里云近期发布的 Agent Native Cloud,则围绕 “AI 原生”的 Agent 设计,进一步强调云平台要能支 撑大量 Agent 持续运行、相互协作,并且和各种工具、数据和业务系统连接起来。这也为 AMD 和阿里云的合作带来了更复杂的挑战。双方也由此展开了更深度的合作,打造完整异构计算平台,实现更强的系统调度能力、资源协同能力,构建更稳定的端到端基础设施,推动 AI Native Cloud 向 Agent Native Cloud 的演进,同时让平台在性能、成本、开放性和可扩展性之间取得更好的平衡。

定义下一代 AI 算力基础设施

AI 变革仍在进行时,Agentic Cloud 和 AI 基础设施也在快速演进。

尤其在上下游持续投入大规模资本支出,技术兑现价值愈发紧迫之际,随着 AI 与真实业务场景的不断碰撞,会涌现出更多新的需求、新的改变。

周俊杰结合 AMD 专家、产业链合作伙伴的观点分析称,AI 领域还有很多变化和未知目前无法完全看清,比如多模态实时交互、多 Agent 协同、长上下文和长期记忆、端边云协同推理,以及 AI 安全和隐私保护等,而这些都会继续影响算力基础设施的演进方向。因此,算力基础设施一定要保持开放和灵活,才能跟上 AI 的发展节奏。

阿里云和 AMD 致力于定义、构建下一代 AI 算力基础设施,双方也在推进更深度的合作,及时适应市场和技术变化,将产品、软件和生态能力更好地对齐到实际业务需求上,更好服务阿里云客户。

目前来看,双方在AI算力基础设施的深度协同共建上,已经出现了很多值得期待的合作方向。

首先是产品路线和客户需求的提前对齐。在 CPU、网络、存储和系统架构等方面,双方计划未来进一步拉通技术路标与时间规划,更早结合阿里云真实业务场景完成产品规划。

第二是软件生态的共建。双方正围绕 AI 软件生态进行深度绑定,推动包括操作系统、驱动、开发框架和工具链的持续优化,进一步降低客户迁移和部署 AI 负载的成本,打造一个更加开放、易用的 AI 开发环境。

第三是在真实云环境中的联合验证和调优。将理论推演与实战场景打通,让新技术不只是停留在实验室性能展示阶段,而是能在客户业务里稳定、高效地跑起来。这也是 Agent 大规模落地,AI 真正嵌入垂直行业、真实场景的关键。

与此同时,阿里云和 AMD 也在“端 - 边 - 云”全栈 AI 解决方案和全球市场的协同拓展上探索更多、更深入的合作。

周俊杰用开放、创新和普惠三个关键词来概括阿里云和 AMD 未来的合作。

开放,是继续推动开放软硬件生态,让客户有更多选择;创新,是一起探索 Agentic AI、大模型推理和行业 AI 解决方案;普惠,则是让更多企业和开发者能够以更低门槛使用先进 AI 能力。

在 Agentic AI 时代到来的关键转折点上,面对 AI 技术的快速迭代与规模化落地中涌现的复杂挑战,阿里云和 AMD 秉持着一致的目标,那就是一起构建更加开放、高效、可持续的下一代云计算和 AI 基础设施,帮助 AI 真正走向规模化应用,为阿里云客户创造更实际的业务价值。

相关文章
|
19天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
8789 25
|
17天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
3356 15
|
17天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
2196 4
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
11天前
|
人工智能 Linux 开发者
【2026国内使用】Codex安装过程一篇讲透(Win/Mac/Linux全支持)
Codex是OpenAI推出的AI编程智能体,可读取本地项目、理解需求并自动修改代码。支持桌面GUI、命令行(CLI)及VS Code/Cursor插件三种形态,覆盖可视化操作、终端高效开发与编辑器无缝集成场景,助开发者用自然语言驱动编码全流程。(239字)
【2026国内使用】Codex安装过程一篇讲透(Win/Mac/Linux全支持)
|
17天前
|
云安全 人工智能 安全
|
3天前
|
人工智能 JSON 自然语言处理
2026 年 Jev 决策模型深度拆解:原理解读、实战测评与保姆级落地教程
有一款特殊AI模型在开发者圈子刷屏,它摒弃传统大模型擅长的对话聊天能力,专注做高速结构化决策,它就是TypeSafe AI推出的Jev模型。该模型由ChatGPT共同发明人Diogo Almeida主导研发,定位为**System One Model(系统一模型)**,对标人类大脑快速直觉判断的思维模式,在响应延迟、调用成本、结构化输出稳定性上相比传统生成式大模型有着巨大差异。本文会完整拆解Jev底层原理、三大核心原语能力、适用业务场景,同时提供可直接运行的curl、Python代码示例,并且结合多组实测数据,客观分析模型优势与能力边界,帮助普通开发者和AI应用从业者快速上手落地。
366 1
|
6天前
|
人工智能 Linux Windows
千问办公(QwenWork)官网入口:其实有2个,一个是网页端千问办公,一个是介绍指南页面
千问办公(QwenWork)是阿里云推出的AI智能办公平台,支持网页端直接使用及Windows/Mac/Linux客户端下载。提供PPT生成、财报分析、网页搭建等AI功能,个人版免费,企业版198元/席/月。详情见官网qwenwork.cn或阿里云产品页。
809 0
千问办公(QwenWork)官网入口:其实有2个,一个是网页端千问办公,一个是介绍指南页面

热门文章

最新文章