平头哥真武 M890 深度适配 Kimi K3,万亿级大模型推理性能大幅提升

简介: 阿里云真武M890超节点实例Day0适配Kimi K3(近3万亿参数),国内首个跑通该规模模型的超节点。依托ICN Switch实现64卡800GB/s全互联、9TB显存,突破算力瓶颈;软硬协同优化使首Token时延降35%,解码吞吐提升1.8倍。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens

最新!阿里云真武M890超节点实例已Day0适配Kimi K3,这是国内首个跑通近3万亿参数模型的超节点。双方将进一步展开国产算力合作,千问AI平台和阿里云百炼也将提供Kimi K3的模型API。本文转自阿里云公众号:

阿里云真武M890AI芯片.png


Kimi K3是目前业界参数规模最大的模型之一,跑通这一规模的模型需要将参数分散到几十张甚至上百张高速互联的GPU卡,让万亿参数“跑得又稳又快”。然而,普通AI集群因通信带宽的局限,无法满足高吞吐、低延迟、高并发的需求。


阿里云百炼AI模型平台:https://www.aliyun.com/product/bailian  体验Kimi K3的模型API,如下图:


阿里云百炼kimi_kimi-k3.jpg


阿里云真武超节点实例通过ICN Switch高速互联芯片,让64张平头哥真武M890实现800GB/s的全互联,其显存规模达到 9TB,可突破万亿参数模型运行的算力、显存和网络带宽的瓶颈,单实例即可支撑大规模万亿级参数MoE模型的专家并行需求。


为提升Kimi K3的运行效率,阿里云、平头哥与Kimi团队从软件栈、算子等层面进行了深度联合适配。例如,真武M890对Kimi K3模型架构的核心算子进行优化,显著提升推理的算力和带宽利用率,可稳定支持最1M长上下文,从容应对长文档理解、复杂推理等场景。测试显示,适配后模型的首Token时延降低约35%,单卡解码吞吐提升1.8倍。


目前,国内外主流模型已进入超2万亿参数规模的时代,阿里云真武超节点不仅跑通Kimi K3,还实现了模型的高效运行,意味着国产算力已具备支撑超大参数模型大规模应用的能力。

相关文章
|
6天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2027 9
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
6天前
|
云安全 人工智能 安全
|
7天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
877 1
|
7天前
|
人工智能 自然语言处理 数据挖掘
最新版通义千问(Qwen3.8-Max-Preview)功能介绍
2026年,通义千问正式推出全新旗舰级大模型 **Qwen3.8-Max-Preview 预览版**,作为首款突破万亿参数规格的新一代基座模型,该模型总参数量达到**2.4万亿**,采用全新迭代的MoE混合专家架构,综合推理性能、长文本处理、多模态理解、复杂任务规划能力全面超越前代Qwen3.7-Max版本,整体实力跻身全球第一梯队,可对标海外顶级旗舰模型,是当前面向复杂工程开发、多智能体协同、超长文档解析、专业办公自动化场景的最优国产基座模型。
884 0
|
8天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
881 37
|
5天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
427 1
|
8天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
652 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南