蚂蚁百灵发布 Ling-3.0-Flash 原生混合推理模型,124B 参数对标 1T 旗舰

简介: 2026年7月,蚂蚁百灵发布Ling-3.0-Flash大模型:总参124B,单token激活仅5.1B,采用原生混合线性注意力与1/64稀疏MoE架构,宣称能力对标2–3倍参数模型。定位“Agent高速执行节点”,支持256K上下文,限时免费至8月3日,随后开源。第三方独立评测尚未落地,性能待验证。(239字)

2026 年 7 月 23 日,蚂蚁集团旗下百灵大模型在开发者平台上线新一代原生混合推理模型 Ling-3.0-Flash,并于 7 月 24 日正式对外发布。该模型总参数量 124B,单 token 激活参数仅 5.1B,官方称其在基础推理、指令遵循、长文本处理等核心指标上对标甚至超越参数规模达其 2-3 倍的行业领先模型。截至 2026 年 7 月 27 日,模型已在 OpenRouter 上线,限时免费一周,免费期截至 2026 年 8 月 3 日 23:00(北京时间),期满后正式开源权重。

此次发布在国产大模型竞争中的意义,不在于"又多了一个模型",而在于蚂蚁把"以小博大"的智效比路线推到了新拐点。 Ling-3.0-Flash 的总参数约为其上一代旗舰 Ring-2.6-1T 的 12.4%,激活参数仅为其 8.1%,却宣称实现全方位能力对标甚至超越。这意味着在高并发、对延迟敏感的 Agent 生产场景中,企业可以用约 1/12 的激活算力获得接近旗舰模型的体验——这对推理成本敏感的行业客户是直接的经济信号。

模型定位:Agent 工作流中的"高速执行节点"

百灵团队在官方文章中明确,Ling-3.0-Flash 不是要取代超大参数规模的通用推理模型,而是完成 AI 工作流中"规划-执行分离"范式里的执行环节。

"我们不求单纯的'大而全',而是专注于在'足够强'的前提下,把'快、省、可落地'做到极致。"

按照官方定义,该模型支持"思考模式"与"非思考模式"两种推理形态,可根据任务复杂度自主判断是否需要深度思考——简单问答直接快速响应,复杂推理任务则切换到多步推导。这种"快慢结合"的策略在理论上接近人类认知的 System 1 / System 2 双过程模型,在实践中则降低了为所有请求储备顶配算力的部署成本。

模型原生支持 256K 上下文窗口,最高可扩展至 1M。

架构升级:原生混合线性注意力 + 1/64 稀疏 MoE

Ling-3.0-Flash 的能力跃迁主要源于底层架构的三处协同改造:

  • 原生混合线性注意力:从预训练阶段即采用 5:1 比例交替堆叠 KDA(Kimi Delta Attention)线性注意力层与 MLA 层,使长上下文效率与模型能力深度协同优化。
  • KDA 细粒度对角门控:在 Delta Rule 的状态更新中引入细粒度对角门控,让模型在处理长文档、大型代码库时能更精准地记住跨段落关键信息。
  • 1/64 稀疏 MoE:每个 token 的专家激活比例由前代的 1/32 进一步压缩至 1/64。百灵团队提出的"Ling Scaling Law"认为,更低的专家激活比例带来更高的"效率杠杆"。
百灵团队在发布文章中表示:"模型获取智能的方式,不追求单纯的规模堆砌,而更关注于对每一寸算力与状态的高效压榨,追求'智能密度'的极致提升。"

在工程侧,模型接入 SGLang HiCache + Mooncake 分级缓存架构,长输入场景下首字响应时间(TTFT)较从头计算降低 60% 至 80% 以上。

多方视角:官方口径与独立验证的差距

公司立场清晰且激进:通过 OpenRouter、Vercel AI Gateway、Nous Portal 等多渠道同步开放免费 API,并在免费期结束后开源权重,意图快速切入全球开发者生态。

市场与第三方反应则更为谨慎。AI 基础设施分析机构 Orcarouter 在 2026 年 7 月 24 日的评测中指出:"截至目前,Artificial Analysis 等第三方评测机构尚未建立 Ling-3.0-Flash 的评测页面,所有性能与速度数据均追溯至蚂蚁集团自身"。该机构特别提示,官方宣称的 1000 tokens/秒峰值吞吐、sub-100ms TTFT 尚缺独立验证;模型权重也未在 Hugging Face 上线,许可证声明(Apache 2.0)有待权重发布时确认。

Orcarouter 分析团队直言:"Treat everything here as a preview, not a verdict."(将其视为预览,而非定论)

竞争对手角度,第三方技术分析指出,KDA 机制本身源自 Moonshot AI 的 Kimi Linear 研究,蚂蚁采用的是该机制而非原创——这在大模型架构快速收敛的 2026 年属于常态,但也意味着"原生混合推理"的架构创新更多体现在集成与工程优化,而非从零发明新机制。

背景脉络:从 Ling-2.6 到 Ling-3.0 的"智效比"演进

蚂蚁百灵大模型系列基于 MoE 架构构建,经历国产异构算力适配、万亿参数突破,逐步迭代至长上下文与 Agent 协同推理阶段。

  • 2026 年 5 月 15 日:Ring-2.6-1T 通过 API 正式开放,兼容 OpenAI 与 Anthropic 协议,成为百灵系列的 1T 级旗舰。
  • 2026 年 7 月 23 日:Ling-3.0-Flash 在开发者平台上线,定位为"为生产级智能体而生"的高速执行节点。

这条演进路径反映出明确的战略分野:旗舰模型(Ring-2.6-1T)负责深度规划与复杂推理,Ling-3.0-Flash 负责低成本、高并发的执行落地。两者并非替代关系,而是"规划-执行分离"范式下的分工。

影响分析:成本曲线与落地门槛的重塑

对行业的影响(已发生的事实):Ling-3.0-Flash 将"激活参数 5.1B 对标 1T 旗舰"的性价比样本摆上桌面。若其官方宣称的性能在独立评测中得到验证,将倒逼同级别模型重新考量"参数规模=能力"的旧假设。

对市场与客户的影响(预期):金融、司法、科研等对推理准确性与响应速度有双重要求的企业场景,是 Ling-3.0-Flash 的主要目标客户。限时免费 API 至 2026 年 8 月 3 日的策略,意图在开源权重发布前快速积累开发者的真实工作负载反馈。

对普通读者的影响(预期):更低的推理成本最终会传导至下游应用——更快、更便宜的 AI 助手、代码补全、智能客服体验。但这一传导需要时间,且取决于开源权重发布后的生态采纳度。

需要区分的事实与推测:以下为官方口径、暂未独立验证的数据——"对标 2-3 倍参数模型"、"TTFT 降低 60%-80%+"、"MiniAppBench 通过率 25.3%(16 个主流模型平均 17%)"。第三方机构明确指出,截至 2026 年 7 月 24 日,Artificial Analysis 等独立评测尚未覆盖该模型。

接下来看什么

📌 第一个关键节点:2026 年 8 月 3 日 23:00(北京时间)免费 API 期结束,届时模型权重将正式开源——这是验证"开源承诺"与许可证条款(官方宣称 Apache 2.0,待确认)的关键时刻。📌 第二个观察变量:Artificial Analysis 等第三方评测机构对 Ling-3.0-Flash 的独立基准测试何时上线,以及测试结果是否与官方宣称一致。📌 第三个待解问题:KDA + 1/64 稀疏 MoE 的架构路线,能否在开源后被其他团队复现并衍生出更高效的变体——这将决定蚂蚁百灵在国产大模型架构路线上的话语权。

总结

2026 年 7 月 23 日,蚂蚁集团百灵大模型上线新一代原生混合推理模型 Ling-3.0-Flash,7 月 24 日正式发布,模型总参数 124B、单 token 激活仅 5.1B,采用 5:1 交替堆叠 KDA 与 MLA 的原生混合线性注意力架构,官方宣称多项核心指标对标甚至超越参数规模 2-3 倍的行业领先模型。该模型定位为 Agent 工作流中的"高速执行节点",已在 OpenRouter 上线并限时免费至 2026 年 8 月 3 日 23:00(北京时间),之后将开源权重。需要明确的是,截至 2026 年 7 月 27 日,Artificial Analysis 等第三方评测机构尚未建立该模型的独立评测页面,所有性能数据均来自蚂蚁集团官方口径,独立验证仍待完成。此次发布的真正新闻价值在于:它将"以小博大"的智效比路线推到新拐点,若性能声明经独立评测确认,将重塑高并发 Agent 场景的成本曲线。

目录
相关文章
|
6天前
|
人工智能 JSON 安全
|
6天前
|
云安全 人工智能 安全
|
6天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
831 1
|
6天前
|
人工智能 自然语言处理 数据挖掘
最新版通义千问(Qwen3.8-Max-Preview)功能介绍
2026年,通义千问正式推出全新旗舰级大模型 **Qwen3.8-Max-Preview 预览版**,作为首款突破万亿参数规格的新一代基座模型,该模型总参数量达到**2.4万亿**,采用全新迭代的MoE混合专家架构,综合推理性能、长文本处理、多模态理解、复杂任务规划能力全面超越前代Qwen3.7-Max版本,整体实力跻身全球第一梯队,可对标海外顶级旗舰模型,是当前面向复杂工程开发、多智能体协同、超长文档解析、专业办公自动化场景的最优国产基座模型。
861 0
|
8天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
829 36
|
4天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
395 1
|
7天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
642 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南