2026 年 7 月 23 日,蚂蚁集团旗下百灵大模型在开发者平台上线新一代原生混合推理模型 Ling-3.0-Flash,并于 7 月 24 日正式对外发布。该模型总参数量 124B,单 token 激活参数仅 5.1B,官方称其在基础推理、指令遵循、长文本处理等核心指标上对标甚至超越参数规模达其 2-3 倍的行业领先模型。截至 2026 年 7 月 27 日,模型已在 OpenRouter 上线,限时免费一周,免费期截至 2026 年 8 月 3 日 23:00(北京时间),期满后正式开源权重。
此次发布在国产大模型竞争中的意义,不在于"又多了一个模型",而在于蚂蚁把"以小博大"的智效比路线推到了新拐点。 Ling-3.0-Flash 的总参数约为其上一代旗舰 Ring-2.6-1T 的 12.4%,激活参数仅为其 8.1%,却宣称实现全方位能力对标甚至超越。这意味着在高并发、对延迟敏感的 Agent 生产场景中,企业可以用约 1/12 的激活算力获得接近旗舰模型的体验——这对推理成本敏感的行业客户是直接的经济信号。
模型定位:Agent 工作流中的"高速执行节点"
百灵团队在官方文章中明确,Ling-3.0-Flash 不是要取代超大参数规模的通用推理模型,而是完成 AI 工作流中"规划-执行分离"范式里的执行环节。
"我们不求单纯的'大而全',而是专注于在'足够强'的前提下,把'快、省、可落地'做到极致。"
按照官方定义,该模型支持"思考模式"与"非思考模式"两种推理形态,可根据任务复杂度自主判断是否需要深度思考——简单问答直接快速响应,复杂推理任务则切换到多步推导。这种"快慢结合"的策略在理论上接近人类认知的 System 1 / System 2 双过程模型,在实践中则降低了为所有请求储备顶配算力的部署成本。
模型原生支持 256K 上下文窗口,最高可扩展至 1M。
架构升级:原生混合线性注意力 + 1/64 稀疏 MoE
Ling-3.0-Flash 的能力跃迁主要源于底层架构的三处协同改造:
- 原生混合线性注意力:从预训练阶段即采用 5:1 比例交替堆叠 KDA(Kimi Delta Attention)线性注意力层与 MLA 层,使长上下文效率与模型能力深度协同优化。
- KDA 细粒度对角门控:在 Delta Rule 的状态更新中引入细粒度对角门控,让模型在处理长文档、大型代码库时能更精准地记住跨段落关键信息。
- 1/64 稀疏 MoE:每个 token 的专家激活比例由前代的 1/32 进一步压缩至 1/64。百灵团队提出的"Ling Scaling Law"认为,更低的专家激活比例带来更高的"效率杠杆"。
百灵团队在发布文章中表示:"模型获取智能的方式,不追求单纯的规模堆砌,而更关注于对每一寸算力与状态的高效压榨,追求'智能密度'的极致提升。"
在工程侧,模型接入 SGLang HiCache + Mooncake 分级缓存架构,长输入场景下首字响应时间(TTFT)较从头计算降低 60% 至 80% 以上。
多方视角:官方口径与独立验证的差距
公司立场清晰且激进:通过 OpenRouter、Vercel AI Gateway、Nous Portal 等多渠道同步开放免费 API,并在免费期结束后开源权重,意图快速切入全球开发者生态。
市场与第三方反应则更为谨慎。AI 基础设施分析机构 Orcarouter 在 2026 年 7 月 24 日的评测中指出:"截至目前,Artificial Analysis 等第三方评测机构尚未建立 Ling-3.0-Flash 的评测页面,所有性能与速度数据均追溯至蚂蚁集团自身"。该机构特别提示,官方宣称的 1000 tokens/秒峰值吞吐、sub-100ms TTFT 尚缺独立验证;模型权重也未在 Hugging Face 上线,许可证声明(Apache 2.0)有待权重发布时确认。
Orcarouter 分析团队直言:"Treat everything here as a preview, not a verdict."(将其视为预览,而非定论)
竞争对手角度,第三方技术分析指出,KDA 机制本身源自 Moonshot AI 的 Kimi Linear 研究,蚂蚁采用的是该机制而非原创——这在大模型架构快速收敛的 2026 年属于常态,但也意味着"原生混合推理"的架构创新更多体现在集成与工程优化,而非从零发明新机制。
背景脉络:从 Ling-2.6 到 Ling-3.0 的"智效比"演进
蚂蚁百灵大模型系列基于 MoE 架构构建,经历国产异构算力适配、万亿参数突破,逐步迭代至长上下文与 Agent 协同推理阶段。
- 2026 年 5 月 15 日:Ring-2.6-1T 通过 API 正式开放,兼容 OpenAI 与 Anthropic 协议,成为百灵系列的 1T 级旗舰。
- 2026 年 7 月 23 日:Ling-3.0-Flash 在开发者平台上线,定位为"为生产级智能体而生"的高速执行节点。
这条演进路径反映出明确的战略分野:旗舰模型(Ring-2.6-1T)负责深度规划与复杂推理,Ling-3.0-Flash 负责低成本、高并发的执行落地。两者并非替代关系,而是"规划-执行分离"范式下的分工。
影响分析:成本曲线与落地门槛的重塑
对行业的影响(已发生的事实):Ling-3.0-Flash 将"激活参数 5.1B 对标 1T 旗舰"的性价比样本摆上桌面。若其官方宣称的性能在独立评测中得到验证,将倒逼同级别模型重新考量"参数规模=能力"的旧假设。
对市场与客户的影响(预期):金融、司法、科研等对推理准确性与响应速度有双重要求的企业场景,是 Ling-3.0-Flash 的主要目标客户。限时免费 API 至 2026 年 8 月 3 日的策略,意图在开源权重发布前快速积累开发者的真实工作负载反馈。
对普通读者的影响(预期):更低的推理成本最终会传导至下游应用——更快、更便宜的 AI 助手、代码补全、智能客服体验。但这一传导需要时间,且取决于开源权重发布后的生态采纳度。
需要区分的事实与推测:以下为官方口径、暂未独立验证的数据——"对标 2-3 倍参数模型"、"TTFT 降低 60%-80%+"、"MiniAppBench 通过率 25.3%(16 个主流模型平均 17%)"。第三方机构明确指出,截至 2026 年 7 月 24 日,Artificial Analysis 等独立评测尚未覆盖该模型。
接下来看什么
📌 第一个关键节点:2026 年 8 月 3 日 23:00(北京时间)免费 API 期结束,届时模型权重将正式开源——这是验证"开源承诺"与许可证条款(官方宣称 Apache 2.0,待确认)的关键时刻。📌 第二个观察变量:Artificial Analysis 等第三方评测机构对 Ling-3.0-Flash 的独立基准测试何时上线,以及测试结果是否与官方宣称一致。📌 第三个待解问题:KDA + 1/64 稀疏 MoE 的架构路线,能否在开源后被其他团队复现并衍生出更高效的变体——这将决定蚂蚁百灵在国产大模型架构路线上的话语权。
总结
2026 年 7 月 23 日,蚂蚁集团百灵大模型上线新一代原生混合推理模型 Ling-3.0-Flash,7 月 24 日正式发布,模型总参数 124B、单 token 激活仅 5.1B,采用 5:1 交替堆叠 KDA 与 MLA 的原生混合线性注意力架构,官方宣称多项核心指标对标甚至超越参数规模 2-3 倍的行业领先模型。该模型定位为 Agent 工作流中的"高速执行节点",已在 OpenRouter 上线并限时免费至 2026 年 8 月 3 日 23:00(北京时间),之后将开源权重。需要明确的是,截至 2026 年 7 月 27 日,Artificial Analysis 等第三方评测机构尚未建立该模型的独立评测页面,所有性能数据均来自蚂蚁集团官方口径,独立验证仍待完成。此次发布的真正新闻价值在于:它将"以小博大"的智效比路线推到新拐点,若性能声明经独立评测确认,将重塑高并发 Agent 场景的成本曲线。