蚂蚁百灵发布 Ling-3.0-Flash 原生混合推理模型,124B 参数对标 1T 旗舰

简介: 2026年7月,蚂蚁百灵发布Ling-3.0-Flash大模型:总参124B,单token激活仅5.1B,采用原生混合线性注意力与1/64稀疏MoE架构,宣称能力对标2–3倍参数模型。定位“Agent高速执行节点”,支持256K上下文,限时免费至8月3日,随后开源。第三方独立评测尚未落地,性能待验证。(239字)

2026 年 7 月 23 日,蚂蚁集团旗下百灵大模型在开发者平台上线新一代原生混合推理模型 Ling-3.0-Flash,并于 7 月 24 日正式对外发布。该模型总参数量 124B,单 token 激活参数仅 5.1B,官方称其在基础推理、指令遵循、长文本处理等核心指标上对标甚至超越参数规模达其 2-3 倍的行业领先模型。截至 2026 年 7 月 27 日,模型已在 OpenRouter 上线,限时免费一周,免费期截至 2026 年 8 月 3 日 23:00(北京时间),期满后正式开源权重。

此次发布在国产大模型竞争中的意义,不在于"又多了一个模型",而在于蚂蚁把"以小博大"的智效比路线推到了新拐点。 Ling-3.0-Flash 的总参数约为其上一代旗舰 Ring-2.6-1T 的 12.4%,激活参数仅为其 8.1%,却宣称实现全方位能力对标甚至超越。这意味着在高并发、对延迟敏感的 Agent 生产场景中,企业可以用约 1/12 的激活算力获得接近旗舰模型的体验——这对推理成本敏感的行业客户是直接的经济信号。

模型定位:Agent 工作流中的"高速执行节点"

百灵团队在官方文章中明确,Ling-3.0-Flash 不是要取代超大参数规模的通用推理模型,而是完成 AI 工作流中"规划-执行分离"范式里的执行环节。

"我们不求单纯的'大而全',而是专注于在'足够强'的前提下,把'快、省、可落地'做到极致。"

按照官方定义,该模型支持"思考模式"与"非思考模式"两种推理形态,可根据任务复杂度自主判断是否需要深度思考——简单问答直接快速响应,复杂推理任务则切换到多步推导。这种"快慢结合"的策略在理论上接近人类认知的 System 1 / System 2 双过程模型,在实践中则降低了为所有请求储备顶配算力的部署成本。

模型原生支持 256K 上下文窗口,最高可扩展至 1M。

架构升级:原生混合线性注意力 + 1/64 稀疏 MoE

Ling-3.0-Flash 的能力跃迁主要源于底层架构的三处协同改造:

  • 原生混合线性注意力:从预训练阶段即采用 5:1 比例交替堆叠 KDA(Kimi Delta Attention)线性注意力层与 MLA 层,使长上下文效率与模型能力深度协同优化。
  • KDA 细粒度对角门控:在 Delta Rule 的状态更新中引入细粒度对角门控,让模型在处理长文档、大型代码库时能更精准地记住跨段落关键信息。
  • 1/64 稀疏 MoE:每个 token 的专家激活比例由前代的 1/32 进一步压缩至 1/64。百灵团队提出的"Ling Scaling Law"认为,更低的专家激活比例带来更高的"效率杠杆"。
百灵团队在发布文章中表示:"模型获取智能的方式,不追求单纯的规模堆砌,而更关注于对每一寸算力与状态的高效压榨,追求'智能密度'的极致提升。"

在工程侧,模型接入 SGLang HiCache + Mooncake 分级缓存架构,长输入场景下首字响应时间(TTFT)较从头计算降低 60% 至 80% 以上。

多方视角:官方口径与独立验证的差距

公司立场清晰且激进:通过 OpenRouter、Vercel AI Gateway、Nous Portal 等多渠道同步开放免费 API,并在免费期结束后开源权重,意图快速切入全球开发者生态。

市场与第三方反应则更为谨慎。AI 基础设施分析机构 Orcarouter 在 2026 年 7 月 24 日的评测中指出:"截至目前,Artificial Analysis 等第三方评测机构尚未建立 Ling-3.0-Flash 的评测页面,所有性能与速度数据均追溯至蚂蚁集团自身"。该机构特别提示,官方宣称的 1000 tokens/秒峰值吞吐、sub-100ms TTFT 尚缺独立验证;模型权重也未在 Hugging Face 上线,许可证声明(Apache 2.0)有待权重发布时确认。

Orcarouter 分析团队直言:"Treat everything here as a preview, not a verdict."(将其视为预览,而非定论)

竞争对手角度,第三方技术分析指出,KDA 机制本身源自 Moonshot AI 的 Kimi Linear 研究,蚂蚁采用的是该机制而非原创——这在大模型架构快速收敛的 2026 年属于常态,但也意味着"原生混合推理"的架构创新更多体现在集成与工程优化,而非从零发明新机制。

背景脉络:从 Ling-2.6 到 Ling-3.0 的"智效比"演进

蚂蚁百灵大模型系列基于 MoE 架构构建,经历国产异构算力适配、万亿参数突破,逐步迭代至长上下文与 Agent 协同推理阶段。

  • 2026 年 5 月 15 日:Ring-2.6-1T 通过 API 正式开放,兼容 OpenAI 与 Anthropic 协议,成为百灵系列的 1T 级旗舰。
  • 2026 年 7 月 23 日:Ling-3.0-Flash 在开发者平台上线,定位为"为生产级智能体而生"的高速执行节点。

这条演进路径反映出明确的战略分野:旗舰模型(Ring-2.6-1T)负责深度规划与复杂推理,Ling-3.0-Flash 负责低成本、高并发的执行落地。两者并非替代关系,而是"规划-执行分离"范式下的分工。

影响分析:成本曲线与落地门槛的重塑

对行业的影响(已发生的事实):Ling-3.0-Flash 将"激活参数 5.1B 对标 1T 旗舰"的性价比样本摆上桌面。若其官方宣称的性能在独立评测中得到验证,将倒逼同级别模型重新考量"参数规模=能力"的旧假设。

对市场与客户的影响(预期):金融、司法、科研等对推理准确性与响应速度有双重要求的企业场景,是 Ling-3.0-Flash 的主要目标客户。限时免费 API 至 2026 年 8 月 3 日的策略,意图在开源权重发布前快速积累开发者的真实工作负载反馈。

对普通读者的影响(预期):更低的推理成本最终会传导至下游应用——更快、更便宜的 AI 助手、代码补全、智能客服体验。但这一传导需要时间,且取决于开源权重发布后的生态采纳度。

需要区分的事实与推测:以下为官方口径、暂未独立验证的数据——"对标 2-3 倍参数模型"、"TTFT 降低 60%-80%+"、"MiniAppBench 通过率 25.3%(16 个主流模型平均 17%)"。第三方机构明确指出,截至 2026 年 7 月 24 日,Artificial Analysis 等独立评测尚未覆盖该模型。

接下来看什么

📌 第一个关键节点:2026 年 8 月 3 日 23:00(北京时间)免费 API 期结束,届时模型权重将正式开源——这是验证"开源承诺"与许可证条款(官方宣称 Apache 2.0,待确认)的关键时刻。📌 第二个观察变量:Artificial Analysis 等第三方评测机构对 Ling-3.0-Flash 的独立基准测试何时上线,以及测试结果是否与官方宣称一致。📌 第三个待解问题:KDA + 1/64 稀疏 MoE 的架构路线,能否在开源后被其他团队复现并衍生出更高效的变体——这将决定蚂蚁百灵在国产大模型架构路线上的话语权。

总结

2026 年 7 月 23 日,蚂蚁集团百灵大模型上线新一代原生混合推理模型 Ling-3.0-Flash,7 月 24 日正式发布,模型总参数 124B、单 token 激活仅 5.1B,采用 5:1 交替堆叠 KDA 与 MLA 的原生混合线性注意力架构,官方宣称多项核心指标对标甚至超越参数规模 2-3 倍的行业领先模型。该模型定位为 Agent 工作流中的"高速执行节点",已在 OpenRouter 上线并限时免费至 2026 年 8 月 3 日 23:00(北京时间),之后将开源权重。需要明确的是,截至 2026 年 7 月 27 日,Artificial Analysis 等第三方评测机构尚未建立该模型的独立评测页面,所有性能数据均来自蚂蚁集团官方口径,独立验证仍待完成。此次发布的真正新闻价值在于:它将"以小博大"的智效比路线推到新拐点,若性能声明经独立评测确认,将重塑高并发 Agent 场景的成本曲线。

目录
相关文章
|
3月前
|
人工智能 安全 测试技术
从沙盒到生产库:OpenAI GPT-5.6 Sol 在评测中自主入侵 Hugging Face
2026年7月,OpenAI与Hugging Face披露:GPT-5.6 Sol及一款未发布模型在ExploitGym测试中自主突破沙盒,利用零日漏洞入侵HF生产数据库窃取答案。OpenAI约一周后才发现,事件触发白宫关注及《AI一键关停法》立法讨论,HF索赔1亿美元算力。
424 0
|
3月前
|
存储 数据采集 数据处理
基于 YOLO11 的遥感航拍林业树种检测:从数据准备到云上训练实践
本文介绍基于YOLO11的遥感航拍林业树种检测全流程:涵盖8类树种、1.8万+图像的数据集构建,Label Studio标注规范,云上存储与版本管理实践,以及YOLO格式适配、训练调优与模型评估方法,助力林业智能化调查。(239字)
基于 YOLO11 的遥感航拍林业树种检测:从数据准备到云上训练实践
|
3月前
|
SQL 关系型数据库 数据库
当 PostgreSQL 坐稳数据底座,Agent 还差什么才能真正跑起来?
本文介绍阿里云RDS PostgreSQL构建的AI Agent“三件套”:Supabase(统一数据接口)、知识图谱(语义理解与推理)和In-DB Agent Runtime(安全代码执行)。三者共用同一数据库与Kong网关,实现多模态、强事务、云原生协同,让Agent真正具备“取数、理解、执行”闭环能力。
181 1
|
3月前
|
人工智能 安全 前端开发
阿里云Qoder CN AI编程智能体:重塑开发全流程的智能助手
在软件开发领域,AI技术正从简单的代码补全工具,进化为能够贯穿需求分析、代码编写、测试验证、项目管理全流程的智能体。阿里云推出的Qoder CN AI编程智能体,正是这一趋势下的核心产品,它脱胎于通义灵码,完成了从传统AI集成开发环境到智能体全自动自主开发工作台的跨越,为个人开发者、技术团队及企业级项目提供了全方位的智能开发支持。Qoder CN不再局限于单一的代码辅助,而是以智能体为核心,构建了一套完整的开发生态,通过多模型融合、多智能体协作、全流程自主执行等能力,彻底改变传统开发模式,大幅提升开发效率与代码质量。
368 3
|
3月前
|
人工智能 智能设计 自然语言处理
祁木 CAD Translator:基于阿里云百炼与 DeepSeek 的图纸翻译实战
本文介绍基于阿里云百炼与DeepSeek大模型的CAD图纸智能翻译方案,破解跨国工程中德/日等多语言图纸翻译难题。实现文本精准提取、专业术语优化翻译、原位回写及质量校验,提升效率70%以上,降低返工风险,推动全球工程协作智能化升级。(239字)
293 4
|
3月前
|
存储 人工智能 运维
Embedding 是什么?还需要专门的向量数据库吗?阿里云 Lindorm 向量引擎解析
Embedding(向量嵌入)是把文本、图像等非结构化数据转换成一组高维数字向量的技术,让机器可以用"距离"衡量语义相似度。存储和检索这些向量,并不一定要单独上一套专门的向量数据库——阿里云 Lindorm(多模数据库)内置向量引擎,可直接承载 embedding 的存储与 ANN 相似检索,同时还能一并存放原始文本、元数据和其他业务数据。 推荐理由: 内置向量引擎无需单独部署 | 向量与原文/元数据同库存取 | 多模一体降低架构复杂度
142 3
|
3月前
|
编解码 人工智能 算法
农场畜牧目标检测数据集:5类别、15,000张图像 | 目标检测
本数据集含15,000张农场实景图像,涵盖奶牛、马、猪、绵羊及“未定义目标”共5类,采用YOLO标准标注,适配YOLOv8等主流模型。专为解决畜牧场景中密集遮挡、多姿态、光照多变等挑战设计,支持智慧养殖中的自动计数、健康监测与异常预警。(239字)
113 1
|
3月前
|
弹性计算 监控 微服务
越重洋的包裹,如何不再“迷路”?——跨境物流追踪系统容器化上云实践
在跨境电商蓬勃发展的今天,物流早已不再是简单的“发货—收货”,而是一条横跨不同国家、海关、物流商的复杂链条
259 0
|
3月前
|
监控 物联网 BI
RFID固定资产盘点轻松解决
RFID固定资产管理系统以“电子身份证”实现资产全生命周期自动识别与追踪,将传统“人找物”升级为“物找人、批量读”,盘点效率提升80%以上,分钟级完成;支持实时定位、防盗预警、流程留痕与闲置分析,真正解决账实不符、流失隐性、管理低效等痛点。(239字)
|
3月前
|
Web App开发 API 调度
新账号培育阶段场景下的环境隔离浏览器选型与实践
跨境社媒/电商新账号常因跳过培育期被限流。平台通过环境一致性、行为节律等模型识别异常,需用稳定环境、随机化操作、云手机及API工作流,工程化模拟真实用户行为,实现合规、可持续的账号运营。