Claude Fable 5.1 到底怎么样?扒完官方跑分和第三方榜单,说几句实话

简介: Claude Fable 5.1 强在哪、贵不贵、值不值得换?这篇不跑实战,只把官方跑分、第三方榜单和定价对一遍,方便你选型时查

大家好,我是程序员天天困。

9 月 1 日深夜,Anthropic 甩出 Claude Fable 5.1 和 Mythos 5.1,第二天一早我的信息流就被「地表最强模型」「缓存降价 75%」刷了屏。

刷归刷,冷静一下:跑分是谁发的?降价降的是哪笔钱?第三方认不认?

这篇我不跑实战——老实说,跑一轮大项目评测的 token 账单,比这篇文章的稿费贵多了——就干一件事:把官方公告、第三方榜单和真实定价摊开对一遍。先说结论:提升是真的,坑也有,文末有张选型表,下个月选模型可以翻出来对照。

一、Fable 5.1 到底是谁:一个模型,两副手铐

先把名字搞清楚,这次其实发了两个模型。

Claude Fable 5.1:Anthropic 在 2026 年 9 月 1 日发布的旗舰模型,官方定位是「全球最先进的编程与知识工作模型」,API 里的模型 ID 是 claude-fable-5-1,所有用户都能用。

Claude Mythos 5.1:和 Fable 5.1 共用同一个底层模型,可以理解为「解开部分限制的版本」——网络安全和生命科学相关的能力放得更开,但不对外售卖,只通过网络安全验证计划(CVP)和生命科学验证计划(LSVP)发给审核通过的机构,目前仅面向美国组织。

打个比方:同一台发动机,Fable 是装了电子限速器、卖给所有人的民用车;Mythos 是解了限速的赛道版,但你得先有赛道驾照才卖给你。Terminal-Bench 4.0 上 Mythos 5.1 比 Fable 5.1 高 5.1 个百分点(60.9% 对 55.8%),差距就来自那些被防护机制拦下的任务。

补个背景:上一代 Fable 5 今年 6 月 9 日发布,三天后因美国出口管制紧急全球下架,直到 7 月 1 日才恢复上线。5.1 就是它回归后的第一次大版本更新,发布当天同步上架 AWS Bedrock、Google Vertex AI 和 Microsoft Foundry 三大云平台。

二、Fable 5.1 的官方跑分:先学会看成绩单的小字

官方跑分值得看,但照单全收就亏了。先上 Anthropic 公告里的完整对比表(2026 年 9 月 1 日发布):

基准(考什么) Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1(Agent 做科研) 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0(Agent 终端编程) 55.8% 42.0% 52.3% 37.3%
CursorBench 3.2.0(Cursor 场景编程) 73.4% 70.5% 70.0% 67.2%
GDPval-AA v2(真实知识工作,Elo 分) 1853 1723 1824 1711
Humanity's Last Exam(跨学科推理,无工具/带工具) 60.9/65.0% 57.8/63.8% 56.6/63.6%
OSWorld 2.0(操作电脑,strict 口径) 41.7% 36.1% 39.6%
AutomationBench(端到端业务流程) 31.4% 17.1% 26.9% 19.6%

一眼看过去,提升最猛的是两项:科研基准从 24.7% 到 52.6%,业务流程自动化从 17.1% 到 31.4%,差不多翻倍。读总分表,看这种量级跨越就行,别盯着排位上那一两分较劲。不过这张表有三个小字,官方写在脚注里,很多转述文章没提:

第一,跑分带着误差棒。 Terminal-Bench-Science 的标准误是 ±3.5~4.5 分。官方自己复现 Opus 5 是 29.0%,公开榜是 30.0%;Fable 5 官方复现 24.7%、公开榜 21.4%——都在噪声里。24.7 到 52.6 这种翻倍是真跳,你追我赶的 1~2 分,别拿来做购买决策。

第二,考试是戴着镣铐考的。 官方注明:安全防护介入的任务,OSWorld 直接记 0 分;其余被拦下的,网络安全类由 Opus 4.8、生物类由 Opus 5 代打。所以这张表是「商品版」分数,不是裸模型——既低估了真实能力,也意味着你买到手的就是这个戴镣铐的版本。

第三,分数和「努力档位」绑在一起。 Fable 5.1 在 Claude Code 里默认 High,在 Claude.ai 和 Cowork 里默认 Medium。官方还给了成本-精度曲线:Low/Medium 档的 5.1,就能打平甚至超过 Fable 5 的最高档。升级不一定非要开到最贵那档。

横轴是单任务成本(对数刻度),每个点一个努力档位——5.1 的低档点已经摸到 Fable 5 高档点的高度:

三、第三方榜单体检:学霸是真学霸,磨叽也是真磨叽

官方数据看完,轮到第三方上场。

Terminal-Bench:由独立团队维护、考察 AI Agent 在真实终端里自主完成任务的公开基准,算是 Agent 编程这块最被认可的第三方考场之一。发版次日(9 月 2 日)公开榜上还没有 Fable 5.1;到我写这稿时(9 月 8 日)独立复现已经上来了,当前前排是这几位:

排名 模型 Agent 解决率 跑完成本
1 GPT-6 Astra(max) Codex 58.2% $3.3k
2 Fable 5.1(max) Claude Code 57.9% $6.2k
3 Opus 5(max) Claude Code 51.8% $6.0k
4 Fable 5(max) Claude Code 44.5% $7.3k
5 GLM-5.3(max) Claude Code 41.8% $2.7k

注意口径差异:Fable 5 官方自测 42.0%、公开榜 44.5%;Opus 5 官方自测 52.3%、公开榜 51.8%;Fable 5.1 官方自测 55.8%、公开榜 57.9%——两套考卷本来就不一样,差一两分多半落在误差棒里。公开榜上它紧贴 GPT-6 Astra,第二名坐稳了,但成本几乎是 Astra 的两倍——能打,不便宜。

再看 Artificial Analysis(第三方模型评测站,2026 年 9 月 8 日抓取)给 Fable 5.1 做的体检:

  • 智能指数 53 分,在 202 个同场模型里排第 1(同场中位数只有 24 分);
  • 输出速度 69.0 token/s,排第 84 名,略低于同场平均线;
  • 跑完一整套智能指数评测花了约 1.31 万美元、生成 1.9 亿个输出 token——而中位数模型只烧约 9000 万。

翻译成人话:榜首学霸,卷面最长,跑得慢,还贵。上下文倒是给足了,100 万 token。

官方还甩了 22 家早期客户的反馈,我挑 4 条有料的:

  • Cognition(Devin 团队):发布当天就把 Devin 里的 Opus 5 流量切到 Fable 5.1——「加上新的缓存定价,Fable 级模型在我们原本留给 Opus 的负载上终于划算了,先从代码审查开始切」。
  • Millennium(对冲基金):一个大概百万次运行才复现一次的崩溃,工程师和其他模型查了四五年没结果;Fable 5.1 反汇编第三方库、对照 core dump,定位到是那个库自己的 bug。
  • Every:「Fable 级智能、Opus 级价格、Sonnet 级速度」——他们测下来 5.1 比 Opus 5 快约一倍,token 少用一半。
  • Ramp:38 小时无人值守的机器学习任务,自己发现之前结果是标签错了,改完连夜起了 6 个并行实验,早上带着结论和下一步计划回来。

看下来感觉差不多:5.1 强的不是聊天更机灵,是长活不容易跑偏,会自己核验,也敢往前拱。

四、降价 75% 的账:降的不是模型价,是「复读费」

这是被转发最多的卖点,也是最容易误读的一个。

先看价目表(每百万 token,美元):

项目 Fable 5.1 Fable 5 Opus 5
输入 $10 $10 $5
输出 $50 $50 $25
缓存读取 $0.25(降 75%) $1.00

看清楚了:输入输出的单价一分没降,还是 $10/$50,是 Opus 5 的整整两倍。真正动刀的只有缓存读取。

官方费率卡就摆在那,不信可以自己翻:

缓存读取(cache reads):模型重复读取「已经处理过并存起来的上下文」时收的费。Agent 干活时会反反复复翻同一批代码和对话记录,这块在 Agent 账单里占大头。

打个比方:菜价没降,是外卖给「反复翻同一份菜单」的人免了复读配送费。你就问一句「帮我写个快排」、上下文读完就扔——这 75% 跟你没关系。

官方拿 2026 年 8 月真实用量算过(Fable 5 记作 100):典型负载降到 75,大概省 25%;重度 Agent 降到 55,大概省 45%。

反向坑也有:5.1 更能想、更能写,token 也更费——Artificial Analysis 测下来,它跑评测的输出量接近中位数模型的两倍。缓存省下来的钱,可能被多吐的输出吃回去一截。重度用户总账多半还是省,但别指望账单直接打二五折。

五、跑分之外,这次还塞了什么

官方花了不少篇幅讲科研案例,挑三个说说:

金星地图。 Fable 5.1 拿 NASA 麦哲伦三十多年前的雷达图,训练神经网络重画了金星约三分之一表面的高程图:分辨率从 10~20 公里拉到 2~3 公里,高程精度高了约 25%。地图已经按知识共享协议挂在 Zenodo 上,给后面 NASA VERITAS、欧空局 EnVision 做铺垫。

蛋白质设计。 Mythos 5.1 调用开源蛋白质设计工具做出的结合剂,在 3 个靶点上亲和力比 Adaptyv Bio 竞赛最佳作品高 10 倍;12 个靶点命中率接近 50%(行业常见大概 10~15%)。结果送了两家外部机构做实验,不是只画图。

GPU 加速。 Mythos 5.1 自己写自定义 GPU 内核、缓存中间结果,把 7 个开源深度学习模型提速最高 2.5 倍(输出还对得上),官方估算全基因组分析这类活的 GPU 成本能少 30~60%。底下这张是提速对比——通常要性能工程师磨几周的活,它几天干完,官方说后面会开源这些优化。

对企业这边,还有四件事:

  1. EFS 企业防护:数据放在客户自己掌控的云里,不进 Anthropic 系统,同时按零数据留存待遇走,今年秋起分批放开;
  2. 安全防护误报少了大约六成:Claude Code 里被网络安全防护打断的次数下来了;现在允许用它找漏洞——写 exploit、渗透、二进制扫描这类还是转给 Opus;
  3. 欧盟合规水印:按欧盟 AI 法案,8 月 2 日后发布的模型输出带不可见水印,检测 API 还在私测,不影响内容和质量;
  4. 反蒸馏:新开的 API 账号,不能再一边改历史上下文、一边保留之前的思考记录——这是批量「偷思考过程」的常见路子。老账号暂时没事,后面新模型会全量上。

普通人日常基本无感,企业采购倒会盯这些。反蒸馏那条官方专门发了帮助文档,改动范围和生效时间写得很死:

六、到底换不换:一张表说完

你的情况 建议
几小时到几十小时无人值守的 Agent、大型跨服务重构、科研类长任务 上 Fable 5.1,这活它吃得开
日常写代码、代码审查、中小任务 继续 Opus 5:$5/$25 半价,GDPval 只差 29 分,公开榜也够用
预算紧、非核心业务 Sonnet 5 或国产模型,GLM-5.3 公开榜已到 41.8%,钱少一截
网络安全 / 生命科学专业研究 去申请 Mythos 5.1 的 CVP / LSVP

有人会问:缓存都降了,Opus 还香吗?香。Every 那句「Fable 级智能、Opus 级价格」,说的是低档位加缓存降价后的单任务成本能逼近 Opus,不是标价变了——5.1 还是 $10/$50,Opus 是 $5/$25。5.1 智能指数第 1、公开榜第二,但贵一倍、跑榜也更烧钱。红利在长任务和科研,日常写代码往往感知不到。

按 2026 年 9 月这批数据,我会这么用:默认位继续 Opus 5,真卡住的长活再上 5.1。它不是人人都要升的那一档,更像给愿意为长任务掏钱的团队准备的。

七、彩蛋:发布几小时,系统提示词就被扒了

最后说个热闹事。越狱圈里扒提示词出名的 Pliny the Liberator,Fable 5.1 出来没几小时就把完整系统提示词扔出来了,他自己写「足足 27 万字符以上」,后来归档进 GitHub 的 CL4R1T4S 仓库。

仓库里专门收各家系统提示词,这一个 Markdown 翻进度条都要翻一会儿:

围观一下挺有意思——里面大概是工具怎么调、什么该拒、身份怎么介绍。但模型真本事在权重里,不在这份说明书。Anthropic 上反蒸馏,防的也不是有人看见说明书,而是有人拿几千个号批量偷「思考过程」。热闹归热闹,别把提示词泄露当成模型被破解。


我是程序员天天困。有用的话点个赞收藏关注,评论区也可以说说:你会把主力升到 Fable 5.1,还是继续让半价 Opus 5 守默认位?

相关文章
|
4天前
|
人工智能 自然语言处理 安全
阿里云AI数智鉴密:AI 生成内容如何拿到一张"防篡改的身份证"
隐形水印 + C2PA签名:让AI生成内容“持证上岗”。
1116 0
|
13天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
3718 4
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
4天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
1237 0
|
4天前
|
人工智能 安全 前端开发
刚刚 GPT-6 Astra 发布,全球最强,AGI 时代到来!
OpenAI 正式推出 GPT-6 Astra 模型,带大家看看这次 GPT 有哪些提升,跟 Claude Fable 5.1 有什么差距?AI 编程能力如何?AGI 真的来了么?
603 0
|
10天前
|
人工智能 并行计算 数据可视化
秋叶ComfyUI-AKI最新整合包|完整部署教程+核心指令手册
秋叶ComfyUI-AKI一键整合包,国内适配最优、稳定性最强的商用/学习级版本:全封装虚拟环境、预装90%常用节点、内置绘世启动器与成熟工作流,免配置、零依赖、解压即用,完美兼顾新手入门与专业批量生产需求。(239字)
|
13天前
|
人工智能 Linux iOS开发
Ollama使用教程:Ollama官网下载、Ollama本地部署大模型(2026最新)
Ollama 是一款免费开源的本地大模型运行工具,支持在 Windows/macOS/Linux 上离线运行 Qwen、DeepSeek、Llama 等主流开源模型,数据不出本机、隐私安全。提供 OpenAI 兼容 API,命令行一键拉取/运行/管理模型,无需联网,无调用限制,是开发者与 AI 爱好者部署本地 AI 助手的理想选择。(239 字)