大家好,我是晚安code。s
这周 AI 圈的新闻多到刷不完,可最该花时间看的一条,是 Anthropic 在 9 月 1 日端出来的 Claude Fable 5.1。名字跟上次的 Fable 5 只差一个小版本,结果我翻完官方博客差点没坐住——科研方向的终端基准直接从 24.7% 干到 52.6%,翻了一倍还多。这篇文章把它拆开讲:升级到底升在哪、价格怎么算,以及谁值得掏这个钱。
一、先说发布:Fable 5.1 到底是个什么模型
开门见山:Anthropic 这次同时发了两个名字,Claude Fable 5.1 和 Claude Mythos 5.1,其实是同一个底层模型,区别只在安全权限的开放程度。
- Fable 5.1:面向普通用户和企业全面开放,已经上了 claude.ai、Claude Code 和 API,模型名
claude-fable-5-1; - Mythos 5.1:走「专业版」路线,只向通过审核的网络安全与生命科学机构开放。
官方给这对模型的定位是「全球最先进的编程与知识工作模型」。科研智能体是这轮更新里进步最猛的一块,但它不是科研专用模型——只是这一代把"在终端里自己干活"这件事做扎实了。

二、科研 Agent 跑分翻倍,是这代最硬的一张牌
先说结论:如果你只关心日常写代码,Fable 5.1 是稳步变强;如果你关心"AI 能不能自己把科研/工程长活干完",这一代是质变。
最能说明问题的数字在 Terminal-Bench-Science 上。Terminal-Bench-Science(科研终端基准):衡量 AI 在终端环境里自主完成科研任务的基准,比如读数据、跑实验、验结果。你可以理解成"让模型在命令行里当研究生干活"。
| 基准 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0(agentic 编程) | 55.8% | 42.0% | 52.3% | 37.3% |
| AutomationBench(企业工作流) | 31.4% | 17.1% | 26.9% | 19.6% |
| GDPval-AA v2(知识工作分) | 1853 | 1723 | 1824 | 1711 |
注意 AutomationBench 那条:从 17.1% 涨到 31.4%,接近翻倍。这基准测的是企业里那种要改系统、要调 API、要按规则反复确认的多步工作流,比单轮问答难太多。官方也提醒,OSWorld 2.0 之类用的是 2026 年 8 月新版任务,别拿它跟更早的数字硬比。

三、一个跑了 38 小时的例子,让我看懂 Agent 变在哪
跑分看多了会麻,真让我愣住的其实是这个:有报道称,Fable 5.1 在真实项目里连续自主运行了 38 个小时处理一个机器学习任务——中途发现自己用的实验数据有标签污染,它自己换了方案、重新处理数据,还并行起了 6 组实验去交叉验证。
说实话我没法替官方背书这个案例的每个细节,但方向是对的:长程 Agent 的分水岭从来不是"能不能答对",而是"跑几小时后能不能发现自己错了、还肯不肯重来"。我平时自己调 agent 脚本,跑一晚上就断、一报错就停在原地的是常态,所以这一条我盯着看。
另一个更"硬"的证据在 Mythos 5.1 的蛋白质设计上:官方说它生成的结合蛋白方案经过外部实验验证,12 个靶点命中率接近 50%——行业里这个数通常是 10% 到 15%。这说明它能跑的已经不光是纸面任务了。


四、价格没涨,但缓存价从 1 美元砍到 0.25 美元
到算账环节。基础单价跟 Fable 5 持平,真正的降价藏在缓存读取里,而缓存恰恰是 Agent 工作负载的成本大头。
| 计费项 | Fable 5.1 | 对比上代 Fable 5 |
|---|---|---|
| 输入 | 10 美元/百万 token | 持平 |
| 输出 | 50 美元/百万 token | 持平 |
| 缓存读取(Cache Read) | 0.25 美元/百万 token | 降 75% |
| 典型工作负载总成本 | — | 约降 25% |
| 高度 agentic 工作负载 | — | 最高降 45% |
这个定价思路很直白:它对"用得多、重复读上下文"的长活更友好。你让 Agent 反复读同一份代码库、同一批文档,缓存命中率高,账就划算。我这种偶尔跑个单轮问答的,基本感觉不到差别——所以别只看降 45% 的宣传词就冲。
五、反蒸馏机制上线:把思考过程"上锁"了
这次除了能力,Anthropic 还动了安全架构。新账户的思考块(thinking blocks)会和产生它的对话上下文绑定,不能再靠改历史消息诱导模型泄露推理过程——官方说这是为了挡住大规模模型蒸馏。
配套的还有 EFS 企业前沿防护:允许企业客户把数据存在自己的云基础设施里,同时仍接受 Anthropic 的安全审查,2026 年秋季起分阶段推出。对企业来说,这条可能比跑分更值得关注:零数据保留和滥用检测,终于不用二选一了。
六、我的看法:谁该升,谁可以再等等
说句我的判断:重度跑长程 Agent、做科研或知识工作的人,这次升级的账基本不用算;只是偶尔写写代码、跑短问答的,等一等也完全不影响。它强在"持续自主干活"这件事上,短任务的优势没那么明显,别被"8 项屠榜"带节奏。
可能有人会问:Fable 5.1 和 Opus 5 到底怎么选?
看任务时长。长链条、要工具调用、要反复验证的活(agent 编程、科研流水线、企业自动化)选 Fable 5.1,AutomationBench 那条差距是实打实的;单轮问答、快速改稿这类短任务,Opus 5 通常更够用也更省心,价格还一样。
我是晚安code,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:你会把 Fable 5.1 用在哪类长任务上,还是觉得短问答够用就不升了?