Claude Opus 5 全新发布,7 大项目实测,夯还是拉?半价吊打 Fable 5?

简介: Claude Opus 5 模型全新发布,只用一半的价格,追平 Claude Fable 5 旗舰模型?我用 7 个实战项目测评 AI 编程能力,前端、后端和全栈开发能力如何?看到最后的例子我惊呆了

大家好,我是程序员鱼皮。

前几天 Anthropic 发布了 Claude Opus 5,我第一时间写了一篇小短文,说 Claude Opus 5 宣称只用一半的价格,能力追平 Claude Fable 5 旗舰模型。

这个模型的跑分还是很能打的,比如 Frontier-Bench 这个测试,考察模型能不能在命令行里独立做完一整套编程任务。

Opus 5 拿了 43.3%,上一代 Opus 4.8 只有 18.7%,顶配的 Fable 5 是 33.7%,而 OpenAI 的 GPT-5.6 Sol 是 37.5%,可以说是遥遥领先了。

但是不能完全相信跑分,模型好不好用,还得拿真实项目来检验。

之前我写过一篇 Kimi K3 模型测评文章,为了便于跟 Kimi K3 等模型对比,接下来我会用跟之前一模一样的提示词,通过 7 个不同类型的项目 来测试 Opus 5 的实际编程能力。

测试方法很简单,我在 Cursor 里同时开了多个子 Agent,每个 Agent 一个独立的项目目录、一个独立的端口,全程不需要人工干预。等过段时间我回来一个一个验收就好。

激动的心,颤抖的手,点个收藏,咱们开始~

项目实战测评

这次我准备了 7 个项目 来测试 Opus 5 的编程能力,从简单的前端动画、到复杂的全栈产品、甚至是企业级工程项目,由浅入深。

  1. 交互式动画讲解网站
  2. 3D 版动画知识讲解
  3. 文案拆解为网页 PPT
  4. 网页 PPT 生成工具(内置 AI 大模型)
  5. 足球对战网页游戏(横评对比)
  6. 以撒的结合肉鸽游戏
  7. 全栈 AI 编程工具(复刻 Cursor)

大家可以猜猜看,跑完这些任务要花多少钱呢?

答案在结尾揭晓~

1、交互式动画讲解网站

第一个项目,让模型做一个用交互式动画讲解知识的网站,讲的知识点是「注意力残差」。

提示词里我要求它先用 Firecrawl 联网搜索技术细节,做完之后自己打开截图验证效果,不满意就自主调整,改到满意再交付。

来看成品,界面科技感满满,背景还有漂浮的光点特效。

而且整个网站很清晰、很结构化,用户可以像阅读教程一样连贯地学会这个知识,也可以通过左侧的章节导航快速跳转、查漏补缺。

第一部分它用「一张越写越花的便利贴」来引出问题,这个比喻很生动。你可以拖动滑块来增加堆叠的层数,能亲眼看到第 1 句话在最终画面里的份量越来越少,最后基本读不清了。

不过页面上存在一些瑕疵,比如出现了文字被遮挡的情况,这点比 Kimi K3 的前端效果差了一些。

不过大多数的动画效果和元素位置都是准确的,个人感觉比 Opus 4.8 做动画网站的体验好太多了!

甚至给出了几道题目来检测学习效果,选错了还会告诉你为什么错,真是太贴心了,可以给到顶级。

2、3D 版动画知识讲解

还是同一个知识点,这次换成 3D 场景来呈现。

提示词里除了联网搜索,我还要求它用 Context7 查一下所用 3D 库的最新文档,别拿过时的 API 来写。

来看成品,我刚打开页面就被惊艳到了,我 chovy!

科技感爆棚,而且动画非常流畅生动。

可以自由切换视角、放大缩小,还能并排对比多种不同的残差模式。

从事教育行业的工作者有福了,可以让 AI 把枯燥的知识点通过动画栩栩如生地展示清楚,让学生更快理解。

单从前端的角度,我真的挑不出缺点,给到夯!

3、文案拆解为网页 PPT

我做视频教程的时候,偶尔需要把文章内容做成演示画面,但手动做 PPT 太慢了。

这次我干脆把一篇技术文章丢给它,让它按照文章的讲解顺序,拆成一个能全屏演示的网页 PPT,后续可以当做视频录制的画面素材。

先看封面,完犊子了,这大标题…… 现在怎么 Claude 也一股子 GPT 味儿了。。。

整个 PPT 的效果跟其他模型差不多,毕竟我没给 AI 提供图片等素材,无非就那么几种布局。

整个 PPT 的科技感还是很足的,我觉得对于很多场合下的 PPT 讲演都是够用的。比如做毕业设计的同学,直接把自己的项目甩给 AI,毕设答辩 PPT 就搞定了,真爽死了……

从整体前端风格来看,给到顶级。

4、网页 PPT 生成工具(内置 AI)

前面 3 个都是开胃小菜,接下来该测测它的全栈工程能力了。

上一个案例是给定一篇文章生成 PPT,那能不能把这个能力做成一个通用工具呢?

用户粘贴任意文案,后端调用大模型拆解内容,前端渲染成可演示的网页 PPT,还要支持切换配色主题和导出成独立的 HTML 文件。

明确需求后,提示词就很简单了,由于涉及到 AI 能力,这里我用新出的 Kimi K3 模型作为给后端调用的模型(注意,项目本身的代码还是 Opus 5 生成的)。

来看看成品,之前用 Kimi K3 生成 PPT 工具的时候,成品非常精简,主页基本上就只有文案输入框和按钮。

但 Claude Opus 5 做的更像一个成熟的工具产品,你看左下角那一排配色主题就知道了,极光、象牙、暮色、青薄,这名字起的还挺文艺。而且每个主题下面还配了一句定位说明,细节做得非常好。

而且还可以填写生成 PPT 的额外要求。注意,我并没有在提示词中讲到这点,AI 自己帮忙锦上添花了。

随便拿我之前的一篇文章来制作 PPT,可以实时看到生成进度,直接查看效果,质量很高。

说真的,现在这种全栈项目一把梭对于 AI 已经完全没有难度了。

来切换个主题试试,效果不错吧,还能直接全屏演示或者导出为 HTML:

整体来说,无论是前端细节、还是后端生成逻辑做的都很好,一段提示词直接梭哈一个商业产品出来了,给到夯。

5、足球对战网页游戏

经常看我文章的朋友应该知道,这个项目是老熟人了。

之前 GPT-5.6 发布的时候,我写过一篇 《顶级国外模型横评对比》,用同一段提示词让 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 三个模型同时开发了一个叫「2066 决战世界杯」的足球游戏。这次的提示词跟那时候完全一致,正好拿来做个对比。

先看赛前设置界面,做得还不错。浅绿主题色跟足球场是匹配的,相得益彰。

踢球、换人功能都是正常的,非常流畅。

而且注意到细节了没?9 号球员下方有个红色的蓄力槽,给了玩家更多的操作空间。

游戏的人机也非常智能,不像其他模型开发出来的人机只会防守,这次的人机甚至还能踢出配合。而且作为玩家,也不是完全没有机会赢过人机,游戏体验非常好。

对比一下之前几个模型的表现。GPT-5.6 Sol 开发的那版,人机不会主动进攻,我打满一整场中等难度,只能以 0 比 0 收场。

Grok 4.5 模型开发的那版,球场渲染有硬伤,换人逻辑也很不顺畅,经常切换到离球最远的那个队友身上。

Claude Fable 5 开发的那版,球的物理引擎翻车了,球经常会瞬移,根本没法正常玩耍。

而 Opus 5 不仅在人机智能上突破了,左侧还会实时展示赛况,这也是之前的模型都没有做到的。

美中不足的是,足球场的白线是不是有点儿问题?禁区前面那道罚球弧两端拐进了禁区里面。综合来看给到顶级。

6、以撒的结合肉鸽游戏

接下来是一个更有挑战性的游戏项目。

以撒的结合是我小孩儿时代很爱玩的一款肉鸽游戏,包括随机地牢生成、射击战斗、道具系统、多种敌人和 Boss。

之前我让 Kimi K3 开发了这个游戏,提示词中要求先用 Firecrawl 搜索以撒的结合的游戏机制和美术风格资料,用 Context7 查询所用游戏框架的文档:

当时 K3 开发出的效果是这样的,虽然界面看起来简陋,但基本玩法是完全跑通的,可以发射子弹打击怪物:

再来看看这次 Opus 5 用同样的提示词开发出的成品,前方高能!

打开网页,光是看到这个游戏主页,我的 DNA 就动了!有没有玩过这个游戏的同学,这个形象跟原版还是很接近的吧?

原版游戏形象

之前我用 Kimi K3 做这个游戏的时候,整个游戏的玩法链路已经跑通了,我当时都已经觉得很满足了。。。

结果没想到 Claude Opus 5 的效果这么好!很多小怪都是原版游戏中存在的。

而且角色的数值清晰、道具丰富多样,可以说是还原了《以撒的结合》游戏的精髓。

我甚至都玩进去了,导致这篇文章发布时间晚了 20 分钟。。。

BOSS 的机制也跟原版《以撒的结合》游戏中的 BOSS 神似!

大家觉得怎么样?

说真的,完全超出我的预期了,给到夯爆了!以后我也有戏做一些游戏了,skr~

7、全栈 AI 编程工具

最后一个项目,直接把难度拉满!

我让 AI 基于 VS Code 的开源代码,开发一个类似 Cursor 的 Web AI 编程工具,要支持 Editor Window 代码编辑器和 Agents Window 对话工作台两种模式,两个窗口之间可以自由切换。

看看成品,几乎完整地保留了 VSCode 的精髓,比如代码高亮、代码小地图、管理面板、代码搜索等等。

来让 AI 执行个任务试试,你能清晰地看到 AI 的思考信息、工具调用等等。

AI 甚至能够调用终端、自主测试开发出的代码,还能清晰地看到本次改动的文件!

怎么样,你敢相信我只跟 AI 对话一次,就开发出了自己的 Cursor 么?简历上又多了蓬荜生辉的一笔。

我的评价是夯爆了!

我的感受

7 个项目全部跑完了,让我印象最深刻的一点是,Claude 没有完全机械地、用最简单直接不绕弯子的方式完成任务,你让它做什么它就只做什么,而是会在你提示词需求的基础上加一点自己的想法,尽量达到理想的效果。

它不仅后端逻辑强、前端视觉效果也强,还非常注重细节,真的是六边形战士了。

至少对我来说,我暂时想不到什么开发任务 AI 完不成了。

如果有,那就是我没有驾驭好 AI,或者 tokens 不够。

另外一个让我印象深刻的点是,Opus 5 确实像官方说的那样,特别爱自己检查作业。Anthropic 甚至专门提醒开发者把提示词里那句「最后记得验证一遍」删掉,你越叮嘱它反而越容易检查上瘾。他们后来干脆把 Claude Code 的系统提示词删掉了 80% 以上,编程跑分一点没掉。

以后用这种级别的模型,该给你的提示词做做减法了,把精力花在明确需求和目标上就好,不用事无巨细地规定每一步该怎么做。

当然,这个特性是一把双刃剑,Opus 5 很容易把简单的任务搞复杂,这是 Claude 一贯的通病,也就更废 tokens。

如果你想更好地利用 Opus 5 这种级别的模型,还是要在提示词上多下下功夫,不是说要写的又臭又长,而是把需求描述清楚、限制好 AI 的边界,否则它搞不好就浪飞边子了。

最后,揭晓谜底,这 7 个任务打包加起来,一共花了我 900 多块。

这就是效果好相应的代价,之前我用 Kimi K3 等国产模型做同样的项目,加起来套餐额度才动了百分之几。

所以还是要根据你的实际需求来选择模型。

  • 如果是追求 90 分效果的任务,可以交给 Opus 5
  • 只需要 80 分的任务,可以交给 GPT 或者 Kimi K3 / GLM 5 这类模型,快、稳、便宜
  • 如果任务只要及格就好,那就用性价比极高的 DeepSeek 吧

OK 就分享到这里,本文会收录到我免费开源的 《AI 编程零基础入门教程》,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。

开源指路:https://github.com/liyupi/ai-guide

鱼皮的 AI 编程教程

我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

也欢迎在评论区聊聊:你觉得这钱花得值么?你现在主力用的是哪个模型?

相关文章
|
6天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2027 9
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
6天前
|
云安全 人工智能 安全
|
7天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
877 1
|
7天前
|
人工智能 自然语言处理 数据挖掘
最新版通义千问(Qwen3.8-Max-Preview)功能介绍
2026年,通义千问正式推出全新旗舰级大模型 **Qwen3.8-Max-Preview 预览版**,作为首款突破万亿参数规格的新一代基座模型,该模型总参数量达到**2.4万亿**,采用全新迭代的MoE混合专家架构,综合推理性能、长文本处理、多模态理解、复杂任务规划能力全面超越前代Qwen3.7-Max版本,整体实力跻身全球第一梯队,可对标海外顶级旗舰模型,是当前面向复杂工程开发、多智能体协同、超长文档解析、专业办公自动化场景的最优国产基座模型。
884 0
|
8天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
881 37
|
5天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
427 1
|
8天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
652 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南