Claude Opus 5 全新发布,7 大项目实测,夯还是拉?半价吊打 Fable 5?

简介: Claude Opus 5 模型全新发布,只用一半的价格,追平 Claude Fable 5 旗舰模型?我用 7 个实战项目测评 AI 编程能力,前端、后端和全栈开发能力如何?看到最后的例子我惊呆了

大家好,我是程序员鱼皮。

前几天 Anthropic 发布了 Claude Opus 5,我第一时间写了一篇小短文,说 Claude Opus 5 宣称只用一半的价格,能力追平 Claude Fable 5 旗舰模型。

这个模型的跑分还是很能打的,比如 Frontier-Bench 这个测试,考察模型能不能在命令行里独立做完一整套编程任务。

Opus 5 拿了 43.3%,上一代 Opus 4.8 只有 18.7%,顶配的 Fable 5 是 33.7%,而 OpenAI 的 GPT-5.6 Sol 是 37.5%,可以说是遥遥领先了。

但是不能完全相信跑分,模型好不好用,还得拿真实项目来检验。

之前我写过一篇 Kimi K3 模型测评文章,为了便于跟 Kimi K3 等模型对比,接下来我会用跟之前一模一样的提示词,通过 7 个不同类型的项目 来测试 Opus 5 的实际编程能力。

测试方法很简单,我在 Cursor 里同时开了多个子 Agent,每个 Agent 一个独立的项目目录、一个独立的端口,全程不需要人工干预。等过段时间我回来一个一个验收就好。

激动的心,颤抖的手,点个收藏,咱们开始~

项目实战测评

这次我准备了 7 个项目 来测试 Opus 5 的编程能力,从简单的前端动画、到复杂的全栈产品、甚至是企业级工程项目,由浅入深。

  1. 交互式动画讲解网站
  2. 3D 版动画知识讲解
  3. 文案拆解为网页 PPT
  4. 网页 PPT 生成工具(内置 AI 大模型)
  5. 足球对战网页游戏(横评对比)
  6. 以撒的结合肉鸽游戏
  7. 全栈 AI 编程工具(复刻 Cursor)

大家可以猜猜看,跑完这些任务要花多少钱呢?

答案在结尾揭晓~

1、交互式动画讲解网站

第一个项目,让模型做一个用交互式动画讲解知识的网站,讲的知识点是「注意力残差」。

提示词里我要求它先用 Firecrawl 联网搜索技术细节,做完之后自己打开截图验证效果,不满意就自主调整,改到满意再交付。

来看成品,界面科技感满满,背景还有漂浮的光点特效。

而且整个网站很清晰、很结构化,用户可以像阅读教程一样连贯地学会这个知识,也可以通过左侧的章节导航快速跳转、查漏补缺。

第一部分它用「一张越写越花的便利贴」来引出问题,这个比喻很生动。你可以拖动滑块来增加堆叠的层数,能亲眼看到第 1 句话在最终画面里的份量越来越少,最后基本读不清了。

不过页面上存在一些瑕疵,比如出现了文字被遮挡的情况,这点比 Kimi K3 的前端效果差了一些。

不过大多数的动画效果和元素位置都是准确的,个人感觉比 Opus 4.8 做动画网站的体验好太多了!

甚至给出了几道题目来检测学习效果,选错了还会告诉你为什么错,真是太贴心了,可以给到顶级。

2、3D 版动画知识讲解

还是同一个知识点,这次换成 3D 场景来呈现。

提示词里除了联网搜索,我还要求它用 Context7 查一下所用 3D 库的最新文档,别拿过时的 API 来写。

来看成品,我刚打开页面就被惊艳到了,我 chovy!

科技感爆棚,而且动画非常流畅生动。

可以自由切换视角、放大缩小,还能并排对比多种不同的残差模式。

从事教育行业的工作者有福了,可以让 AI 把枯燥的知识点通过动画栩栩如生地展示清楚,让学生更快理解。

单从前端的角度,我真的挑不出缺点,给到夯!

3、文案拆解为网页 PPT

我做视频教程的时候,偶尔需要把文章内容做成演示画面,但手动做 PPT 太慢了。

这次我干脆把一篇技术文章丢给它,让它按照文章的讲解顺序,拆成一个能全屏演示的网页 PPT,后续可以当做视频录制的画面素材。

先看封面,完犊子了,这大标题…… 现在怎么 Claude 也一股子 GPT 味儿了。。。

整个 PPT 的效果跟其他模型差不多,毕竟我没给 AI 提供图片等素材,无非就那么几种布局。

整个 PPT 的科技感还是很足的,我觉得对于很多场合下的 PPT 讲演都是够用的。比如做毕业设计的同学,直接把自己的项目甩给 AI,毕设答辩 PPT 就搞定了,真爽死了……

从整体前端风格来看,给到顶级。

4、网页 PPT 生成工具(内置 AI)

前面 3 个都是开胃小菜,接下来该测测它的全栈工程能力了。

上一个案例是给定一篇文章生成 PPT,那能不能把这个能力做成一个通用工具呢?

用户粘贴任意文案,后端调用大模型拆解内容,前端渲染成可演示的网页 PPT,还要支持切换配色主题和导出成独立的 HTML 文件。

明确需求后,提示词就很简单了,由于涉及到 AI 能力,这里我用新出的 Kimi K3 模型作为给后端调用的模型(注意,项目本身的代码还是 Opus 5 生成的)。

来看看成品,之前用 Kimi K3 生成 PPT 工具的时候,成品非常精简,主页基本上就只有文案输入框和按钮。

但 Claude Opus 5 做的更像一个成熟的工具产品,你看左下角那一排配色主题就知道了,极光、象牙、暮色、青薄,这名字起的还挺文艺。而且每个主题下面还配了一句定位说明,细节做得非常好。

而且还可以填写生成 PPT 的额外要求。注意,我并没有在提示词中讲到这点,AI 自己帮忙锦上添花了。

随便拿我之前的一篇文章来制作 PPT,可以实时看到生成进度,直接查看效果,质量很高。

说真的,现在这种全栈项目一把梭对于 AI 已经完全没有难度了。

来切换个主题试试,效果不错吧,还能直接全屏演示或者导出为 HTML:

整体来说,无论是前端细节、还是后端生成逻辑做的都很好,一段提示词直接梭哈一个商业产品出来了,给到夯。

5、足球对战网页游戏

经常看我文章的朋友应该知道,这个项目是老熟人了。

之前 GPT-5.6 发布的时候,我写过一篇 《顶级国外模型横评对比》,用同一段提示词让 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 三个模型同时开发了一个叫「2066 决战世界杯」的足球游戏。这次的提示词跟那时候完全一致,正好拿来做个对比。

先看赛前设置界面,做得还不错。浅绿主题色跟足球场是匹配的,相得益彰。

踢球、换人功能都是正常的,非常流畅。

而且注意到细节了没?9 号球员下方有个红色的蓄力槽,给了玩家更多的操作空间。

游戏的人机也非常智能,不像其他模型开发出来的人机只会防守,这次的人机甚至还能踢出配合。而且作为玩家,也不是完全没有机会赢过人机,游戏体验非常好。

对比一下之前几个模型的表现。GPT-5.6 Sol 开发的那版,人机不会主动进攻,我打满一整场中等难度,只能以 0 比 0 收场。

Grok 4.5 模型开发的那版,球场渲染有硬伤,换人逻辑也很不顺畅,经常切换到离球最远的那个队友身上。

Claude Fable 5 开发的那版,球的物理引擎翻车了,球经常会瞬移,根本没法正常玩耍。

而 Opus 5 不仅在人机智能上突破了,左侧还会实时展示赛况,这也是之前的模型都没有做到的。

美中不足的是,足球场的白线是不是有点儿问题?禁区前面那道罚球弧两端拐进了禁区里面。综合来看给到顶级。

6、以撒的结合肉鸽游戏

接下来是一个更有挑战性的游戏项目。

以撒的结合是我小孩儿时代很爱玩的一款肉鸽游戏,包括随机地牢生成、射击战斗、道具系统、多种敌人和 Boss。

之前我让 Kimi K3 开发了这个游戏,提示词中要求先用 Firecrawl 搜索以撒的结合的游戏机制和美术风格资料,用 Context7 查询所用游戏框架的文档:

当时 K3 开发出的效果是这样的,虽然界面看起来简陋,但基本玩法是完全跑通的,可以发射子弹打击怪物:

再来看看这次 Opus 5 用同样的提示词开发出的成品,前方高能!

打开网页,光是看到这个游戏主页,我的 DNA 就动了!有没有玩过这个游戏的同学,这个形象跟原版还是很接近的吧?

原版游戏形象

之前我用 Kimi K3 做这个游戏的时候,整个游戏的玩法链路已经跑通了,我当时都已经觉得很满足了。。。

结果没想到 Claude Opus 5 的效果这么好!很多小怪都是原版游戏中存在的。

而且角色的数值清晰、道具丰富多样,可以说是还原了《以撒的结合》游戏的精髓。

我甚至都玩进去了,导致这篇文章发布时间晚了 20 分钟。。。

BOSS 的机制也跟原版《以撒的结合》游戏中的 BOSS 神似!

大家觉得怎么样?

说真的,完全超出我的预期了,给到夯爆了!以后我也有戏做一些游戏了,skr~

7、全栈 AI 编程工具

最后一个项目,直接把难度拉满!

我让 AI 基于 VS Code 的开源代码,开发一个类似 Cursor 的 Web AI 编程工具,要支持 Editor Window 代码编辑器和 Agents Window 对话工作台两种模式,两个窗口之间可以自由切换。

看看成品,几乎完整地保留了 VSCode 的精髓,比如代码高亮、代码小地图、管理面板、代码搜索等等。

来让 AI 执行个任务试试,你能清晰地看到 AI 的思考信息、工具调用等等。

AI 甚至能够调用终端、自主测试开发出的代码,还能清晰地看到本次改动的文件!

怎么样,你敢相信我只跟 AI 对话一次,就开发出了自己的 Cursor 么?简历上又多了蓬荜生辉的一笔。

我的评价是夯爆了!

我的感受

7 个项目全部跑完了,让我印象最深刻的一点是,Claude 没有完全机械地、用最简单直接不绕弯子的方式完成任务,你让它做什么它就只做什么,而是会在你提示词需求的基础上加一点自己的想法,尽量达到理想的效果。

它不仅后端逻辑强、前端视觉效果也强,还非常注重细节,真的是六边形战士了。

至少对我来说,我暂时想不到什么开发任务 AI 完不成了。

如果有,那就是我没有驾驭好 AI,或者 tokens 不够。

另外一个让我印象深刻的点是,Opus 5 确实像官方说的那样,特别爱自己检查作业。Anthropic 甚至专门提醒开发者把提示词里那句「最后记得验证一遍」删掉,你越叮嘱它反而越容易检查上瘾。他们后来干脆把 Claude Code 的系统提示词删掉了 80% 以上,编程跑分一点没掉。

以后用这种级别的模型,该给你的提示词做做减法了,把精力花在明确需求和目标上就好,不用事无巨细地规定每一步该怎么做。

当然,这个特性是一把双刃剑,Opus 5 很容易把简单的任务搞复杂,这是 Claude 一贯的通病,也就更废 tokens。

如果你想更好地利用 Opus 5 这种级别的模型,还是要在提示词上多下下功夫,不是说要写的又臭又长,而是把需求描述清楚、限制好 AI 的边界,否则它搞不好就浪飞边子了。

最后,揭晓谜底,这 7 个任务打包加起来,一共花了我 900 多块。

这就是效果好相应的代价,之前我用 Kimi K3 等国产模型做同样的项目,加起来套餐额度才动了百分之几。

所以还是要根据你的实际需求来选择模型。

  • 如果是追求 90 分效果的任务,可以交给 Opus 5
  • 只需要 80 分的任务,可以交给 GPT 或者 Kimi K3 / GLM 5 这类模型,快、稳、便宜
  • 如果任务只要及格就好,那就用性价比极高的 DeepSeek 吧

OK 就分享到这里,本文会收录到我免费开源的 《AI 编程零基础入门教程》,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。

开源指路:https://github.com/liyupi/ai-guide

鱼皮的 AI 编程教程

我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

也欢迎在评论区聊聊:你觉得这钱花得值么?你现在主力用的是哪个模型?

相关文章
|
2月前
|
人工智能 安全 前端开发
A÷ 你还我账号!Claude 封号事件完整复盘
Anthropic 你还我账号!Claude Max 零元购漏洞与大规模封号事件全程复盘
420 0
|
1月前
|
人工智能 程序员 API
DeepSeek V4 Flash 正式版:成绩碾压 Pro 预览版,白菜价
DeepSeek V4 Flash 正式版上线公测:Agent 基准远超 V4-Pro 预览版,第三方指数反超 Pro,输出 2 元/百万token
DeepSeek V4 Flash 正式版:成绩碾压 Pro 预览版,白菜价
|
28天前
|
人工智能 JSON 测试技术
Claude 官方让我砍掉 80% 的提示词,效果真的更好吗?
Anthropic 官方针对 Claude Opus 5 和 Fable 5 这两个新模型,删掉了 Claude Code 超过 80% 的系统提示词,但在编码评测上的表现居然没有下降!什么原因?对 AI 编程有哪些启发
104 0
|
15天前
|
人工智能 开发框架 运维
API中转站,稳定服务哪家强?聊聊大模型多调用落地选型
大模型落地面临多厂商接口异构难题,API中转站成企业刚需。本文对比SaaS型(如4stoken,原生兼容OpenAI/Gemini/Claude及Seedance 2.0/2.5视频模型,支持多模态、人民币结算)与开源自建型(如New-API,数据自主可控)方案,聚焦协议兼容、链路稳定、成本审计与合规性,助团队科学选型。(239字)
|
15天前
|
人工智能 机器人 数据挖掘
4 大技巧,教你打造高效的 AI Agent 团队!
Claude 母公司 Anthropic 官方分享:怎么在团队中高效和 AI 协作,覆盖文档驱动协作、Skills 角色定义、多 Agent 分工、北极星目标设定等,配合鱼皮团队真实落地案例讲透
|
2月前
|
人工智能 安全 程序员
终于,Claude Code 封号的原因被曝光了!竟然针对中国用户,植入隐形代码?!
通俗易懂地揭秘 Claude Code 封号的手段,分享一些自己对 AI 编程困境的思考,Codex、Cursor、DeepSeek、智谱 GLM、甚至是豆包,都有所行动了
1592 2
|
2月前
|
缓存 运维 开发工具
阿里云国际站注册:CDN加速视频无法拖动播放怎么办?
视频点播业务中,进度条拖动是最基本的交互,可一旦接上 CDN,这个简单的动作反而成了高频故障点。不少技术团队排查无果后才发现,问题的根源并非带宽或源站性能,而是 CDN 节点在处理 Range 请求时的行为与预期不符。以下从现象入手,拆解这种看似“卡住”实则是协议层冲突的故障,并给出可复现的验证路径——这构成了阿里云CDN视频无法拖动播放解决方案的核心基础。
161 1
|
21天前
|
人工智能 小程序 前端开发
又一个 AI 新项目完结,用 DeepSeek 搞了个微信小程序!
手把手带你用 AI 编程做出一个能上线传播、能变现的微信小程序产品!最新 AI Agent 应用开发 + Vibe Coding 项目,秋招简历亮点拉满~
155 0
|
22天前
|
人工智能 安全 API
DeepSeek V4 Pro暴涨近50分,我却更想押GLM-5.3
DeepSeek V4 Pro正式版和GLM-5.3前后脚上线。一个把Agent成绩拉得像换了一代模型,一个连基座都没换,只靠后训练继续往前拱。老金来给你详细说说。