大家好,我是晚安code。
上周我刷到一支 2 分 21 秒的 MV,转发量一路冲到几百万,评论区全在感叹"AI 视频生成又进化了"。我顺手去看了它的制作过程——好家伙,这玩意儿压根就没生成视频。

一、先泼盆冷水:Opus 5.5 生成视频的原理里,没有视频模型
先把三个概念摆正,后面的内容才不会走偏。
Claude Opus 5.5:Anthropic 在 2026 年 9 月 22 日发布的旗舰模型,主打长时运行的智能体编程与知识型工作。你可以把它理解成一个能连着干十几个小时、中途不喊累的高级外包。
代码渲染(Code Rendering):用程序把每一帧画面算出来,再拼成视频的做法。它不"生成"画面,是"画"画面——像手绘动画的每一张赛璐璐片,只不过画笔换成了浏览器。
确定性渲染(Deterministic Rendering):同一个时间点 t,永远画出同一帧。这是整条管线的地基,后面详细说。
现在说结论。判断一个模型是不是视频生成模型,最省事的标准就一条——看输出。视频生成模型的输出是像素块,Opus 5.5 的输出是 token。
更直接一点:Opus 5.5 连图片都生成不了。Anthropic 的官方文档写得很清楚,Claude 不能创建图像,它的输入支持文本、图片和文件,输出只有文本。一个连静态图都吐不出来的模型,凭什么给你一段视频?
那网上那些片子是哪来的?

二、Opus 5.5 写代码做视频:那支被马斯克连转的 MV 是怎么来的
据量子位、新浪财经等媒体报道,这波"出片潮"的起点是博主 donald。他在 X 上刷到 NotinReality 做的《Claude Pop》,把原始链接连同音频一起丢给 Opus 5.5,要求保留歌曲、画面全部重做。
9 月 23 日,他对着电脑讲了大概 5 分钟,配上一长串提示词,然后去睡觉。12 小时后醒来,一支 2 分 21 秒的完整翻拍 MV 躺在那里,帖子冲到约 320 万播放。随后他公开了那串约 9500 字符的提示词,同题接龙就此开始。
另一位用户 anabology 照着公开的提示词,再加上 Midjourney 和 moodboard,让 Opus 5.5 又干了 12 小时,搓出一支 5 分多钟的超长版。马斯克多次转发,评论从"Epic"到"这次我真切感受到了 AGI",把浏览量推到了数百万量级。
到这里,九成文章会告诉你:"看,Opus 5.5 生成视频的能力真强。"
但这里有个被普遍略过的分叉。
我把 donald 公开的提示词翻了一遍,里面明确写了调用 Seedance 2.5 生成画面、ElevenLabs 生成声音、fal 跑视频生成,再用 JavaScript 叠动态图形。
也就是说,这支 MV 的画面不是代码渲出来的,是外部视频模型生成的。Opus 5.5 在这一单里干的是导演加剪辑:决定每个镜头用什么素材、怎么接、哪里重来。
](https://ucc.alicdn.com/kfmtnc2razd4s/developer-article1767954/20261004/eec325fb368443b2a65ebb03c0e39f19.png?x-oss-process=image/resize,w_1400/format,webp)
而真正纯靠写代码渲出来的是另一批作品。GitHub 上的 awesome-opus-5.5-video 就在做这件事:把散在各处的作品、原作者帖子、提示词和来源链接汇总起来,按动态图形、科普解说、3D 场景、游戏与交互分类。
里面能看到 @noahwachnik 做的浏览器版《我的世界》,@WinterArc2125 用代码渲染的奥斯特里茨战役短片。这些片子的画面全部由 HTML、Canvas、SVG、Three.js 这类代码在浏览器里实时画出来。
三、Playwright 逐帧渲染:从一句话到 MP4 的五个环节
纯代码渲染这条路,我把它拆成五个环节。

1)先要分镜,别让它直接写代码
上来就让它"做个 30 秒视频",出来的东西十有八九要推倒重来。正确的顺序是先让它交分镜或节拍表——总时长、几个场景、每个场景讲什么。你确认了再让它写代码,之后还能只改某一个镜头。
2)让页面暴露两个钩子
场景页面需要对外暴露一个时长和一个按时间绘制的函数:
window.DURATION = 12.5; // 总时长(秒)
window.seek = async (t) => {
// 画第 t 秒那一帧
// 所有元素的位置/透明度/颜色,都写成 t 的函数
};
seek(t) 是整个管线的核心约定。渲染器不"播放"动画,它只是不停地问:"t 等于这个值时,画面长什么样?"
3)把不确定的东西全关掉
这一步最容易被忽略,但也最容易翻车。
Date.now()、requestAnimationFrame 循环、CSS transition、定时器——这些都不能用,因为它们让画面依赖挂钟时间,而不是 t。随机值必须设种子。帧与帧之间也不许保存状态,否则并行渲染时会闪。
为什么这么较真?因为确定性渲染有个硬要求:同一份代码,每次渲染结果必须完全一样。只有这样,你才能单独重渲某个镜头,才能在发现第 137 帧有问题时,只重跑那一帧。
4)Playwright 逐帧截图
npm i playwright && npx playwright install chromium
渲染脚本启动无头 chromium,打开场景页,等 document.fonts.ready,然后按 t = 帧号 / fps 循环调用 seek,把每一帧截下来。
5)FFmpeg 吃帧流
帧不必先落盘。脚本 spawn 出 ffmpeg,用 -f image2pipe 从标准输入读帧,边收边编码:
ffmpeg -f image2pipe -framerate 30 -i - \
-c:v libx264 -pix_fmt yuv420p -crf 18 out.mp4
最后把音轨合进来,用 two-pass loudnorm 压到 -14 LUFS,一条能发的片子就成型了。
说到底,Opus 5.5 生成视频的门槛根本不在那句提示词上,而在你搭没搭好这套确定性渲染的框架。Claude Code 团队的 Thariq 自己就在网上吐槽过,那些网传的提示词上万字符,里面还夹着 skills、示例和 API 密钥——离"一句话出片"差得远。
四、四条路线,什么时候用哪条
这套管线不是只有一种搭法。按你的片子类型选:
| 路线 | 技术栈 | 适合 | 要注意 |
|---|---|---|---|
| A 单页截图 | HTML/Canvas + Playwright + FFmpeg | 15 秒内的动效、片头 | 最快搭起来,长片难管 |
| B 框架化 | Remotion / Manim / HyperFrames | 讲解片、几分钟长片 | Remotion 免费许可覆盖范围要自己核一遍 |
| C 产品演示 | 项目里真实的 UI 组件 | 产品宣传片 | 别拿"长得像"的仿制品冒充产品 |
| D 分段长任务 | 分镜拆场景,逐个渲染 | 长片、复杂叙事 | 接缝和音频要单独校 |
我的建议很直接:第一次上手走 A。一个 HTML 文件加一个渲染脚本,几十行就能跑通全流程。等你确认真需要三分钟的片子了,再考虑搬到 Remotion。
有个坑提前说:让它给运动模糊时,做法是每帧多渲几个子帧再用 tmix 混合,渲染时间会成倍涨。别一上来就开。

五、Opus 5.5 价格:单价降了,出片账单是另一本账
先把官方单价摆清楚(2026 年 10 月口径,参数以官方文档为准):
| 项目 | Opus 5 | Opus 5.5 |
|---|---|---|
| 输入 | $5 / 百万 token | $4 / 百万 token |
| 输出 | $25 / 百万 token | $20 / 百万 token |
| 缓存读取 | $0.50 / 百万 token | $0.20 / 百万 token |
| 缓存写入(5 分钟) | $6.25 / 百万 token | $5 / 百万 token |
| Fast Mode | — | $8 输入 / $40 输出 |
账面数字是这样的:输入输出各降 20%,缓存读取降幅 60%。上下文窗口 100 万 token,单次最多输出 12.8 万 token,API 模型名 claude-opus-5-5。
Anthropic 对外宣传的"常规负载成本降 40%"是另一个口径——那是把典型任务的 token 用量减少也算进去了。单价降 20% 和综合成本降 40% 是两笔账,别混着看。
真正要提醒的是第三笔账:出片成本。
有用户同时开 9 个 Opus 5.5 代理并行跑了 6 小时做一支预告片,烧掉约 1.87 亿 token,账单 190 美元。还有人的长片单次会话就吃掉 Max 周额度的 7% 到 10%。
所以,别拿"每百万 token 4 美元"去估你的成片预算。一支几十秒的短片可能几美元搞定,但一支几分钟的 MV,账单是按百美元算的,而且多数作品实际都跑了两轮以上。

六、想自己上手,先记住这几条
像导演一样给结构,别堆形容词。 写清总时长、场景数、每个场景要什么,再塞一两个参考图或参考视频。你说"要高级感"没用,你说"参考这支片子的运镜节奏"才有用。
列一份禁用清单。 粒子爆炸、RGB 分离、镜头光晕、霓虹辉光、弹跳缓动——这几个是"模板味"的主要来源,写进提示词里明确禁掉,成片立刻不一样。
让它自查返工。 渲染前抽查几张关键帧,把文字压字、元素重叠、画面拥挤这些问题先修掉,别等到渲完一万帧才发现标题被挡住了。
把推理强度开高。 effort 设到 high 以上,API 文档放进项目目录,密钥放 .env,顺手加一条 "deny": ["Read(./.env)"] 防止它把你的密钥读进上下文。
做成 Skill 复用。 跑通一次之后,把"给产品 → 出宣传片"整个流程封成 Skill,下次换个项目直接调。
可能有人会问:那这算不算 AI 生成视频?
看你说的"生成"指什么。如果你指的是画面由模型直接算出来,那不算——Opus 5.5 一个像素都不产。如果你指的是"我描述需求,最后拿到一支片子",那算,只是中间那段活儿是代码干的。这个概念分清楚,你在选工具时才不会买错东西。
绕回开头那支 MV。看明白之后就没什么玄乎的了:Opus 5.5 生成视频的能力,本质是写代码的能力换了个舞台。它不创造画面,它创造的是那个能一帧一帧把画面算出来的程序——而这件事,恰好是它最擅长的。
真要上手,我建议先花半小时把那条 seek(t) 的管线跑通。你用不上的话就当看个热闹;用得上的话,它比想象中好使。
我是晚安code,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:Opus 5.5 生成视频这种"写代码出片"的路子,和 Sora 那种直接生成画面的方式,你更愿意用哪个?