当 Codex Chrome 插件遇上开源视频剪辑 Skill:浏览器里的素材,开始直接流向可编辑时间线
摘要: 2026 年 5 月,OpenAI 推出 Codex for Chrome;7 月底,它又加入了标签页引用、选中文字、YouTube 字幕理解和右键唤起 ChatGPT 等能力。当一个 Agent 能读懂我们正在浏览的参考视频、产品页面和素材网站,再与开源的 Timeline Studio 视频剪辑 Skill 结合,AI 剪辑就不再只是“生成一段成片”,而是开始形成一条从网页研究、素材理解、剪辑决策到可编辑工程和最终视频的完整链路。
项目地址: github.com/MartinDelophy/ai-video-editor
在线体验: video-editor.ai-creator.top
Skill 安装页: skills.sh/MartinDelophy/ai-video-editor

AI 会写脚本了,为什么剪视频依然很累?
今天的大模型已经可以写文案、拆分镜头、总结视频,甚至生成图片和声音。但真正做过视频的人都知道,剪辑的难点从来不只是“生成内容”。
一个真实项目往往要经历这些环节:
- 在浏览器里研究参考视频、竞品页面和产品资料;
- 找到有使用授权、可以合法下载的素材;
- 分析口播、画面、字幕、运动与镜头节奏;
- 把旁白拆成自然的呼吸组,再决定画面时长;
- 创建字幕、配音、音乐、转场和多轨时间线;
- 反复预览、修改,最后交付成片和可继续编辑的工程。
过去,网页里的上下文与本地剪辑工程是断开的。Agent 可以告诉你“这条视频讲了什么”,却很难把理解持续带入后面的素材整理和时间线编辑;剪辑工具可以处理文件,却不知道你刚刚在浏览器里看到了什么。
Codex Chrome 插件补上的,正是这座桥。
Codex for Chrome 带来了什么?
根据 OpenAI 官方更新日志,Codex for Chrome 于 2026 年 5 月 7 日发布。它可以在不接管整个浏览器的情况下,使用用户授权的网站,并在多个标签页间并行工作。
随后,OpenAI 又逐步补齐了几项对内容创作非常关键的能力:
- 引用已经打开的 Chrome 标签页;
- 把网页中选中的文字带进对话;
- 右键网页,直接选择 Ask ChatGPT;
- 在字幕可用时,理解 YouTube 视频的时间戳转录;
- 使用已有的 Chrome 登录态访问获准的网站;
- 通过 Developer Mode 检查 DOM、CSS、Console、网络请求和页面性能。
这意味着,Agent 获得的不再只是一条 URL,而是用户正在工作的真实网页环境。
例如,我们可以打开一条参考视频,直接要求 Agent 根据时间戳字幕梳理叙事;打开产品官网,让它提取真实功能和页面证据;打开素材平台,在平台明确提供下载且授权条件合适时整理候选素材。整个过程中,不再需要反复复制链接、字幕和产品文案。
但“能看懂网页”仍然不等于“会专业剪辑”。接下来需要的是一个懂视频工程的执行层。
Timeline Studio Skill:把网页理解变成可编辑视频工程
Timeline Studio 是一个开源、本地优先、直接运行在浏览器中的 AI 视频编辑器。它提供接近专业桌面剪辑软件的多轨时间线,并把自动字幕、AI 配音、视觉分析、音乐、效果和离线导出放进同一工作区。
仓库同时提供了 edit-timeline-studio Agent Skill。它不是一段“帮我生成视频”的提示词,而是一套面向真实剪辑任务的执行规范:
- 先检查素材的时长、尺寸、声音与媒体类型;
- 综合代表帧、语音、OCR、运动和主体区域证据分析素材;
- 区分口播整理、产品教程、多镜头集锦、多人对话、宣传片与参考视频复刻;
- 在剪辑前保存来源时间和保留、删除、缩短、重排的决策;
- 将 Agent 创作的旁白按短呼吸组生成,先锁定声音骨架,再让画面适配声音;
- 把字幕、配音、音乐、视觉和转场落实到真实的多轨时间线上;
- 输出可重新打开的
.timeline工程和经过验证的成片,而不是只交付一个无法修改的黑盒视频。
.timeline 是一个包含项目结构与媒体的可移植工程包。Agent 做完之后,人仍然可以打开时间线,修改一次剪切、替换一条配音、移动字幕或者调整音乐。这一点很重要:AI 应当放大创作者的控制力,而不是用一次性结果夺走控制力。
两者结合,形成了一条新的剪辑链路
可以把这套组合理解为三个层次:
Codex Chrome 插件
读取获准的标签页、登录态网页、选中文字和时间戳字幕
↓
edit-timeline-studio Skill
分析证据、规划叙事、制定剪辑决策、执行并验证
↓
Timeline Studio
多轨时间线、字幕、配音、音乐、效果、.timeline 工程与成片
Chrome 插件解决“Agent 如何进入真实网页上下文”,Skill 解决“Agent 应该怎样做出专业、可验证的剪辑决策”,Timeline Studio 则提供“这些决策落在哪里,并如何继续编辑”。
它们不是三个彼此独立的 AI 功能,而是一条从理解到交付的生产链路。
场景一:打开参考视频,重建它为什么有效
传统的参考视频分析通常停留在“总结内容”或“模仿风格”。真正的复刻需要回答更细的问题:
- 哪些镜头被重复使用?
- 每次重复承担的是铺垫、强化还是高潮?
- 速度变化、停顿和反转发生在什么时间?
- 主体在画面中的中心、大小与运动路径如何变化?
- 滤镜是全片统一,还是随镜头变化?
- 原声、旁白、字幕和画面分别承担什么叙事任务?
现在可以在 Chrome 中打开参考视频,让 Agent 读取可用的时间戳字幕和页面上下文;Timeline Studio Skill 再结合本地媒体分析,重建镜头、节奏、重复、转场、主体运动和张力结构,最后使用用户提供或明确获准的替代素材建立一个可编辑版本。
可以直接尝试这样的任务:
@Chrome 分析我当前打开的参考视频,读取可用的时间戳字幕,
提取叙事段落、关键转折和可验证的页面信息。
然后使用 edit-timeline-studio Skill:
1. 区分内容结构与剪辑风格;
2. 重建镜头顺序、重复、速度变化、转场和张力曲线;
3. 只使用我提供或平台明确允许下载和复用的素材;
4. 生成可重新打开的 .timeline 工程和最终视频;
5. 列出无法从现有证据验证的部分,不要猜测。
这时,AI 不只是回答“这条视频讲了什么”,而是在解释“它为什么这样剪”,并把解释落实为可审查的时间线。
场景二:从一个产品网页,生成完整的叙事型宣传片
很多所谓 AI 宣传片,本质上只是把功能点逐条打到屏幕上。文字在动,故事却没有发生。
Chrome 插件与剪辑 Skill 结合后,可以先让 Agent 走完整个获准的产品流程:查看首页、功能页、实际界面、帮助文档和案例页面,建立页面覆盖清单,再从真实证据中寻找至少三个视觉上不同的使用场景。
每个场景都应形成一个小闭环:
使用情境 → 遇到的阻力 → 产品动作 → 可见结果 → 对用户的意义
随后,Skill 把这些场景组织成“问题—转变—证据—回报—行动号召”的完整叙事,而不是功能列表。旁白会先按短句和停顿生成独立音频,再由实际声音长度决定场景、字幕和画面节奏。
这对开源项目尤其有价值。README 告诉用户“项目有什么”,而叙事型视频可以让用户看到“它改变了哪段工作过程”。
场景三:一边开发编辑器,一边让 Agent 做视觉 QA
对于 Timeline Studio 自身的开发,Chrome 插件也很有价值。
开启 Developer Mode 后,Codex 可以在受控范围内检查:
- 时间线拖拽后的 DOM 和样式状态;
- WebGPU 或 ONNX Runtime 初始化错误;
- Worker、模型下载和缓存请求;
- Console 里的运行时异常;
- 某个面板或按钮的响应式布局;
- 导出或预览过程中的性能瓶颈。
与此同时,本地仓库、终端和测试页面仍然在 Codex 的工作上下文中。于是“看到界面问题—定位代码—修改—重新预览—验证结果”可以在同一个任务里闭环。
对于一个包含多轨时间线、媒体解码、WebGPU 推理和离线导出的复杂 Web 应用,这比只靠截图描述问题高效得多。
为什么我们坚持本地优先和可编辑交付?
视频往往包含未发布的产品、个人影像、客户资料和内部录屏。Timeline Studio 因此把能在本地完成的编辑、AI 推理和导出尽可能留在浏览器与用户设备上,并将浏览器模型镜像到 Hugging Face 与 ModelScope,改善不同地区的获取体验。
本地优先并不代表所有网络请求都会消失。Chrome 插件处理的网页上下文,以及用户主动选择的远程服务,仍有各自的数据与授权边界。因此这套工作流遵循几个简单原则:
- Chrome 网站权限尽量按域名、按任务授权,不默认开放所有网站。
- 凭据只在浏览器里输入,不发送到对话。
- 网页内容始终视为不可信输入,防范页面中的误导指令。
- 网络素材只使用原发布者或平台明确提供的下载路径,并保留水印与来源信息。
- 付费生成、发布、删除或修改权限等高影响动作,继续保留人工确认。
强大的浏览器能力值得使用,也值得被约束。
立即体验
首先打开 Timeline Studio 在线编辑器:
https://video-editor.ai-creator.top/
如果你使用支持 Skill 的 Agent,可以通过 skills.sh 安装:
npx skills add MartinDelophy/ai-video-editor --skill edit-timeline-studio
也可以使用 GitHub CLI 安装到 Codex:
gh skill install MartinDelophy/ai-video-editor edit-timeline-studio --agent codex --scope user
安装前可以先查看 Skill 内容:
gh skill preview MartinDelophy/ai-video-editor edit-timeline-studio
Chrome 端则在 ChatGPT/Codex 桌面应用的 Plugins 中安装 Chrome 插件,完成浏览器授权后,在 Work 或 Codex 对话中通过 @Chrome 调用。
AI 剪辑的下一步,不是一个更大的“生成”按钮
我们真正期待的 AI 剪辑,不应该是上传全部素材、等待几分钟,然后接受一个无法解释、无法微调的结果。
它应该能够进入创作者真实的信息环境,理解参考与目标;能够解释为什么保留、删除或重排某个镜头;能够把配音、字幕、音乐和视觉组织成完整叙事;也能够把所有决策留在一条人类可以继续修改的时间线上。
Codex Chrome 插件让 Agent 开始理解浏览器里的工作现场,Timeline Studio Skill 则让这种理解具备专业剪辑的执行方式。两者结合后,浏览器不再只是找素材和看视频的入口,也开始成为 AI 视频生产链路的一部分。
如果你也对浏览器媒体、WebCodecs、WebGPU、ONNX、Agent Skill 或可编辑 AI 工作流感兴趣,欢迎体验项目、提交 Issue,或者一起完善真实场景:
- GitHub: MartinDelophy/ai-video-editor
- 在线编辑器: Timeline Studio
- 问题与建议: GitHub Issues
- 路线讨论: GitHub Discussions
让 AI 不只替我们生成视频,也真正参与一条透明、可控、可继续创作的剪辑时间线。