安装一个 Skill,让 AI 在一杯咖啡的时间里完成视频剪辑,并交付可编辑工程
从图片、视频或网站地址出发,AI 自动完成内容分析、脚本规划、镜头剪辑、配音、字幕和视觉引导。最终交付的不只是一条成品视频,还包括可以随时重新打开和修改的
.timeline工程文件。
项目名称:Timeline Studio
GitHub 仓库:https://github.com/MartinDelophy/ai-video-editor
Agent Skill:https://skills.sh/MartinDelophy/ai-video-editor

一、我们想解决的,不只是“生成视频”
今天,让 AI 生成一段画面、一条配音或者几行字幕已经不难。
真正困难的是:怎样让 AI 独立完成一条具备专业质量的视频,同时让创作者保留继续修改的能力。
在真实的视频制作过程中,我们经常遇到这些问题:
- AI 能生成视频,但不能准确调整其中一个镜头;
- 配音为了满足时长被强行加速,听起来很不自然;
- 字幕和声音没有严格对应;
- 产品宣传片只会套模板,不能理解产品重点;
- 网站介绍视频只是截图轮播,没有真实交互;
- 放大和框选位置不准确,甚至会跟着画面抖动;
- 最终只输出一个 MP4,修改时只能重新生成;
- 工程重新打开后,本地素材或者音频关系丢失。
因此,我们开发 Timeline Studio 时确立了一个重要目标:
AI 不仅要自动完成视频,还必须交付一个可解释、可验证、可继续编辑的工程。
二、一杯咖啡的时间,从需求到成片
安装 edit-timeline-studio Skill 之后,用户不需要学习复杂的剪辑命令,只需要描述想要的结果。
例如:
请把这个网站制作成一条英文介绍视频。
使用自然女声,专业可信但有活力,16:9,时长约 60 秒。
先体验网站公开页面。如果关键功能需要登录,
请让我在浏览器中自行完成登录。
画面保持稳定,使用真实交互、关键帧放大、
下划线和准确框选突出重要功能。
最终交付成品视频和可继续编辑的工程文件。
提交任务后,你可以暂时离开,去喝一杯咖啡。
Agent 会依次完成:
- 分析图片、视频、声音或网站;
- 判断视频内容类型;
- 提炼产品价值与叙事重点;
- 规划脚本和镜头;
- 选择自然的配音节奏;
- 生成并同步字幕;
- 添加必要的放大、框选和视觉引导;
- 调整背景音乐;
- 预览并检查全部片段边界;
- 导出视频与可编辑工程。
最终结果包括:
project-name.mp4 # 可以直接发布的成品视频
project-name.timeline # 可以继续修改的完整工程
第一次自动剪辑完成大部分工作,以后的修改则直接在工程中完成,不需要从头再来。
三、为什么一定要保留工程文件
许多 AI 视频工具采用一次性生成模式。
当文案、配音、字幕或者镜头出现问题时,用户很难只修改其中一部分。即使再次使用相同提示词,生成结果也可能完全不同。
Timeline Studio 将可编辑工程作为整个系统的核心。
.timeline 是一个可移植的工程归档,其中不仅保存时间线结构,还可以包含项目使用的媒体文件。
重新导入后,可以恢复:
- 主画面轨道;
- 画中画和叠加素材;
- 字幕轨道;
- 分段配音;
- 视频原声;
- 背景音乐;
- 镜头时间;
- 轨道显隐和锁定状态;
- 画面变换;
- 编辑器中的其他项目设置。
因此,AI 与人之间不再是“生成或者不用”的关系,而是形成一条连续的协作流程:
AI 分析素材
↓
AI 完成初剪
↓
人工检查与调整
↓
AI 继续修改局部内容
↓
重新导出
四、AI 自动剪辑不是套模板
不同类型的视频不能使用同一套剪辑逻辑。
Timeline Studio 将常见任务划分为七个大类:
| 视频类型 | 需要优先保护的内容 |
|---|---|
| 人物口播 | 语义、表情、自然停顿与人物稳定 |
| 教程演示 | 操作步骤、点击行为与结果对应 |
| 访谈对话 | 说话人身份、问答关系与真实语境 |
| Vlog/活动 | 事件发展、自然声与镜头变化 |
| 产品营销 | 产品身份、卖点证据、品牌与行动号召 |
| 叙事纪录 | 人物、因果关系和时空连续性 |
| 网站宣传 | 页面证据、真实交互、隐私与视觉引导 |
分类不是为了选择一个固定模板,而是为了建立不同的编辑保护规则。
例如,在教程视频里,讲解、操作和操作结果必须保持完整。如果只保留点击动作,却删除前面的说明,观众就无法理解操作目的。
在产品宣传视频里,AI 不能为了画面更漂亮而改变:
- 产品外形;
- 包装文字;
- Logo;
- 品牌颜色;
- 操作按钮;
- 材质和结构;
- 产品实际具备的功能。
对于访谈和纪录内容,也不能通过重新排列句子制造原本不存在的结论。
五、先分析,再生成剪辑决策
Timeline Studio 不会拿到素材后立即修改时间线。
它会先建立内容证据。
对于图片,系统会分析:
- 人物和主体;
- 产品与品牌标识;
- 可读文字;
- 构图;
- 清晰度与分辨率;
- 可裁切空间;
- 景深和分层条件;
- 图生视频或图生图的适用性。
对于视频,系统会结合:
- 镜头边界;
- 代表帧;
- OCR;
- 语音与字幕;
- 人物、产品和界面区域;
- 全局光流;
- 主体区域光流;
- 模糊、遮挡和失焦;
- 动作开始与结果出现的时间。
光流并不直接负责判断“什么最重要”。
一个移动区域可能是人物,也可能只是背景。系统会先确定对象的语义,再使用光流判断运动轨迹。
这让 Timeline Studio 可以分辨:
- 无意的相机抖动;
- 有目的的运镜;
- 人物移动;
- 产品运动;
- 页面视频中的动态内容。
完成分析后,Agent 会生成一份可解释的剪辑决策:
{
"category": "website-walkthrough-promo",
"goal": "product-introduction",
"targetDurationSeconds": 60,
"aspectRatio": "16:9",
"narrationLanguage": "en-US",
"voiceStyle": "professional-energetic",
"mustKeep": [
"product value",
"search interaction",
"result evidence"
],
"mustAvoid": [
"private account data",
"unsupported claims",
"continuous camera shake"
]
}
每个关键片段都会记录保留、删除、缩短或重排的理由。
只有完成检查后,系统才会修改时间线。
六、网站宣传视频不能只截一张首页
网站介绍是 Timeline Studio 重点优化的自动剪辑场景。
用户只需要提供网站地址,Agent 会先体验网站,再决定如何介绍。
它会建立页面和流程覆盖清单:
- 主页;
- 功能页面;
- 产品列表;
- 详情页面;
- 搜索和筛选;
- 关键操作路径;
- 登录后的产品界面;
- 外部跳转;
- 可能产生真实影响的操作。
如果关键页面需要登录,Agent 会请用户自行在浏览器中登录。
它不会要求用户提供:
- 密码;
- 短信验证码;
- 一次性口令;
- Cookie;
- Token;
- 账户恢复信息。
无法访问的功能会标记为“未验证”,不会仅根据首页宣传语推断产品实际体验。
在用户授权的页面范围内,Agent 可以通过脚本驱动真实浏览器完成:
- 平滑滚动;
- 鼠标移动;
- hover 状态;
- 标签切换;
- 搜索与筛选;
- 加载到结果的变化;
- 页面视频播放;
- 可逆的表单预览;
- 临时鼠标光环。
脚本不会提交订单、发布内容、发送消息、修改账户资料或者执行其他具有外部影响的操作。
七、专业动效不是“每个地方都画框”
网页宣传片中,一个常见问题是到处使用矩形框。
框选太多,重点反而会消失。
Timeline Studio 会根据内容选择不同的视觉表达:
- 小而密集的内容:关键帧放大;
- 关键文字和数字:下划线或括线;
- 按钮和卡片:准确框选;
- 需要保留上下文的区域:聚光遮罩;
- 需要解释关系的元素:引导线;
- 页面视频中的移动对象:光流辅助跟踪;
- 静态产品图片:景深或 2.5D 分层。
镜头会遵循统一的视觉节奏:
建立上下文 → 引导注意 → 锁定目标 → 静止阅读 → 自然释放
当观众需要阅读文字、数据、按钮或产品细节时,画面必须停下来。
我们明确避免:
- 无意义的持续缩放;
- 画面微抖动;
- 模拟手持镜头;
- 弹性过冲;
- 框选漂移;
- 重复放大和缩小;
- 同时滚动和变焦;
- 为了展示效果而堆叠效果。
动效的目标不是让画面一直运动,而是帮助观众快速理解内容。
八、声音决定画面,而不是时长强迫声音
许多自动视频先固定 60 秒,再将配音强行压进 60 秒。
这容易产生语速过快、停顿消失、字幕闪过和品牌名称发音错误等问题。
Timeline Studio 先确定声音表现,再根据配音安排画面。
生成前,Agent 会确认:
- 配音语言;
- 女性、男性或指定声音;
- 年龄感;
- 专业、温暖、可信、活力或沉稳等风格;
- 正确的品牌名、网址和数字读法;
- 字幕语言;
- 期望的自然节奏。
如果文案超出目标时长,系统优先缩短文案,而不是全局加速声音。
在画面层面,光标到达、框选锁定、下划线出现、关键帧放大和结果展示,也会与对应语句同步。
九、每条字幕对应一个独立配音文件
最新的 .timeline v3 对配音工程结构进行了升级。
过去,一条完整旁白可能被不同时间范围重复引用。这样虽然在时间线上看起来像多个片段,实际却仍然只有一个音频文件。
现在,句子级配音会被物理拆分:
caption-01 → voice-01.wav
caption-02 → voice-02.wav
caption-03 → voice-03.wav
每条字幕通过 audioClipId 关联到对应音频。
用户以后可以:
- 单独替换某一句配音;
- 修改某一句音量;
- 调整一句话的开始时间;
- 修改字幕和配音的同步;
- 删除一句话;
- 重新生成某个句子;
- 保留其他已经确认的内容。
这种结构让“一键成片”之后的快速修改真正可行。
十、为什么播放不会卡在一个片段中循环
多媒体时间线中,一个容易被忽略的问题是播放时钟。
如果直接使用当前视频元素的 currentTime 控制整个时间线,当视频在片尾解码发生停顿时,播放头可能一直停留在当前片段末尾。
用户看到的效果,就像视频不断在一个片段中循环。
Timeline Studio 将时间线作为单调递增的主时钟:
Timeline Clock
├── 同步视频
├── 同步配音
├── 同步背景音乐
├── 同步字幕
└── 同步视觉效果
视频和音频只跟随时间线,不再反过来控制播放头。
相邻片段使用 [start, end) 半开时间区间,避免在公共边界上同时激活两个片段。
这类底层改进没有生成模型那么显眼,却决定了编辑器能否稳定处理长时间、多镜头和多音轨工程。
十一、浏览器本地 AI 与 ModelScope 双线路模型交付
Timeline Studio 是一个本地优先的浏览器 AI 视频编辑器。
浏览器端能力包括:
- 多语言 AI 配音;
- Whisper 自动字幕;
- Stable Audio AI 音乐;
- 人物和物体检测;
- 智能画面;
- 人像处理;
- AI 修复;
- 高清增强;
- 人声分离;
- 数字人相关能力。
为了改善不同网络环境下的模型获取体验,我们将模型通过 Hugging Face 和 ModelScope 双线路镜像交付。
国内网络环境优先使用 ModelScope,并在必要时回退到 Hugging Face。
两条线路保持统一的模型版本和缓存身份。因此,从一个来源切换到另一个来源时,不需要重新下载相同模型。
模型采用按需加载策略:
用户第一次使用能力
↓
检查本地缓存
↓
选择可用模型线路
↓
下载缺失模型
↓
初始化浏览器推理
↓
后续任务直接复用
这套设计带来了几个好处:
- 基础剪辑素材无需上传到远程编辑后端;
- 模型可以在浏览器中缓存;
- 国内外网络可以选择不同下载线路;
- 模型版本可以固定;
- 模型来源和许可证可以追踪;
- Agent 与人工编辑共享同一份项目状态。
涉及人脸替换、数字人或其他深度合成能力时,使用者必须取得相关素材的合法授权,不得制作或传播违法、侵权、虚假或误导性内容,也不能将生成结果冒充为真实影像。
十二、如何安装 Skill
通过 skills.sh 安装:
npx skills add MartinDelophy/ai-video-editor \
--skill edit-timeline-studio
安装到 Codex:
gh skill install MartinDelophy/ai-video-editor \
edit-timeline-studio \
--agent codex \
--scope user \
--pin v0.9.1
安装到 Claude Code:
gh skill install MartinDelophy/ai-video-editor \
edit-timeline-studio \
--agent claude-code \
--scope user \
--pin v0.9.1
GitHub Copilot、Gemini CLI、Cursor 等支持 Agent Skills 的客户端,也可以从同一个仓库发现这套 Skill。
十三、安装之后如何使用
安装之后,可以直接向 Agent 描述需要的结果。
示例一:产品宣传视频
请自动分析这些产品图片和演示视频,
剪辑成一条 45 秒的中文产品宣传片。
保留产品 Logo、包装文字和品牌颜色。
使用自然女声,表达专业、可信、有活力。
背景音乐不要覆盖配音。
画面保持稳定,突出产品最清晰的时刻。
最终输出 MP4 和可编辑的 .timeline 工程。
示例二:网站介绍视频
请介绍这个网站,英文女声,16:9,约 60 秒。
请先体验所有公开的主要页面。
如果核心功能需要登录,请让我自行登录。
使用真实交互、关键帧放大、下划线和准确框选。
不要让画面抖动,也不要在每个页面重复使用相同动效。
最终交付成品视频和可编辑工程。
示例三:已有工程快速修改
请打开这个 .timeline 工程。
将第二句配音替换为新文案,
把对应字幕同步更新,并将第三个镜头延长 1.5 秒。
其他已经确认的画面和声音保持不变,
然后重新导出视频。
最后一种场景正是可编辑工程的价值所在:修改局部,而不是重新生成全部内容。
十四、Agent 如何操作工程
对于命令层已经支持的能力,Agent 会先检查项目,再生成声明式编辑计划。
npm run agent -- project.inspect /absolute/path/project.timeline
npm run agent -- project.diff /absolute/path/edit-plan.json
npm run agent -- project.run /absolute/path/edit-plan.json
npm run agent -- project.inspect /absolute/path/project-v2.timeline
其中:
project.inspect用于检查工程结构;project.diff是不会写入文件的语义 dry run;project.run执行通过验证的编辑计划;- 再次运行
project.inspect验证最终结果。
AI 生成、复杂效果、浏览器操作和实时预览,则通过 Timeline Studio 编辑器完成。
Skill 会明确区分命令执行与浏览器执行,不会把 UI 自动化描述成完全确定性的无头操作。
十五、一键成片之后,还可以快速修改
保留 .timeline 工程后,用户可以随时:
- 替换某一个镜头;
- 调整镜头顺序;
- 修改片段时长;
- 重新生成某一句配音;
- 修改字幕;
- 调整字幕位置;
- 替换背景音乐;
- 修改音量和淡入淡出;
- 调整框选和放大;
- 改变视频比例;
- 输出不同语言版本;
- 重新导出。
AI 第一次完成大部分工作,后续只修改发生变化的部分。
不需要重新分析全部素材,也不需要把整条视频推倒重来。
十六、完成标准不只是“成功导出”
Timeline Studio 会同时检查结构正确性和编辑质量。
结构检查包括:
.timeline是否可以重新打开;- 项目媒体是否完整;
- 字幕和配音是否一一对应;
- 主画面、音频和字幕轨道是否正确;
- 轨道显隐和锁定状态是否恢复;
- 视频是否包含真实音频;
- 导出的尺寸、时长和帧数是否正确;
- 播放能否连续跨越全部片段边界。
编辑质量检查包括:
- 是否存在画面抖动;
- 跟踪目标是否漂移;
- 产品或人物身份是否被生成模型改变;
- 框选是否准确;
- 强调是否与配音同步;
- 字幕是否有足够的阅读时间;
- 画面是否遮挡关键内容;
- 需要阅读时画面是否停稳;
- 动效是否被过度使用。
技术上完成导出,并不代表视频已经具备专业质量。
结语:AI 自动剪辑需要的不只是模型
我们认为,AI 视频编辑下一阶段的核心,不只是生成模型能否产生更漂亮的画面。
更重要的是:
- 能不能理解素材;
- 能不能保护事实和品牌;
- 能不能规划清晰的叙事;
- 能不能生成自然配音;
- 能不能稳定地引导注意力;
- 能不能交付可继续工作的工程;
- 能不能在用户提出修改时只调整必要部分。
Timeline Studio 想实现的目标,可以概括为一句话:
安装一个 Skill,一杯咖啡的时间得到一条成品视频;保留一个可编辑工程,承接之后的每一次调整。
GitHub 仓库:
https://github.com/MartinDelophy/ai-video-editor
其他地址:
- 在线体验:https://video-editor.ai-creator.top
- Skill 安装页:https://skills.sh/MartinDelophy/ai-video-editor
- ModelScope:https://www.modelscope.cn/organization/martindelophy
- Issues:https://github.com/MartinDelophy/ai-video-editor/issues
如果这个项目对你有帮助,欢迎 Star、提交 Issue,或者分享你最希望交给 AI 自动完成的视频制作场景。