Timeline Studio 重大升级:安装一个 Skill,让 AI 在一杯咖啡的时间里完成视频剪辑,并交付可编辑工程

简介: Timeline Studio 是一款AI视频编辑工具,支持从图片/视频/网址自动生成专业视频,并交付可编辑的`.timeline`工程文件。它兼顾自动剪辑与人工精修,实现“一杯咖啡成片,随时局部修改”。开源免费,浏览器本地运行。

安装一个 Skill,让 AI 在一杯咖啡的时间里完成视频剪辑,并交付可编辑工程

从图片、视频或网站地址出发,AI 自动完成内容分析、脚本规划、镜头剪辑、配音、字幕和视觉引导。最终交付的不只是一条成品视频,还包括可以随时重新打开和修改的 .timeline 工程文件。

项目名称:Timeline Studio
GitHub 仓库:https://github.com/MartinDelophy/ai-video-editor
Agent Skill:https://skills.sh/MartinDelophy/ai-video-editor

ScreenShot_2026-08-05_191633_865.png

一、我们想解决的,不只是“生成视频”

今天,让 AI 生成一段画面、一条配音或者几行字幕已经不难。

真正困难的是:怎样让 AI 独立完成一条具备专业质量的视频,同时让创作者保留继续修改的能力。

在真实的视频制作过程中,我们经常遇到这些问题:

  • AI 能生成视频,但不能准确调整其中一个镜头;
  • 配音为了满足时长被强行加速,听起来很不自然;
  • 字幕和声音没有严格对应;
  • 产品宣传片只会套模板,不能理解产品重点;
  • 网站介绍视频只是截图轮播,没有真实交互;
  • 放大和框选位置不准确,甚至会跟着画面抖动;
  • 最终只输出一个 MP4,修改时只能重新生成;
  • 工程重新打开后,本地素材或者音频关系丢失。

因此,我们开发 Timeline Studio 时确立了一个重要目标:

AI 不仅要自动完成视频,还必须交付一个可解释、可验证、可继续编辑的工程。

二、一杯咖啡的时间,从需求到成片

安装 edit-timeline-studio Skill 之后,用户不需要学习复杂的剪辑命令,只需要描述想要的结果。

例如:

请把这个网站制作成一条英文介绍视频。

使用自然女声,专业可信但有活力,16:9,时长约 60 秒。

先体验网站公开页面。如果关键功能需要登录,
请让我在浏览器中自行完成登录。

画面保持稳定,使用真实交互、关键帧放大、
下划线和准确框选突出重要功能。

最终交付成品视频和可继续编辑的工程文件。

提交任务后,你可以暂时离开,去喝一杯咖啡。

Agent 会依次完成:

  1. 分析图片、视频、声音或网站;
  2. 判断视频内容类型;
  3. 提炼产品价值与叙事重点;
  4. 规划脚本和镜头;
  5. 选择自然的配音节奏;
  6. 生成并同步字幕;
  7. 添加必要的放大、框选和视觉引导;
  8. 调整背景音乐;
  9. 预览并检查全部片段边界;
  10. 导出视频与可编辑工程。

最终结果包括:

project-name.mp4        # 可以直接发布的成品视频
project-name.timeline   # 可以继续修改的完整工程

第一次自动剪辑完成大部分工作,以后的修改则直接在工程中完成,不需要从头再来。

三、为什么一定要保留工程文件

许多 AI 视频工具采用一次性生成模式。

当文案、配音、字幕或者镜头出现问题时,用户很难只修改其中一部分。即使再次使用相同提示词,生成结果也可能完全不同。

Timeline Studio 将可编辑工程作为整个系统的核心。

.timeline 是一个可移植的工程归档,其中不仅保存时间线结构,还可以包含项目使用的媒体文件。

重新导入后,可以恢复:

  • 主画面轨道;
  • 画中画和叠加素材;
  • 字幕轨道;
  • 分段配音;
  • 视频原声;
  • 背景音乐;
  • 镜头时间;
  • 轨道显隐和锁定状态;
  • 画面变换;
  • 编辑器中的其他项目设置。

因此,AI 与人之间不再是“生成或者不用”的关系,而是形成一条连续的协作流程:

AI 分析素材
    ↓
AI 完成初剪
    ↓
人工检查与调整
    ↓
AI 继续修改局部内容
    ↓
重新导出

四、AI 自动剪辑不是套模板

不同类型的视频不能使用同一套剪辑逻辑。

Timeline Studio 将常见任务划分为七个大类:

视频类型 需要优先保护的内容
人物口播 语义、表情、自然停顿与人物稳定
教程演示 操作步骤、点击行为与结果对应
访谈对话 说话人身份、问答关系与真实语境
Vlog/活动 事件发展、自然声与镜头变化
产品营销 产品身份、卖点证据、品牌与行动号召
叙事纪录 人物、因果关系和时空连续性
网站宣传 页面证据、真实交互、隐私与视觉引导

分类不是为了选择一个固定模板,而是为了建立不同的编辑保护规则。

例如,在教程视频里,讲解、操作和操作结果必须保持完整。如果只保留点击动作,却删除前面的说明,观众就无法理解操作目的。

在产品宣传视频里,AI 不能为了画面更漂亮而改变:

  • 产品外形;
  • 包装文字;
  • Logo;
  • 品牌颜色;
  • 操作按钮;
  • 材质和结构;
  • 产品实际具备的功能。

对于访谈和纪录内容,也不能通过重新排列句子制造原本不存在的结论。

五、先分析,再生成剪辑决策

Timeline Studio 不会拿到素材后立即修改时间线。

它会先建立内容证据。

对于图片,系统会分析:

  • 人物和主体;
  • 产品与品牌标识;
  • 可读文字;
  • 构图;
  • 清晰度与分辨率;
  • 可裁切空间;
  • 景深和分层条件;
  • 图生视频或图生图的适用性。

对于视频,系统会结合:

  • 镜头边界;
  • 代表帧;
  • OCR;
  • 语音与字幕;
  • 人物、产品和界面区域;
  • 全局光流;
  • 主体区域光流;
  • 模糊、遮挡和失焦;
  • 动作开始与结果出现的时间。

光流并不直接负责判断“什么最重要”。

一个移动区域可能是人物,也可能只是背景。系统会先确定对象的语义,再使用光流判断运动轨迹。

这让 Timeline Studio 可以分辨:

  • 无意的相机抖动;
  • 有目的的运镜;
  • 人物移动;
  • 产品运动;
  • 页面视频中的动态内容。

完成分析后,Agent 会生成一份可解释的剪辑决策:

{
   
  "category": "website-walkthrough-promo",
  "goal": "product-introduction",
  "targetDurationSeconds": 60,
  "aspectRatio": "16:9",
  "narrationLanguage": "en-US",
  "voiceStyle": "professional-energetic",
  "mustKeep": [
    "product value",
    "search interaction",
    "result evidence"
  ],
  "mustAvoid": [
    "private account data",
    "unsupported claims",
    "continuous camera shake"
  ]
}

每个关键片段都会记录保留、删除、缩短或重排的理由。

只有完成检查后,系统才会修改时间线。

六、网站宣传视频不能只截一张首页

网站介绍是 Timeline Studio 重点优化的自动剪辑场景。

用户只需要提供网站地址,Agent 会先体验网站,再决定如何介绍。

它会建立页面和流程覆盖清单:

  • 主页;
  • 功能页面;
  • 产品列表;
  • 详情页面;
  • 搜索和筛选;
  • 关键操作路径;
  • 登录后的产品界面;
  • 外部跳转;
  • 可能产生真实影响的操作。

如果关键页面需要登录,Agent 会请用户自行在浏览器中登录。

它不会要求用户提供:

  • 密码;
  • 短信验证码;
  • 一次性口令;
  • Cookie;
  • Token;
  • 账户恢复信息。

无法访问的功能会标记为“未验证”,不会仅根据首页宣传语推断产品实际体验。

在用户授权的页面范围内,Agent 可以通过脚本驱动真实浏览器完成:

  • 平滑滚动;
  • 鼠标移动;
  • hover 状态;
  • 标签切换;
  • 搜索与筛选;
  • 加载到结果的变化;
  • 页面视频播放;
  • 可逆的表单预览;
  • 临时鼠标光环。

脚本不会提交订单、发布内容、发送消息、修改账户资料或者执行其他具有外部影响的操作。

七、专业动效不是“每个地方都画框”

网页宣传片中,一个常见问题是到处使用矩形框。

框选太多,重点反而会消失。

Timeline Studio 会根据内容选择不同的视觉表达:

  • 小而密集的内容:关键帧放大;
  • 关键文字和数字:下划线或括线;
  • 按钮和卡片:准确框选;
  • 需要保留上下文的区域:聚光遮罩;
  • 需要解释关系的元素:引导线;
  • 页面视频中的移动对象:光流辅助跟踪;
  • 静态产品图片:景深或 2.5D 分层。

镜头会遵循统一的视觉节奏:

建立上下文 → 引导注意 → 锁定目标 → 静止阅读 → 自然释放

当观众需要阅读文字、数据、按钮或产品细节时,画面必须停下来。

我们明确避免:

  • 无意义的持续缩放;
  • 画面微抖动;
  • 模拟手持镜头;
  • 弹性过冲;
  • 框选漂移;
  • 重复放大和缩小;
  • 同时滚动和变焦;
  • 为了展示效果而堆叠效果。

动效的目标不是让画面一直运动,而是帮助观众快速理解内容。

八、声音决定画面,而不是时长强迫声音

许多自动视频先固定 60 秒,再将配音强行压进 60 秒。

这容易产生语速过快、停顿消失、字幕闪过和品牌名称发音错误等问题。

Timeline Studio 先确定声音表现,再根据配音安排画面。

生成前,Agent 会确认:

  • 配音语言;
  • 女性、男性或指定声音;
  • 年龄感;
  • 专业、温暖、可信、活力或沉稳等风格;
  • 正确的品牌名、网址和数字读法;
  • 字幕语言;
  • 期望的自然节奏。

如果文案超出目标时长,系统优先缩短文案,而不是全局加速声音。

在画面层面,光标到达、框选锁定、下划线出现、关键帧放大和结果展示,也会与对应语句同步。

九、每条字幕对应一个独立配音文件

最新的 .timeline v3 对配音工程结构进行了升级。

过去,一条完整旁白可能被不同时间范围重复引用。这样虽然在时间线上看起来像多个片段,实际却仍然只有一个音频文件。

现在,句子级配音会被物理拆分:

caption-01 → voice-01.wav
caption-02 → voice-02.wav
caption-03 → voice-03.wav

每条字幕通过 audioClipId 关联到对应音频。

用户以后可以:

  • 单独替换某一句配音;
  • 修改某一句音量;
  • 调整一句话的开始时间;
  • 修改字幕和配音的同步;
  • 删除一句话;
  • 重新生成某个句子;
  • 保留其他已经确认的内容。

这种结构让“一键成片”之后的快速修改真正可行。

十、为什么播放不会卡在一个片段中循环

多媒体时间线中,一个容易被忽略的问题是播放时钟。

如果直接使用当前视频元素的 currentTime 控制整个时间线,当视频在片尾解码发生停顿时,播放头可能一直停留在当前片段末尾。

用户看到的效果,就像视频不断在一个片段中循环。

Timeline Studio 将时间线作为单调递增的主时钟:

Timeline Clock
   ├── 同步视频
   ├── 同步配音
   ├── 同步背景音乐
   ├── 同步字幕
   └── 同步视觉效果

视频和音频只跟随时间线,不再反过来控制播放头。

相邻片段使用 [start, end) 半开时间区间,避免在公共边界上同时激活两个片段。

这类底层改进没有生成模型那么显眼,却决定了编辑器能否稳定处理长时间、多镜头和多音轨工程。

十一、浏览器本地 AI 与 ModelScope 双线路模型交付

Timeline Studio 是一个本地优先的浏览器 AI 视频编辑器。

浏览器端能力包括:

  • 多语言 AI 配音;
  • Whisper 自动字幕;
  • Stable Audio AI 音乐;
  • 人物和物体检测;
  • 智能画面;
  • 人像处理;
  • AI 修复;
  • 高清增强;
  • 人声分离;
  • 数字人相关能力。

为了改善不同网络环境下的模型获取体验,我们将模型通过 Hugging Face 和 ModelScope 双线路镜像交付。

国内网络环境优先使用 ModelScope,并在必要时回退到 Hugging Face。

两条线路保持统一的模型版本和缓存身份。因此,从一个来源切换到另一个来源时,不需要重新下载相同模型。

模型采用按需加载策略:

用户第一次使用能力
        ↓
检查本地缓存
        ↓
选择可用模型线路
        ↓
下载缺失模型
        ↓
初始化浏览器推理
        ↓
后续任务直接复用

这套设计带来了几个好处:

  • 基础剪辑素材无需上传到远程编辑后端;
  • 模型可以在浏览器中缓存;
  • 国内外网络可以选择不同下载线路;
  • 模型版本可以固定;
  • 模型来源和许可证可以追踪;
  • Agent 与人工编辑共享同一份项目状态。

涉及人脸替换、数字人或其他深度合成能力时,使用者必须取得相关素材的合法授权,不得制作或传播违法、侵权、虚假或误导性内容,也不能将生成结果冒充为真实影像。

十二、如何安装 Skill

通过 skills.sh 安装:

npx skills add MartinDelophy/ai-video-editor \
  --skill edit-timeline-studio

安装到 Codex:

gh skill install MartinDelophy/ai-video-editor \
  edit-timeline-studio \
  --agent codex \
  --scope user \
  --pin v0.9.1

安装到 Claude Code:

gh skill install MartinDelophy/ai-video-editor \
  edit-timeline-studio \
  --agent claude-code \
  --scope user \
  --pin v0.9.1

GitHub Copilot、Gemini CLI、Cursor 等支持 Agent Skills 的客户端,也可以从同一个仓库发现这套 Skill。

十三、安装之后如何使用

安装之后,可以直接向 Agent 描述需要的结果。

示例一:产品宣传视频

请自动分析这些产品图片和演示视频,
剪辑成一条 45 秒的中文产品宣传片。

保留产品 Logo、包装文字和品牌颜色。
使用自然女声,表达专业、可信、有活力。

背景音乐不要覆盖配音。
画面保持稳定,突出产品最清晰的时刻。

最终输出 MP4 和可编辑的 .timeline 工程。

示例二:网站介绍视频

请介绍这个网站,英文女声,16:9,约 60 秒。

请先体验所有公开的主要页面。
如果核心功能需要登录,请让我自行登录。

使用真实交互、关键帧放大、下划线和准确框选。
不要让画面抖动,也不要在每个页面重复使用相同动效。

最终交付成品视频和可编辑工程。

示例三:已有工程快速修改

请打开这个 .timeline 工程。

将第二句配音替换为新文案,
把对应字幕同步更新,并将第三个镜头延长 1.5 秒。

其他已经确认的画面和声音保持不变,
然后重新导出视频。

最后一种场景正是可编辑工程的价值所在:修改局部,而不是重新生成全部内容。

十四、Agent 如何操作工程

对于命令层已经支持的能力,Agent 会先检查项目,再生成声明式编辑计划。

npm run agent -- project.inspect /absolute/path/project.timeline
npm run agent -- project.diff /absolute/path/edit-plan.json
npm run agent -- project.run /absolute/path/edit-plan.json
npm run agent -- project.inspect /absolute/path/project-v2.timeline

其中:

  • project.inspect 用于检查工程结构;
  • project.diff 是不会写入文件的语义 dry run;
  • project.run 执行通过验证的编辑计划;
  • 再次运行 project.inspect 验证最终结果。

AI 生成、复杂效果、浏览器操作和实时预览,则通过 Timeline Studio 编辑器完成。

Skill 会明确区分命令执行与浏览器执行,不会把 UI 自动化描述成完全确定性的无头操作。

十五、一键成片之后,还可以快速修改

保留 .timeline 工程后,用户可以随时:

  • 替换某一个镜头;
  • 调整镜头顺序;
  • 修改片段时长;
  • 重新生成某一句配音;
  • 修改字幕;
  • 调整字幕位置;
  • 替换背景音乐;
  • 修改音量和淡入淡出;
  • 调整框选和放大;
  • 改变视频比例;
  • 输出不同语言版本;
  • 重新导出。

AI 第一次完成大部分工作,后续只修改发生变化的部分。

不需要重新分析全部素材,也不需要把整条视频推倒重来。

十六、完成标准不只是“成功导出”

Timeline Studio 会同时检查结构正确性和编辑质量。

结构检查包括:

  • .timeline 是否可以重新打开;
  • 项目媒体是否完整;
  • 字幕和配音是否一一对应;
  • 主画面、音频和字幕轨道是否正确;
  • 轨道显隐和锁定状态是否恢复;
  • 视频是否包含真实音频;
  • 导出的尺寸、时长和帧数是否正确;
  • 播放能否连续跨越全部片段边界。

编辑质量检查包括:

  • 是否存在画面抖动;
  • 跟踪目标是否漂移;
  • 产品或人物身份是否被生成模型改变;
  • 框选是否准确;
  • 强调是否与配音同步;
  • 字幕是否有足够的阅读时间;
  • 画面是否遮挡关键内容;
  • 需要阅读时画面是否停稳;
  • 动效是否被过度使用。

技术上完成导出,并不代表视频已经具备专业质量。

结语:AI 自动剪辑需要的不只是模型

我们认为,AI 视频编辑下一阶段的核心,不只是生成模型能否产生更漂亮的画面。

更重要的是:

  • 能不能理解素材;
  • 能不能保护事实和品牌;
  • 能不能规划清晰的叙事;
  • 能不能生成自然配音;
  • 能不能稳定地引导注意力;
  • 能不能交付可继续工作的工程;
  • 能不能在用户提出修改时只调整必要部分。

Timeline Studio 想实现的目标,可以概括为一句话:

安装一个 Skill,一杯咖啡的时间得到一条成品视频;保留一个可编辑工程,承接之后的每一次调整。

GitHub 仓库:

https://github.com/MartinDelophy/ai-video-editor

其他地址:

如果这个项目对你有帮助,欢迎 Star、提交 Issue,或者分享你最希望交给 AI 自动完成的视频制作场景。

相关文章
|
4天前
|
监控 Shell API
Qoder CLI /loop 大升级:Agent 自调节奏,盯盘场景交给它就行了
Loop Engineering 新增动态唤醒机制:`/loop` 不再依赖固定间隔,Agent 可自主决定检查频率、触发时机与终止条件。支持 Monitor 事件秒级响应、三模式自动路由、TUI 管理面板及持久化任务,让盯盘、告警监控等弹性场景真正实现“交出判断权”。
133 0
|
6天前
|
人工智能 IDE 安全
阿里云Qoder CN全解析:AI编码智能体全场景功能深度指南
阿里云Qoder CN(原灵码)是阿里云推出的全栈式AI智能体产品系列,定位为覆盖编码、办公、终端、云端的一体化AI开发与协作平台,以多模态编程、智能体自主执行、全端覆盖、企业级安全合规为核心优势,深度适配国内开发者与企业的研发、办公、运维全流程需求。平台内置多模型自由切换、工程级代码处理、智能体任务编排、多模态交互、企业知识库集成等核心能力,提供桌面IDE、JetBrains插件、CLI终端、云端智能体、桌面办公助手等全形态产品,实现“一个账号、全场景覆盖、Credits共享”的一体化体验,是国内领先的AI编码与智能体协作平台。本文从产品矩阵、核心能力、全端接入、实战代码、企业级特性、订阅方
152 2
|
28天前
|
人工智能 算法 数据可视化
告别单轮静态测评!WorldForge 多动态环境基准,量化 Agent 组件协同能力
WorldForge是开源动态Agent评测框架,首创情绪耗竭、意义危机、快速衰减三类可控压力环境,支持多轮交互鲁棒性量化评估。适配ModelScope大模型,提供标准化动作空间、WS综合评分及四大基线Agent,助力算法研究与工业落地。
|
2月前
|
弹性计算 人工智能 运维
保姆级实操:阿里云ECS/轻量服务器完整部署Hermes Agent全流程手册
阿里云服务器部署Hermes Agent可解决本地部署的稳定性问题,实现全天候在线智能体服务。三种部署方案覆盖不同用户需求,一键部署适合新手,手动部署适合自定义配置。通过合理配置模型密钥、端口放行与运维优化,可长期稳定运行Hermes Agent,用于代码开发、自动化任务、数据处理等各类场景。
481 3
|
3天前
|
人工智能 安全 语音技术
当语言被困住:我们和 Qoder 跑通了一条有尊严的表达链路
MeantByMe是一款由Qoder赋能的语音补全产品,专为失语患者设计:实时补全含糊话语,经用户确认后播报,守护表达权与尊严。五天内,三人小队借助Qoder知识引擎与多Agent协作,高效完成全栈开发。
62 0
当语言被困住:我们和 Qoder 跑通了一条有尊严的表达链路
|
3天前
|
人工智能 JSON Java
插件上新:给鸿蒙开发者的 Cangjie 工具箱
Cangjie 插件上线 Qoder Desktop,集成570+篇仓颉官方文档,覆盖语言特性、标准库、工具链等6大技能。AI写代码时自动查文档,确保语法正确、API精准、编译通过,专为鸿蒙开发者打造。
61 1
|
1天前
|
机器学习/深度学习 人工智能 缓存
如何用 Agent Skill 构建一套可编辑、可验证的 AI 视频生产流水线
Timeline Studio 是开源AI视频编辑系统,支持从自然语言需求出发,自动完成素材分析、剪辑决策、时间线修改、浏览器端本地AI推理(Whisper/VITS等)及成片+可编辑`.timeline`工程双重交付,实现专业级自动化视频生产。
|
3天前
|
内存技术
阿里云千问模型前缀续写是什么?Partial Mode工作原理介绍
前缀续写(Partial Mode)指模型基于指定前缀无缝续生成内容。需将messages中最后一条设为assistant角色,content填前缀,并置"partial":true。支持Qwen-Max、Plus、Flash、Coder、VL、Turbo及Qwen3.5等系列(非思考模式)。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
3天前
|
人工智能 监控 数据安全/隐私保护
企业AI落地的终点,不是会对话,而是把一个流程真正跑通
企业AI落地的终点,不是会对话,而是把一个流程真正跑通 TL;DR 企业AI是否真正落地,应看真实任务能否持续、重复地完成并通过验收,而不是界面是否采用聊天框。对话助手能够产生经营价值,但不同岗位和熟练度人群的收益可能明显不同。对多数小微企业,更稳妥的起点是边界明确、风险可控、结果易检查的具体任务。知识库、权限控制、人
|
3天前
|
安全 网络协议 数据建模
内网ip地址证书如何申请内网 IP 证书怎么申请?一文读懂申请逻辑、流程与注意事项
为企业内网IP(如192.168.x.x)申请SSL证书,是实现通信加密、防中间人攻击及满足等保2.0等合规要求的关键举措。本文详解DV/OV/EV三类证书适用场景、标准化申请流程(含CSR生成、CA选择、IP验证与部署),并强调客户端信任配置、IP固定性、SAN多IP支持、自动化续期及私钥安全等核心注意事项。(239字)

热门文章

最新文章