LTX-2.5:一句话生成带声音的视频,几分钟拥有 AI 影音创作工作站

简介: LTX-2.5是Lightricks推出的220亿参数开源音视频大模型,支持文生视频、图生视频及首尾帧生成,音画天然同步。依托阿里云计算巢+ComfyUI,一键部署即用,4K HDR输出,开箱实现AI影音创作。

LTX-2.5:一句话生成带声音的视频,几分钟拥有 AI 影音创作工作站

阿里云计算巢 × ComfyUI × LTX-2.5:一键部署音画同步的 AI 视频生成环境,支持文生视频 / 图生视频 / 首尾帧生成,对白音效与画面一次生成、天然对齐。


一、模型简介

LTX-2.5 是 Lightricks 推出的 220 亿参数开源音视频生成模型,原生支持 ComfyUI。它接受文本、图像和视频输入,可在一次生成中产出带同步音频的多镜头视频:对白、音效与画面联合建模,音画天然对齐。核心亮点:

  • 音画同步生成:对白、音效与视频在单次生成中一并产出,无需后期配音
  • 三种生成模式:文生视频(T2V)、图生视频(I2V)、首尾帧生成(FLF2V)
  • 高质量输出:支持 4K HDR 输出、多镜头叙事与精确视频编辑
  • ComfyUI 原生支持:官方模板库直接提供三个示例工作流,开箱即用

二、部署方式:计算巢一键部署

通过阿里云计算巢模型市场,选择 LTX-2.5 即可一键部署 ComfyUI 环境,模型文件自动下载,无需手动配置。

资源要求

项目 说明
部署形态 ECS 单机版(GPU 云服务器) / 容器集群版
磁盘空间 模型文件约需 400GB 数据盘
推荐 GPU NVIDIA L20 及以上规格

部署步骤

  1. 打开计算巢模型市场,搜索「LTX-2.5」,点击立即部署
  2. 选择地域、实例规格(GPU 型号)、付费方式等参数;
  3. 确认订单并创建服务实例。模型权重较大,部署时会自动下载模型文件,请耐心等待服务实例创建完成;
  4. 部署完成后,服务输出中会给出 ComfyUI 的访问地址。

三、打开 ComfyUI 并加载工作流

1.加载官方工作流

  1. 打开部署输出中的 ComfyUI 访问地址,进入 ComfyUI 界面;
  2. 选择 工作流 → 浏览模板 → 视频,搜索 "LTX-2.5" 直接打开对应工作流;
  3. 也可以下载工作流 JSON 文件后直接拖入 ComfyUI 加载,三种模式各一个:
    截屏2026-08-17 13.46.03截屏2026-08-17 13.46.03.png

下载地址(ComfyUI 官方模板库):
https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/

- T2V 文生视频:`video_ltx2_5_t2v.json`
- I2V 图生视频:`video_ltx2_5_i2v.json`
- FLF2V 首尾帧生成:`video_ltx2_5_flf2v.json`

计算巢部署时模型文件已自动下载到对应目录,无需手动操作:

ComfyUI/models/
├── diffusion_models/
│   └── ltx-2.5-22b-dev-transformer-bf16.safetensors   # 主扩散模型
├── text_encoders/
│   └── gemma4-12b-with-proj-ltx-2.5-bf16.safetensors  # 文本编码器
└── vae/
    ├── ltx-2.5-video-vae-bf16.safetensors             # 视频 VAE
    └── ltx-2.5-audio-vae-bf16.safetensors             # 音频 VAE

四、关键参数说明

1. 提示词编写技巧

  • 按「主体 + 动作 + 场景 + 镜头语言 + 音频描述」的顺序组织提示词;
  • 需要音频时,直接在提示词中描述对白、音效或音乐风格,模型会一并生成;
  • 可按时间顺序描述多个镜头,模型支持在一次生成中产出多镜头视频;
  • FLF2V 模式下,首帧和尾帧图像决定起止画面,提示词负责描述过渡过程。

2. 输出参数

  • 分辨率:模板默认使用适合预览的分辨率,可根据 GPU 显存情况适当提高;追求高质量输出时可启用 4K HDR 相关配置;
  • 帧率与时长:按工作流中采样节点的 frames/length 参数控制,数值越大生成耗时越长;
  • I2V / FLF2V 模式:将图像连接到对应的图像输入端口即可。

3. 执行

使用 Ctrl+Enter 或点击运行按钮执行工作流,等待生成完成即可在输出节点查看带音频的视频。


五、应用场景

  • 广告与营销短片:一句提示词生成带音效与配乐的产品展示视频,快速产出投放素材
  • 短视频创作:音画同步一次生成,大幅降低拍摄与后期成本
  • 影视概念预演:首尾帧控制快速产出分镜过渡效果,辅助导演与美术沟通
  • 静态内容动态化:图生视频把海报、照片变成带声音的动态内容,提升社媒互动

六、相关链接


七、技术支持

钉钉群:

如有部署或使用问题,欢迎联系您的阿里云客户经理获取支持。

相关文章
人工智能 缓存 前端开发
6540 22
人工智能 JavaScript 开发工具
3390 6
开发工具 Swift git
1273 1
缓存 JavaScript Shell
1604 2
Shell API 调度
902 2
安全 机器人 API
665 2
|
15天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1825 13
|
14天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
2151 121
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
|
12天前
|
编解码 弹性计算 云计算
MiniMax-H3 视频生成模型 — 一键部署与使用指南
MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)

热门文章

最新文章