LTX-2.5:一句话生成带声音的视频,几分钟拥有 AI 影音创作工作站
阿里云计算巢 × ComfyUI × LTX-2.5:一键部署音画同步的 AI 视频生成环境,支持文生视频 / 图生视频 / 首尾帧生成,对白音效与画面一次生成、天然对齐。
一、模型简介
LTX-2.5 是 Lightricks 推出的 220 亿参数开源音视频生成模型,原生支持 ComfyUI。它接受文本、图像和视频输入,可在一次生成中产出带同步音频的多镜头视频:对白、音效与画面联合建模,音画天然对齐。核心亮点:
- 音画同步生成:对白、音效与视频在单次生成中一并产出,无需后期配音
- 三种生成模式:文生视频(T2V)、图生视频(I2V)、首尾帧生成(FLF2V)
- 高质量输出:支持 4K HDR 输出、多镜头叙事与精确视频编辑
- ComfyUI 原生支持:官方模板库直接提供三个示例工作流,开箱即用
二、部署步骤
- 选择地域、实例规格(GPU 型号)、付费方式等参数;
- 确认订单并创建服务实例。模型权重较大,部署时会自动下载模型文件,请耐心等待服务实例创建完成;
- 部署完成后,服务输出中会给出 ComfyUI 的访问地址。
三、打开 ComfyUI 并加载工作流
1.加载官方工作流
- 打开部署输出中的 ComfyUI 访问地址,进入 ComfyUI 界面;
- 选择 模版 → 生成类型 → 音频,搜索 "LTX-2.5" 直接打开对应工作流;
- 然后把图片和模型改成如下图所示,点击运行:
计算巢部署时模型文件已自动下载到对应目录,无需手动操作:
ComfyUI/models/ ├── diffusion_models/ │ └── ltx-2.5-22b-dev-transformer-bf16.safetensors # 主扩散模型 ├── text_encoders/ │ └── gemma4-12b-with-proj-ltx-2.5-bf16.safetensors # 文本编码器 └── vae/ ├── ltx-2.5-video-vae-bf16.safetensors # 视频 VAE └── ltx-2.5-audio-vae-bf16.safetensors # 音频 VAE
四、应用场景
- 广告与营销短片:一句提示词生成带音效与配乐的产品展示视频,快速产出投放素材
- 短视频创作:音画同步一次生成,大幅降低拍摄与后期成本
- 影视概念预演:首尾帧控制快速产出分镜过渡效果,辅助导演与美术沟通
- 静态内容动态化:图生视频把海报、照片变成带声音的动态内容,提升社媒互动
五、相关链接
- 计算巢模型市场(LTX-2.5):从计算巢控制台「模型市场」搜索 LTX-2.5 进入
- 模型权重仓库:https://huggingface.co/Lightricks/LTX-2.5
- ComfyUI 官方工作流模板:https://github.com/Comfy-Org/workflow_templates
- ComfyUI 官方教程:https://docs.comfy.org/tutorials/video/lightricks/ltx-2
- Lightricks 官方:https://www.ltx.studio/ltx-2
六、技术支持
钉钉群:
如有部署或使用问题,欢迎联系您的阿里云客户经理获取支持。