LTX-2.5:一句话生成带声音的视频,几分钟拥有 AI 影音创作工作站

简介: LTX-2.5是Lightricks推出的220亿参数开源音视频大模型,支持文生视频、图生视频及首尾帧生成,音画天然同步。依托阿里云计算巢+ComfyUI,一键部署即用,4K HDR输出,开箱实现AI影音创作。

LTX-2.5:一句话生成带声音的视频,几分钟拥有 AI 影音创作工作站

阿里云计算巢 × ComfyUI × LTX-2.5:一键部署音画同步的 AI 视频生成环境,支持文生视频 / 图生视频 / 首尾帧生成,对白音效与画面一次生成、天然对齐。


一、模型简介

LTX-2.5 是 Lightricks 推出的 220 亿参数开源音视频生成模型,原生支持 ComfyUI。它接受文本、图像和视频输入,可在一次生成中产出带同步音频的多镜头视频:对白、音效与画面联合建模,音画天然对齐。核心亮点:

  • 音画同步生成:对白、音效与视频在单次生成中一并产出,无需后期配音
  • 三种生成模式:文生视频(T2V)、图生视频(I2V)、首尾帧生成(FLF2V)
  • 高质量输出:支持 4K HDR 输出、多镜头叙事与精确视频编辑
  • ComfyUI 原生支持:官方模板库直接提供三个示例工作流,开箱即用

二、部署步骤

  1. 打开计算巢模型市场,搜索「LTX-2.5」,点击立即部署

image.png

  1. 选择地域、实例规格(GPU 型号)、付费方式等参数;

image.png

  1. 确认订单并创建服务实例。模型权重较大,部署时会自动下载模型文件,请耐心等待服务实例创建完成;

image.png

  1. 部署完成后,服务输出中会给出 ComfyUI 的访问地址。

image.png


三、打开 ComfyUI 并加载工作流

1.加载官方工作流

  1. 打开部署输出中的 ComfyUI 访问地址,进入 ComfyUI 界面;
  2. 选择 模版 → 生成类型 → 音频,搜索 "LTX-2.5" 直接打开对应工作流;

image.png

  1. 然后把图片和模型改成如下图所示,点击运行:

image.png

image.png


计算巢部署时模型文件已自动下载到对应目录,无需手动操作:

ComfyUI/models/
├── diffusion_models/
│   └── ltx-2.5-22b-dev-transformer-bf16.safetensors   # 主扩散模型
├── text_encoders/
│   └── gemma4-12b-with-proj-ltx-2.5-bf16.safetensors  # 文本编码器
└── vae/
    ├── ltx-2.5-video-vae-bf16.safetensors             # 视频 VAE
    └── ltx-2.5-audio-vae-bf16.safetensors             # 音频 VAE

四、应用场景

  • 广告与营销短片:一句提示词生成带音效与配乐的产品展示视频,快速产出投放素材
  • 短视频创作:音画同步一次生成,大幅降低拍摄与后期成本
  • 影视概念预演:首尾帧控制快速产出分镜过渡效果,辅助导演与美术沟通
  • 静态内容动态化:图生视频把海报、照片变成带声音的动态内容,提升社媒互动

五、相关链接


六、技术支持

钉钉群:

image.png

如有部署或使用问题,欢迎联系您的阿里云客户经理获取支持。

相关文章
|
21天前
|
人工智能 弹性计算 云计算
从一个想法到完整歌曲 — 用 MiniMax-Music-3 写出你的第一首 AI 单曲
阿里云×ComfyUI×MiniMax-Music-3,一键部署AI音乐创作环境。输入创意想法或歌词,单次生成最长5分钟完整歌曲——作曲、编曲、演唱、混音全链路自动完成,支持段落控制与高质量人声,开箱即用!
从一个想法到完整歌曲 — 用 MiniMax-Music-3 写出你的第一首 AI 单曲
|
1月前
|
编解码 弹性计算 云计算
MiniMax-H3 视频生成模型 — 一键部署与使用指南
MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)
|
15天前
|
人工智能 编解码 弹性计算
SenseNova-U1.5:一句话生成 4K 商用级大图,理解、推理、生成一体的 AI 视觉创作工作站
商汤SenseNova-U1.5-8B-MoT是原生多模态统一模型,基于NEO-unify架构,实现理解、推理与生成一体化;支持文生图、图像编辑、文字渲染与复杂版式编排,原生4K直出,轻量高效,已适配ComfyUI并支持阿里云一键部署。
|
人工智能 安全 Apache
QwenPaw:你的私人 AI 助理 —— 数据归你、记忆进化、多端触达的开源个人智能体
QwenPaw 是一款开源、本地优先的AI个人智能体(Apache 2.0),数据归属用户、记忆自主进化、支持钉钉/飞书/微信等多端触达。3行命令即可部署,内置Coding IDE、Persona人格、定时任务、MCP工具生态与多Agent协作,真正属于你的私有AI助理。
QwenPaw:你的私人 AI 助理 —— 数据归你、记忆进化、多端触达的开源个人智能体
|
21天前
|
语音技术 云计算 异构计算
一段音频克隆任何声音 — IndexTTS-2.5 零样本语音合成实战
阿里云×ComfyUI一键部署IndexTTS-2.5,零样本音色克隆:仅需一段音频即可复刻任意声音,支持情感控制、多角色对话及中英日西阿五语种合成,开箱即用,适用于有声书、视频配音与虚拟人等场景。(239字)
一段音频克隆任何声音 — IndexTTS-2.5 零样本语音合成实战
|
6月前
|
Linux API 网络安全
OpenClaw(Clawdbot)本地+阿里云部署实操:知识库搭建与大模型API对接全流程
在2026年的AI办公实践中,将本地分散的PDF、Markdown、Word等文档转化为可检索、可问答的智能知识库,成为提升工作效率的核心需求。但实际操作中,开发者常面临资料检索效率低、向量库搭建环境依赖复杂、大模型对接流程不清晰等问题。OpenClaw(原Clawdbot)作为轻量级的RAG(检索增强生成)框架,可实现本地文档的快速向量化、检索与问答闭环,同时支持本地多系统(MacOS/Linux/Windows11)与阿里云服务器部署,还能灵活对接阿里云千问系列大模型及免费的Coding Plan API,兼顾数据隐私性与AI问答能力。本文将详细拆解2026年OpenClaw的全平台部署步
3134 13
|
1月前
|
存储 人工智能 JSON
ComfyUI 影视级写实 AI 短片全链路落地教程|本地 AI 电影分镜渲染、时序稳定与人像一致性解决方案
本指南详解ComfyUI+FLUX+Wan2.2离线影视工业化流程:支持8G显卡,涵盖分镜生成、关键帧绘制、IP-Adapter人物统一、ControlNet姿态控制、图生视频、时序平滑与FFmpeg成片合成,全程本地部署、无水印、无限制。
|
2月前
|
人工智能 缓存 自然语言处理
阿里云百炼Token Plan深度解析:Credits规则、AI模型矩阵及免费Tokens获取攻略
阿里云百炼Token Plan是面向个人与团队的AI大模型订阅服务,以Credits为统一计量单位,整合通义千问全系列及主流第三方模型,提供灵活计费、团队管理与多工具兼容能力。本文从Credits计量逻辑、AI模型矩阵、免费Tokens获取与使用规则、套餐选型及常见问题等维度,全面解析Token Plan,帮助用户清晰理解计费机制、高效使用免费额度、合理选择订阅方案。
910 2
|
3月前
|
人工智能 自然语言处理 数据挖掘
用ChatGPT和Codex搭建个人AI工作流:从一人部门到开源实践
本文探讨AI时代“一人部门”工作法:用ChatGPT拆解任务、构建知识库,用Codex将流程工具化,结合复盘与沉淀,打造可持续的个人AI工作系统(OPC)。非替代团队,而是以工具+流程+知识,提升单人可复用、可迭代的系统性产出能力。
1279 7