MiniMax-H3 视频生成模型 — 一键部署与使用指南
阿里云计算巢 × ComfyUI × MiniMax-H3:几分钟部署一个自带文生视频 / 图生视频 / 参考生视频能力的 AI 视频工作站,视频自带原生立体声音频。
一、模型简介
MiniMax-H3 是 MiniMax 推出的通用全模态生成模型,基于 330 亿参数的 dense Transformer 架构,现已开放权重并原生支持 ComfyUI。核心亮点:
- 三种生成模式:文生视频(T2V)、图生视频(I2V)、参考生视频(R2V)
- 原生立体声音频:语音、音效和音乐在单次前向传播中一并建模,而非事后叠加
- 高质量输出:最高支持 2K 分辨率、24fps,时长约 15 秒
- ComfyUI 原生支持:官方模板库直接提供三个示例工作流,开箱即用
二、部署方式:计算巢一键部署
通过阿里云计算巢模型市场,选择 MiniMax-H3 即可一键部署 ComfyUI 环境,模型文件自动下载,无需手动配置。
资源要求:
项目 |
说明 |
部署形态 |
ECS 单机版(GPU 云服务器) / 容器集群版 |
磁盘空间 |
模型文件约需 600GB 数据盘 |
推荐 GPU |
NVIDIA G49 / G49E / G59 / L20 等 |
部署步骤:
- 打开计算巢模型市场,搜索「MiniMax-H3」,点击立即部署;
- 选择地域、实例规格(GPU 型号)、付费方式等参数;
- 确认订单并创建服务实例。模型权重较大,部署时会自动下载模型文件,请耐心等待服务实例创建完成;
- 部署完成后,服务输出中会给出 ComfyUI 的访问地址。
三、打开 ComfyUI 并加载工作流
1.示例工作流
- 打开部署输出中的 ComfyUI 访问地址,进入 ComfyUI 界面;
- 选择 工作流 ,可以看到入门版示例工作流
2.下载官方工作流
- 打开部署输出中的 ComfyUI 访问地址,进入 ComfyUI 界面;
- 选择 工作流 → 浏览模板 → 视频,搜索 "MiniMax H3" 直接打开对应工作流;
- 也可以下载工作流 JSON 文件后直接拖入 ComfyUI 加载,三种模式各一个:
下载地址(ComfyUI 官方模板库):
https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/
- T2V 文生视频:
video_minimax_h3_t2v.json - I2V 图生视频:
video_minimax_h3_i2v.json - R2V 参考生视频:
video_minimax_h3_r2v.json
计算巢部署时模型文件已自动下载到对应目录,无需手动操作:
ComfyUI/models/ ├── diffusion_models/ │ ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors # T2V / I2V 使用 │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors # R2V 使用 ├── text_encoders/ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors └── vae/ ├── minimax_h3_video_vae_fp16.safetensors └── minimax_h3_audio_vae_fp32.safetensors
四、关键参数说明
1. 输出分辨率
每个工作流使用 Resolution Selector(分辨率选择器) 节点控制输出尺寸:
- MiniMax-H3 的原生画布短边为 768px,上限为 768×1344 像素;
- 模板默认使用较快的预览尺寸;要获得全质量输出,请在 16:9 下将百万像素提高到约 1.0(约 1344×768)。
2. 视频时长
时长输入会对齐到模型在 24fps 下每块 17 帧(17k+5)的网格,例如约 5 秒、约 12 秒等档位。
3. 提示词编写技巧
- 按「主体 + 动作 + 场景 + 镜头语言 + 音效描述」的顺序组织提示词;
- 需要音频时,直接在提示词中描述对白、音效或音乐风格,模型会一并生成;
- R2V 模式下,参考图决定人物与画面风格,提示词负责描述动作与剧情。
4. 执行
使用 Ctrl+Enter 或点击运行按钮执行工作流,等待生成完成即可在输出节点查看视频。
五、加速技巧:让生成更快
DeepGPU 推理加速(推荐)
本模型支持 ComfyUI-deepgpu 加速插件,安装使用后一般可加速生成 20%~30%,部分场景最高可将性能提升 5 倍。
- 免费插件,将阿里云 DeepGPU 推理加速技术集成至 ComfyUI;
- 可与 fp8、sage-attention、TeaCache、WaveSpeed 等优化技术叠加使用;
- 无需预编译,即时启用,切换图像/视频尺寸不产生额外开销;
- 使用限制:ComfyUI 须部署在阿里云的云服务实例上。
Sage Attention
示例工作流默认使用标准注意力实现。安装 Sage Attention 后:
- 通过 ComfyUI 管理器安装
ComfyUI-KJNodes; - 在工作流中添加
Patch Sage Attention KJ节点,连接在UNETLoader和BasicGuider节点之间; - 将
sage_attention设置为auto,照常运行工作流。
可将生成速度大约提升一倍,质量损失极小。
六、应用场景
- 广告与营销短片:一句提示词生成带配音、音效的产品展示视频
- 影视概念预演:用参考图保持角色一致性,快速产出分镜动态效果
- 社交媒体内容:图生视频把静态海报、照片变成动态内容
- 有声故事与短剧:原生立体声音频支持对白 + 环境音一次生成
七、相关链接
- 计算巢模型市场(MiniMax-H3):从计算巢控制台「模型市场」搜索 MiniMax-H3 进入
- 模型权重仓库:https://huggingface.co/Comfy-Org/MiniMax-H3
- ComfyUI 官方工作流模板:https://github.com/Comfy-Org/workflow_templates
- MiniMax 官方:https://www.minimax.io
八、技术支持
钉钉群:
如有部署或使用问题,欢迎联系您的阿里云客户经理获取支持。