MiniMax-H3 视频生成模型 — 一键部署与使用指南

简介: MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)

MiniMax-H3 视频生成模型 — 一键部署与使用指南

阿里云计算巢 × ComfyUI × MiniMax-H3:几分钟部署一个自带文生视频 / 图生视频 / 参考生视频能力的 AI 视频工作站,视频自带原生立体声音频。


一、模型简介

MiniMax-H3 是 MiniMax 推出的通用全模态生成模型,基于 330 亿参数的 dense Transformer 架构,现已开放权重并原生支持 ComfyUI。核心亮点:

  • 三种生成模式:文生视频(T2V)、图生视频(I2V)、参考生视频(R2V)
  • 原生立体声音频:语音、音效和音乐在单次前向传播中一并建模,而非事后叠加
  • 高质量输出:最高支持 2K 分辨率、24fps,时长约 15 秒
  • ComfyUI 原生支持:官方模板库直接提供三个示例工作流,开箱即用

image.png


二、部署方式:计算巢一键部署

通过阿里云计算巢模型市场,选择 MiniMax-H3 即可一键部署 ComfyUI 环境,模型文件自动下载,无需手动配置。

资源要求

项目

说明

部署形态

ECS 单机版(GPU 云服务器) / 容器集群版

磁盘空间

模型文件约需 600GB 数据盘

推荐 GPU

NVIDIA G49 / G49E / G59 / L20 等

部署步骤

  1. 打开计算巢模型市场,搜索「MiniMax-H3」,点击立即部署
  2. 选择地域、实例规格(GPU 型号)、付费方式等参数;
  3. 确认订单并创建服务实例。模型权重较大,部署时会自动下载模型文件,请耐心等待服务实例创建完成;
  4. 部署完成后,服务输出中会给出 ComfyUI 的访问地址。

image.png

image.png

image.png


三、打开 ComfyUI 并加载工作流

1.示例工作流

  1. 打开部署输出中的 ComfyUI 访问地址,进入 ComfyUI 界面;
  2. 选择 工作流 ,可以看到入门版示例工作流

image.png

2.下载官方工作流

  1. 打开部署输出中的 ComfyUI 访问地址,进入 ComfyUI 界面;
  2. 选择 工作流 → 浏览模板 → 视频,搜索 "MiniMax H3" 直接打开对应工作流;
  3. 也可以下载工作流 JSON 文件后直接拖入 ComfyUI 加载,三种模式各一个:

下载地址(ComfyUI 官方模板库):
https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/

  • T2V 文生视频:video_minimax_h3_t2v.json
  • I2V 图生视频:video_minimax_h3_i2v.json
  • R2V 参考生视频:video_minimax_h3_r2v.json

计算巢部署时模型文件已自动下载到对应目录,无需手动操作:

ComfyUI/models/
├── diffusion_models/
│   ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors   # T2V / I2V 使用
│   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors  # R2V 使用
├── text_encoders/
│   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
└── vae/
    ├── minimax_h3_video_vae_fp16.safetensors
    └── minimax_h3_audio_vae_fp32.safetensors

四、关键参数说明

1. 输出分辨率

每个工作流使用 Resolution Selector(分辨率选择器) 节点控制输出尺寸:

  • MiniMax-H3 的原生画布短边为 768px,上限为 768×1344 像素;
  • 模板默认使用较快的预览尺寸;要获得全质量输出,请在 16:9 下将百万像素提高到约 1.0(约 1344×768)。

2. 视频时长

时长输入会对齐到模型在 24fps 下每块 17 帧(17k+5)的网格,例如约 5 秒、约 12 秒等档位。

3. 提示词编写技巧

  • 按「主体 + 动作 + 场景 + 镜头语言 + 音效描述」的顺序组织提示词;
  • 需要音频时,直接在提示词中描述对白、音效或音乐风格,模型会一并生成;
  • R2V 模式下,参考图决定人物与画面风格,提示词负责描述动作与剧情。

4. 执行

使用 Ctrl+Enter 或点击运行按钮执行工作流,等待生成完成即可在输出节点查看视频。


五、加速技巧:让生成更快

DeepGPU 推理加速(推荐)

本模型支持 ComfyUI-deepgpu 加速插件,安装使用后一般可加速生成 20%~30%,部分场景最高可将性能提升 5 倍。

  • 免费插件,将阿里云 DeepGPU 推理加速技术集成至 ComfyUI;
  • 可与 fp8、sage-attention、TeaCache、WaveSpeed 等优化技术叠加使用;
  • 无需预编译,即时启用,切换图像/视频尺寸不产生额外开销;
  • 使用限制:ComfyUI 须部署在阿里云的云服务实例上。

Sage Attention

示例工作流默认使用标准注意力实现。安装 Sage Attention 后:

  1. 通过 ComfyUI 管理器安装 ComfyUI-KJNodes
  2. 在工作流中添加 Patch Sage Attention KJ 节点,连接在 UNETLoaderBasicGuider 节点之间;
  3. sage_attention 设置为 auto,照常运行工作流。

可将生成速度大约提升一倍,质量损失极小。


六、应用场景

  • 广告与营销短片:一句提示词生成带配音、音效的产品展示视频
  • 影视概念预演:用参考图保持角色一致性,快速产出分镜动态效果
  • 社交媒体内容:图生视频把静态海报、照片变成动态内容
  • 有声故事与短剧:原生立体声音频支持对白 + 环境音一次生成

七、相关链接


八、技术支持

钉钉群:

image.png

如有部署或使用问题,欢迎联系您的阿里云客户经理获取支持。

相关文章
|
20天前
|
人工智能 编解码 搜索推荐
阿里云Wan3.0模型解析:模型能力、适用场景、模型价格、接入使用方式等
Wan3.0在生成时长、万能创作、全能参考与真实感等维度全面升级,单次可生成30秒视频,完整表达创作意图;在文本、图片、音频、视频四种基础模态之外,首次支持doc、xls、ppt、pdf、md等文档格式输入,让“万物皆可生视频”。与此同时,Wan3.0力求准确还原真实世界——人物千人千面,细节经得起审视,每一帧画面既真实、又可信。
|
23天前
|
人工智能 JSON Shell
2026AI漫剧本地全开源方案(附各个软件模型链接),8G显卡也能流畅运行
这是一套完全本地化部署的AI漫剧生成技术链路:涵盖LLM剧本分镜生成、FLUX文生图(IP-Adapter人脸锁定)、StoryDiffusion时序连贯控制、LTX-2.3唇形同步视频生成,及ComfyUI全流程调度。零云端费用,仅耗硬件算力,单集2–4小时可产出竖屏短视频,适配抖音/B站分发。
人工智能 缓存 前端开发
11718 59
|
人工智能 安全 Apache
QwenPaw:你的私人 AI 助理 —— 数据归你、记忆进化、多端触达的开源个人智能体
QwenPaw 是一款开源、本地优先的AI个人智能体(Apache 2.0),数据归属用户、记忆自主进化、支持钉钉/飞书/微信等多端触达。3行命令即可部署,内置Coding IDE、Persona人格、定时任务、MCP工具生态与多Agent协作,真正属于你的私有AI助理。
QwenPaw:你的私人 AI 助理 —— 数据归你、记忆进化、多端触达的开源个人智能体
|
20天前
|
人工智能 编解码 物联网
8G显存本地部署AI漫剧生成:基于ComfyUI的自动化工作流搭建指南
本文面向8G显存设备,基于ComfyUI打造轻量化AI漫剧工作流:通过FP8量化、GPU独占调度、节点精简、IP-Adapter角色固化等优化,彻底解决OOM、角色漂移、效率低下等问题;提供完整部署指令、参数表、批量生成源码及报错方案,支持9:16竖屏高清分镜全自动量产。(239字)
人工智能 JavaScript 开发工具
4704 17
人工智能 云计算 异构计算
130 0
|
1月前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
3445 139
缓存 JavaScript Shell
2064 3
|
23天前
|
机器学习/深度学习 Web App开发 编解码
2026 年 8 月大模型的三重跃迁
8月1—3日,国产大模型密集突破:通义千问Qwen3.8-Max以2.4T稀疏MoE+1M上下文实现高效推理;MiniMax开源全模态视频模型H3,支持2K/15秒带声视频生成;DeepSeek V4-Flash显著提升Agent能力。三大进展分别指向参数效率、长程自治与多模态生产,标志着大模型正从“辅助工具”迈向“端到端自主交付”。
1703 1
2026 年 8 月大模型的三重跃迁