MiniMax-H3 视频生成模型 — 一键部署与使用指南

简介: MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)

MiniMax-H3 视频生成模型 — 一键部署与使用指南

阿里云计算巢 × ComfyUI × MiniMax-H3:几分钟部署一个自带文生视频 / 图生视频 / 参考生视频能力的 AI 视频工作站,视频自带原生立体声音频。


一、模型简介

MiniMax-H3 是 MiniMax 推出的通用全模态生成模型,基于 330 亿参数的 dense Transformer 架构,现已开放权重并原生支持 ComfyUI。核心亮点:

  • 三种生成模式:文生视频(T2V)、图生视频(I2V)、参考生视频(R2V)
  • 原生立体声音频:语音、音效和音乐在单次前向传播中一并建模,而非事后叠加
  • 高质量输出:最高支持 2K 分辨率、24fps,时长约 15 秒
  • ComfyUI 原生支持:官方模板库直接提供三个示例工作流,开箱即用

image.png


二、部署方式:计算巢一键部署

通过阿里云计算巢模型市场,选择 MiniMax-H3 即可一键部署 ComfyUI 环境,模型文件自动下载,无需手动配置。

资源要求

项目

说明

部署形态

ECS 单机版(GPU 云服务器) / 容器集群版

磁盘空间

模型文件约需 600GB 数据盘

推荐 GPU

NVIDIA G49 / G49E / G59 / L20 等

部署步骤

  1. 打开计算巢模型市场,搜索「MiniMax-H3」,点击立即部署
  2. 选择地域、实例规格(GPU 型号)、付费方式等参数;
  3. 确认订单并创建服务实例。模型权重较大,部署时会自动下载模型文件,请耐心等待服务实例创建完成;
  4. 部署完成后,服务输出中会给出 ComfyUI 的访问地址。

image.png

image.png

image.png


三、打开 ComfyUI 并加载工作流

1.示例工作流

  1. 打开部署输出中的 ComfyUI 访问地址,进入 ComfyUI 界面;
  2. 选择 工作流 ,可以看到入门版示例工作流

image.png

2.下载官方工作流

  1. 打开部署输出中的 ComfyUI 访问地址,进入 ComfyUI 界面;
  2. 选择 工作流 → 浏览模板 → 视频,搜索 "MiniMax H3" 直接打开对应工作流;
  3. 也可以下载工作流 JSON 文件后直接拖入 ComfyUI 加载,三种模式各一个:

下载地址(ComfyUI 官方模板库):
https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/

  • T2V 文生视频:video_minimax_h3_t2v.json
  • I2V 图生视频:video_minimax_h3_i2v.json
  • R2V 参考生视频:video_minimax_h3_r2v.json

计算巢部署时模型文件已自动下载到对应目录,无需手动操作:

ComfyUI/models/
├── diffusion_models/
│   ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors   # T2V / I2V 使用
│   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors  # R2V 使用
├── text_encoders/
│   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
└── vae/
    ├── minimax_h3_video_vae_fp16.safetensors
    └── minimax_h3_audio_vae_fp32.safetensors

四、关键参数说明

1. 输出分辨率

每个工作流使用 Resolution Selector(分辨率选择器) 节点控制输出尺寸:

  • MiniMax-H3 的原生画布短边为 768px,上限为 768×1344 像素;
  • 模板默认使用较快的预览尺寸;要获得全质量输出,请在 16:9 下将百万像素提高到约 1.0(约 1344×768)。

2. 视频时长

时长输入会对齐到模型在 24fps 下每块 17 帧(17k+5)的网格,例如约 5 秒、约 12 秒等档位。

3. 提示词编写技巧

  • 按「主体 + 动作 + 场景 + 镜头语言 + 音效描述」的顺序组织提示词;
  • 需要音频时,直接在提示词中描述对白、音效或音乐风格,模型会一并生成;
  • R2V 模式下,参考图决定人物与画面风格,提示词负责描述动作与剧情。

4. 执行

使用 Ctrl+Enter 或点击运行按钮执行工作流,等待生成完成即可在输出节点查看视频。


五、加速技巧:让生成更快

DeepGPU 推理加速(推荐)

本模型支持 ComfyUI-deepgpu 加速插件,安装使用后一般可加速生成 20%~30%,部分场景最高可将性能提升 5 倍。

  • 免费插件,将阿里云 DeepGPU 推理加速技术集成至 ComfyUI;
  • 可与 fp8、sage-attention、TeaCache、WaveSpeed 等优化技术叠加使用;
  • 无需预编译,即时启用,切换图像/视频尺寸不产生额外开销;
  • 使用限制:ComfyUI 须部署在阿里云的云服务实例上。

Sage Attention

示例工作流默认使用标准注意力实现。安装 Sage Attention 后:

  1. 通过 ComfyUI 管理器安装 ComfyUI-KJNodes
  2. 在工作流中添加 Patch Sage Attention KJ 节点,连接在 UNETLoaderBasicGuider 节点之间;
  3. sage_attention 设置为 auto,照常运行工作流。

可将生成速度大约提升一倍,质量损失极小。


六、应用场景

  • 广告与营销短片:一句提示词生成带配音、音效的产品展示视频
  • 影视概念预演:用参考图保持角色一致性,快速产出分镜动态效果
  • 社交媒体内容:图生视频把静态海报、照片变成动态内容
  • 有声故事与短剧:原生立体声音频支持对白 + 环境音一次生成

七、相关链接


八、技术支持

钉钉群:

image.png

如有部署或使用问题,欢迎联系您的阿里云客户经理获取支持。

相关文章
|
2天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1298 108
|
9天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1931 8
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
3天前
|
编解码 人工智能 安全
2核4G/4核8G/8核16G阿里云服务器如何选择实例?经济型e、通用算力型u2i与计算型c9i选哪个?
本文介绍了阿里云2核4G、4核8G、8核16G三档主流配置下经济型e、通用算力型u2i和计算型c9i三种实例的最新活动价格与适用场景。同配置下三者价差显著,以2核4G为例,经济型e低至599.93元/年,计算型c9i则高达1742.08元/年。文章详细解析了各实例的性能定位:经济型e适合轻负载入门场景,u2i兼顾稳定算力与性价比,c9i凭借第9代至强处理器与芯片级安全能力支撑高性能业务。同时提示用户可叠加满减优惠券享受折上折,建议根据业务负载与预算综合决策。
507 111
|
7天前
|
存储 人工智能 关系型数据库
阿里云AI产品与云产品最新组合套餐:Token Plan、AI coding及云服务器和建站等组合优惠价
阿里云推出全新“算力+模型+应用”一站式云与AI组合套餐活动,覆盖从个人开发者到中大型企业的全场景需求。核心亮点为分三档定价的Token Plan订阅服务,支持Qwen3.8-Max-Preview大模型调用,错峰时段最低可享0.2折优惠。活动同步推出AI Coding、智能体部署、云电脑托管、0代码建站等十余类场景化组合,搭配99元/年的普惠云服务器、88元/年的入门数据库等经典特惠产品,还为企业提供1V1定制化AI转型方案,大幅降低了不同用户群体拥抱AI的技术门槛与采购成本。
685 111
|
3天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
|
17天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2611 13
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
15天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
2055 2
|
4天前
Qoder 一周年 × Qwen3.8-Max 正式上线,多重好礼限时领
8月3日,Qwen3.8-Max 正式上线Qoder,迎来Qoder一周年。新老用户可领800次免费调用,下单再赠2000次;夜间(22:00–08:00)调用5折;邀请好友双方得积分与调用额度。
319 0
|
17天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
1493 3