更新日期:2026-08-11|适用版本:ComfyUI 0.31.0+|关键词:MiniMax H3、ComfyUI视频生成、全模态视频、AI视频工作流

MiniMax H3是MiniMax于2026年7月31日发布的新一代全模态视频生成系统。它与传统“文生视频”“图生视频”模型最大的区别,是能够把文本、图片、视频和音频放在同一上下文中理解,再联合生成画面与原生立体声音频。官方规格支持4—15秒、24FPS、最高2K输出,并可同时生成对白、环境音、音效和背景音乐。

ComfyUI在0.30.0版本中加入MiniMax H3开放权重的原生支持;截至2026年8月11日,最新稳定版本已经来到0.31.0,这一版本又针对H3音频损坏、Audio VAE offload、采样器等问题进行了修复,因此新搭环境更建议直接使用0.31.0或更新版本。

目前使用ComfyUI跑MiniMax H3,可以分成两条主要路线:

路线 计算位置 输出 更适合
云端API 云端模型服务 最高可到2K 快速测试、没有高端GPU
本地H3-Base 自己的GPU 768P + 原生音频 本地控制、批量实验、模型研究

需要特别说明:**MiniMax目前开放的是H3-Base,不是完整2K流水线。**2K结果需要H3-Regenerate-2K重新生成,而这个模块目前仍是托管服务,没有随开放权重一起发布。

一、MiniMax H3到底能输入什么?

H3-Base目前主要分为FL2VA与Ref2VA两种检查点。

FL2VA:文生视频与首尾帧控制

FL2VA实际上覆盖三个常见任务:

纯文本
→ 文生视频

文本 + 1张图片
→ 首帧生视频 / 尾帧生视频

文本 + 2张图片
→ 首尾帧生视频

也就是说,文生视频并不需要另一套独立模型,它与首尾帧任务共用H3-Base-FL2VA。

Ref2VA:多参考全模态生成

Ref2VA则适合复杂参考控制。

官方当前限制为:

例如可以这样描述:

<Picture 1>是主人公,保持人物外貌和服装。

<Video 1>提供镜头运动和人物奔跑节奏。

<Audio 1>作为声音风格参考。

生成一段雨夜城市追逐场景。
镜头首先从人物侧后方跟拍,
随后切换到正面低机位。
保留雨声、脚步声和急促呼吸,
背景加入低沉电子音乐。

ComfyUI官方R2V模板同样采用<Picture 1><Video 1><Audio 1>这样的引用方式,让提示词明确说明不同素材分别承担什么角色。

二、路线一:ComfyUI云端API模式

如果只是想测试MiniMax H3效果,没有多卡GPU环境,API方式最简单。

ComfyUI已经提供MiniMax相关Partner Node,并从0.29.2开始增加H3模型支持;0.30.0进一步加入H3的768P选项。

这里要区分两个概念。

ComfyUI官方Partner Node使用的是ComfyUI自己的API节点和认证体系;如果使用MiniMax官方API Key,或者星链4SAPI这类第三方API中转站,就属于另一条自定义API接入路径,通常需要通过脚本、自定义节点或现有第三方节点完成。

不要认为:

有一个Base URL
+
有一个API Key
=
所有ComfyUI API节点都能直接替换

视频生成通常还是异步任务,需要提交任务、查询状态,再取得最终视频地址。

MiniMax H3官方API的完整2K生成会调用H3系统中的Context-IR、H3-Base和Regenerate-2K能力,因此不需要用户自行维护本地GPU。

对于只想快速验证:

云端方式通常更省工程时间。

三、路线二:ComfyUI本地运行H3-Base

如果需要数据留在本地,或者准备研究工作流、批量跑任务,则可以直接使用开放的H3-Base。

MiniMax已经明确把ComfyUI列入官方推荐推理框架,并提供T2V和R2V工作流模板。

第一步:更新ComfyUI

建议至少:

ComfyUI 0.31.0+

0.30.0是首次加入H3本地模型支持的版本,但0.31.0已经针对H3连续修复多个音频和显存相关问题,因此没有必要专门停留在0.30.0。

第二步:直接使用官方模板

打开Workflow Templates,搜索:

MiniMax H3

当前官方主要提供两套模板:

MiniMax H3 T2V
MiniMax H3 R2V

其中T2V工作流实际也包含首帧和尾帧输入,可以覆盖Text-to-Video与FL2VA;R2V则使用MiniMaxH3ReferenceToVideo处理图片、视频和音频参考。

相比自己从零搭节点,更建议第一次直接导入官方模板。

这样可以避免最常见的:

四、本地需要下载哪些模型?

H3不是一个单独的safetensors就能完成全部工作的模型。

完整H3-Base包含:

H3 Encoder
    ↓
Qwen3-VL-32B

H3 Omni Transformer
    ↓
视频 + 音频联合生成

H3 Visual VAE
    ↓
视频编码/解码

H3 Audio VAE
    ↓
32kHz立体声音频编码/解码

MiniMax官方开放的原始检查点为BF16,并分别提供:

FL2VA/
Ref2VA/

每个目录中包含Tokenizer、Processor、Text Encoder、Transformer、Visual VAE和Audio VAE等组件。

ComfyUI还针对H3加入了int8_convrot等量化和VAE优化能力,用来降低本地运行时的内存与显存压力。0.31.0进一步加入了H3相关int8_convrot VAE支持。

因此,本地用户更建议按照官方ComfyUI模板提示下载对应模型,而不是照着旧教程固定复制某几个文件名——量化版本和模型文件更新速度目前很快。

五、本地到底需要多少显存?

这一点不要简单写成“最低24GB”。

MiniMax官方目前没有给出“RTX 4090最低多少GB即可完整运行”的统一结论。

官方SGLang参考部署采用:

4 × GPU
Ulysses Degree = 4

分别运行FL2VA和Ref2VA。原始模型的H3-Omni-Transformer约为33B参数,并且首次开放版本暂时只提供Full Attention推理,Sparse Attention实现计划后续再开放。

ComfyUI的量化、CPU Offload、模型卸载可以明显降低显存门槛,但实际能否运行还取决于:

GPU显存
系统内存
量化版本
视频分辨率
视频长度
参考素材数量
是否使用Offload

所以“16GB一定能跑”或“必须24GB以上”都不够严谨。

如果只是想体验H3,API模式通常会更简单;本地模式更适合已经有高显存GPU或愿意折腾量化与Offload的用户。

六、本地H3为什么只有768P?

这是MiniMax H3目前最容易被误解的一点。

完整H3系统实际上是三段:

用户输入
    ↓
H3-Context-IR
    ↓
H3-Base
    ↓
768P视频 + 原生立体声音频
    ↓
H3-Regenerate-2K
    ↓
2K最终视频

H3-Context-IR负责理解复杂的文本、图片、视频和音频之间的关系;H3-Base负责生成768P基础结果;H3-Regenerate-2K再利用原始上下文和768P视频重新生成高分辨率版本。

其中目前开放权重的是H3-Base。

Context-IR和Regenerate-2K仍需要调用MiniMax托管API。因此:

完全离线ComfyUI工作流目前应以768P输出为主。

如果想得到官方完整2K质量,则需要采用“本地H3-Base + 云端Context-IR/Regenerate-2K”的混合流程。MiniMax官方也把这一方案称为Full 2K Workflow。

七、三种工作流分别怎么写提示词?

文生视频

建议按照:

场景
+
人物动作
+
镜头运动
+
时间变化
+
声音

例如:

电影感写实画面。

一名年轻女性站在深夜便利店门口,
雨水打在透明雨棚上。

镜头从街道另一侧缓慢推进,
她低头查看手机,随后抬头望向街角。

环境音包含持续雨声、远处车辆、
便利店自动门开启的提示音。

背景音乐使用克制的钢琴与低频氛围音。

H3原生联合建模视频与32kHz立体声音频,因此声音描述最好直接作为Prompt的一部分,而不是等视频生成后才补。

首尾帧生成

需要控制转场或角色位置时,可以输入首帧、尾帧或两者同时输入。

更适合:

R2V参考生成

R2V最值得利用的是“关系描述”。

不要只上传一堆素材然后写:

参考这些生成视频。

最好明确:

Picture 1负责人物身份
Picture 2负责服装
Video 1负责动作
Video 2负责运镜
Audio 1负责人声

模型知道每份参考素材“为什么存在”,效果通常比单纯堆素材更稳定。

八、星链4SAPI类大模型API中转站怎么放进工作流?

如果ComfyUI项目除了MiniMax H3,还会同时使用GPT、Claude、Gemini、Qwen、DeepSeek、图像模型或其他视频模型,就会出现多个API Key、Endpoint和计费入口。

这时可以增加一层统一API管理:

ComfyUI / Python脚本 / Agent
            ↓
     大模型API统一接入层
            ↓
文本模型 / 图像模型 / 视频模型

星链4SAPI这类大模型API中转站的作用主要是统一模型入口、Key和调用管理,而不是替代ComfyUI本身。其公开定位就是多模型API聚合与统一接入。

视频模型还需要特别确认接口类型。

如果平台已经上架MiniMax H3,也应确认是否完整支持:

视频任务创建
任务状态查询
图片 / 视频 / 音频输入
异步返回
2K生成
文件URL

不能因为一个平台兼容OpenAI Chat Completions,就直接推断它能够处理MiniMax H3视频接口。

因此,在ComfyUI中更合理的做法是:

本地开放权重
→ 直接走ComfyUI原生节点

云端视频模型
→ Partner Node / API节点 / 自定义节点

多模型项目
→ 再通过统一API层管理不同供应商

这样工作流会更清晰。

九、常见问题

Q:MiniMax H3本地可以直接输出2K吗?

目前不可以按官方完整流程纯本地实现。H3-Base本地输出以768P为主,2K需要H3-Regenerate-2K,而该模块目前尚未开放权重。

Q:ComfyUI最低需要哪个版本?

H3开放权重原生支持从0.30.0加入,但现在推荐0.31.0或更新版本,因为0.31.0修复了多项H3音频、采样和VAE问题。

Q:H3一次最多能放多少参考素材?

Ref2VA最多9张图片、3段视频和3段音频,同时所有文件总数最多12个。音频不能单独作为唯一参考输入。

Q:本地运行一定要多张专业GPU吗?

官方原始BF16参考部署使用4卡,但ComfyUI提供量化、Offload等方式,可以降低本地门槛。官方目前没有给出统一的消费级显卡最低配置,因此最好按照自己的分辨率和视频时长实测。

小结

MiniMax H3进入ComfyUI以后,真正值得关注的不只是多了一个视频模型,而是ComfyUI开始能够直接编排:

文本
图片
视频
音频
      ↓
统一上下文
      ↓
视频 + 原生立体声音频

截至2026年8月,ComfyUI 0.31.0已经能够原生运行开放的H3-Base,覆盖文生视频、首尾帧生成和Ref2VA多参考生成;完全本地工作流以768P为主,完整2K仍需要云端Regenerate流程。

如果只是快速验证效果,可以走云端API;如果重视数据控制和工作流自由度,则可以在ComfyUI本地部署H3-Base;如果项目还需要同时调用多个文本、图片或视频模型,也可以把星链4SAPI这类大模型API中转站放在模型接入层统一管理。

三条路线解决的是不同问题,没有必要强行只选一种。对于大多数开发者来说,先用API确认H3是否符合业务需求,再决定是否投入本地GPU和复杂工作流,通常是成本更可控的顺序。