更新日期:2026-08-11|适用版本:ComfyUI 0.31.0+|关键词:MiniMax H3、ComfyUI视频生成、全模态视频、AI视频工作流
MiniMax H3是MiniMax于2026年7月31日发布的新一代全模态视频生成系统。它与传统“文生视频”“图生视频”模型最大的区别,是能够把文本、图片、视频和音频放在同一上下文中理解,再联合生成画面与原生立体声音频。官方规格支持4—15秒、24FPS、最高2K输出,并可同时生成对白、环境音、音效和背景音乐。
ComfyUI在0.30.0版本中加入MiniMax H3开放权重的原生支持;截至2026年8月11日,最新稳定版本已经来到0.31.0,这一版本又针对H3音频损坏、Audio VAE offload、采样器等问题进行了修复,因此新搭环境更建议直接使用0.31.0或更新版本。
目前使用ComfyUI跑MiniMax H3,可以分成两条主要路线:
| 路线 | 计算位置 | 输出 | 更适合 |
|---|---|---|---|
| 云端API | 云端模型服务 | 最高可到2K | 快速测试、没有高端GPU |
| 本地H3-Base | 自己的GPU | 768P + 原生音频 | 本地控制、批量实验、模型研究 |
需要特别说明:**MiniMax目前开放的是H3-Base,不是完整2K流水线。**2K结果需要H3-Regenerate-2K重新生成,而这个模块目前仍是托管服务,没有随开放权重一起发布。
一、MiniMax H3到底能输入什么?
H3-Base目前主要分为FL2VA与Ref2VA两种检查点。
FL2VA:文生视频与首尾帧控制
FL2VA实际上覆盖三个常见任务:
纯文本
→ 文生视频
文本 + 1张图片
→ 首帧生视频 / 尾帧生视频
文本 + 2张图片
→ 首尾帧生视频
也就是说,文生视频并不需要另一套独立模型,它与首尾帧任务共用H3-Base-FL2VA。
Ref2VA:多参考全模态生成
Ref2VA则适合复杂参考控制。
官方当前限制为:
- 参考图片最多9张;
- 参考视频最多3段;
- 参考音频最多3段;
- 每段视频或音频2—15秒;
- 视频总时长不超过15秒;
- 音频总时长不超过15秒;
- 图片、视频、音频合计最多12个文件;
- 音频不能作为唯一参考输入。
例如可以这样描述:
<Picture 1>是主人公,保持人物外貌和服装。
<Video 1>提供镜头运动和人物奔跑节奏。
<Audio 1>作为声音风格参考。
生成一段雨夜城市追逐场景。
镜头首先从人物侧后方跟拍,
随后切换到正面低机位。
保留雨声、脚步声和急促呼吸,
背景加入低沉电子音乐。
ComfyUI官方R2V模板同样采用<Picture 1>、<Video 1>、<Audio 1>这样的引用方式,让提示词明确说明不同素材分别承担什么角色。
二、路线一:ComfyUI云端API模式
如果只是想测试MiniMax H3效果,没有多卡GPU环境,API方式最简单。
ComfyUI已经提供MiniMax相关Partner Node,并从0.29.2开始增加H3模型支持;0.30.0进一步加入H3的768P选项。
这里要区分两个概念。
ComfyUI官方Partner Node使用的是ComfyUI自己的API节点和认证体系;如果使用MiniMax官方API Key,或者星链4SAPI这类第三方API中转站,就属于另一条自定义API接入路径,通常需要通过脚本、自定义节点或现有第三方节点完成。
不要认为:
有一个Base URL
+
有一个API Key
=
所有ComfyUI API节点都能直接替换
视频生成通常还是异步任务,需要提交任务、查询状态,再取得最终视频地址。
MiniMax H3官方API的完整2K生成会调用H3系统中的Context-IR、H3-Base和Regenerate-2K能力,因此不需要用户自行维护本地GPU。
对于只想快速验证:
- 文生视频;
- 商品图片转视频;
- 短广告素材;
- 带对白的短视频;
- 首尾帧转场;
云端方式通常更省工程时间。
三、路线二:ComfyUI本地运行H3-Base
如果需要数据留在本地,或者准备研究工作流、批量跑任务,则可以直接使用开放的H3-Base。
MiniMax已经明确把ComfyUI列入官方推荐推理框架,并提供T2V和R2V工作流模板。
第一步:更新ComfyUI
建议至少:
ComfyUI 0.31.0+
0.30.0是首次加入H3本地模型支持的版本,但0.31.0已经针对H3连续修复多个音频和显存相关问题,因此没有必要专门停留在0.30.0。
第二步:直接使用官方模板
打开Workflow Templates,搜索:
MiniMax H3
当前官方主要提供两套模板:
MiniMax H3 T2V
MiniMax H3 R2V
其中T2V工作流实际也包含首帧和尾帧输入,可以覆盖Text-to-Video与FL2VA;R2V则使用MiniMaxH3ReferenceToVideo处理图片、视频和音频参考。
相比自己从零搭节点,更建议第一次直接导入官方模板。
这样可以避免最常见的:
- VAE选错;
- 音频Latent没有正确连接;
- FL2VA与Ref2VA模型混用;
- 分辨率与帧长度不匹配;
- Reference编号错误。
四、本地需要下载哪些模型?
H3不是一个单独的safetensors就能完成全部工作的模型。
完整H3-Base包含:
H3 Encoder
↓
Qwen3-VL-32B
H3 Omni Transformer
↓
视频 + 音频联合生成
H3 Visual VAE
↓
视频编码/解码
H3 Audio VAE
↓
32kHz立体声音频编码/解码
MiniMax官方开放的原始检查点为BF16,并分别提供:
FL2VA/
Ref2VA/
每个目录中包含Tokenizer、Processor、Text Encoder、Transformer、Visual VAE和Audio VAE等组件。
ComfyUI还针对H3加入了int8_convrot等量化和VAE优化能力,用来降低本地运行时的内存与显存压力。0.31.0进一步加入了H3相关int8_convrot VAE支持。
因此,本地用户更建议按照官方ComfyUI模板提示下载对应模型,而不是照着旧教程固定复制某几个文件名——量化版本和模型文件更新速度目前很快。
五、本地到底需要多少显存?
这一点不要简单写成“最低24GB”。
MiniMax官方目前没有给出“RTX 4090最低多少GB即可完整运行”的统一结论。
官方SGLang参考部署采用:
4 × GPU
Ulysses Degree = 4
分别运行FL2VA和Ref2VA。原始模型的H3-Omni-Transformer约为33B参数,并且首次开放版本暂时只提供Full Attention推理,Sparse Attention实现计划后续再开放。
ComfyUI的量化、CPU Offload、模型卸载可以明显降低显存门槛,但实际能否运行还取决于:
GPU显存
系统内存
量化版本
视频分辨率
视频长度
参考素材数量
是否使用Offload
所以“16GB一定能跑”或“必须24GB以上”都不够严谨。
如果只是想体验H3,API模式通常会更简单;本地模式更适合已经有高显存GPU或愿意折腾量化与Offload的用户。
六、本地H3为什么只有768P?
这是MiniMax H3目前最容易被误解的一点。
完整H3系统实际上是三段:
用户输入
↓
H3-Context-IR
↓
H3-Base
↓
768P视频 + 原生立体声音频
↓
H3-Regenerate-2K
↓
2K最终视频
H3-Context-IR负责理解复杂的文本、图片、视频和音频之间的关系;H3-Base负责生成768P基础结果;H3-Regenerate-2K再利用原始上下文和768P视频重新生成高分辨率版本。
其中目前开放权重的是H3-Base。
Context-IR和Regenerate-2K仍需要调用MiniMax托管API。因此:
完全离线ComfyUI工作流目前应以768P输出为主。
如果想得到官方完整2K质量,则需要采用“本地H3-Base + 云端Context-IR/Regenerate-2K”的混合流程。MiniMax官方也把这一方案称为Full 2K Workflow。
七、三种工作流分别怎么写提示词?
文生视频
建议按照:
场景
+
人物动作
+
镜头运动
+
时间变化
+
声音
例如:
电影感写实画面。
一名年轻女性站在深夜便利店门口,
雨水打在透明雨棚上。
镜头从街道另一侧缓慢推进,
她低头查看手机,随后抬头望向街角。
环境音包含持续雨声、远处车辆、
便利店自动门开启的提示音。
背景音乐使用克制的钢琴与低频氛围音。
H3原生联合建模视频与32kHz立体声音频,因此声音描述最好直接作为Prompt的一部分,而不是等视频生成后才补。
首尾帧生成
需要控制转场或角色位置时,可以输入首帧、尾帧或两者同时输入。
更适合:
- 商品展示;
- Logo动画;
- 镜头转场;
- 人物动作;
- 场景状态变化。
R2V参考生成
R2V最值得利用的是“关系描述”。
不要只上传一堆素材然后写:
参考这些生成视频。
最好明确:
Picture 1负责人物身份
Picture 2负责服装
Video 1负责动作
Video 2负责运镜
Audio 1负责人声
模型知道每份参考素材“为什么存在”,效果通常比单纯堆素材更稳定。
八、星链4SAPI类大模型API中转站怎么放进工作流?
如果ComfyUI项目除了MiniMax H3,还会同时使用GPT、Claude、Gemini、Qwen、DeepSeek、图像模型或其他视频模型,就会出现多个API Key、Endpoint和计费入口。
这时可以增加一层统一API管理:
ComfyUI / Python脚本 / Agent
↓
大模型API统一接入层
↓
文本模型 / 图像模型 / 视频模型
星链4SAPI这类大模型API中转站的作用主要是统一模型入口、Key和调用管理,而不是替代ComfyUI本身。其公开定位就是多模型API聚合与统一接入。
视频模型还需要特别确认接口类型。
如果平台已经上架MiniMax H3,也应确认是否完整支持:
视频任务创建
任务状态查询
图片 / 视频 / 音频输入
异步返回
2K生成
文件URL
不能因为一个平台兼容OpenAI Chat Completions,就直接推断它能够处理MiniMax H3视频接口。
因此,在ComfyUI中更合理的做法是:
本地开放权重
→ 直接走ComfyUI原生节点
云端视频模型
→ Partner Node / API节点 / 自定义节点
多模型项目
→ 再通过统一API层管理不同供应商
这样工作流会更清晰。
九、常见问题
Q:MiniMax H3本地可以直接输出2K吗?
目前不可以按官方完整流程纯本地实现。H3-Base本地输出以768P为主,2K需要H3-Regenerate-2K,而该模块目前尚未开放权重。
Q:ComfyUI最低需要哪个版本?
H3开放权重原生支持从0.30.0加入,但现在推荐0.31.0或更新版本,因为0.31.0修复了多项H3音频、采样和VAE问题。
Q:H3一次最多能放多少参考素材?
Ref2VA最多9张图片、3段视频和3段音频,同时所有文件总数最多12个。音频不能单独作为唯一参考输入。
Q:本地运行一定要多张专业GPU吗?
官方原始BF16参考部署使用4卡,但ComfyUI提供量化、Offload等方式,可以降低本地门槛。官方目前没有给出统一的消费级显卡最低配置,因此最好按照自己的分辨率和视频时长实测。
小结
MiniMax H3进入ComfyUI以后,真正值得关注的不只是多了一个视频模型,而是ComfyUI开始能够直接编排:
文本
图片
视频
音频
↓
统一上下文
↓
视频 + 原生立体声音频
截至2026年8月,ComfyUI 0.31.0已经能够原生运行开放的H3-Base,覆盖文生视频、首尾帧生成和Ref2VA多参考生成;完全本地工作流以768P为主,完整2K仍需要云端Regenerate流程。
如果只是快速验证效果,可以走云端API;如果重视数据控制和工作流自由度,则可以在ComfyUI本地部署H3-Base;如果项目还需要同时调用多个文本、图片或视频模型,也可以把星链4SAPI这类大模型API中转站放在模型接入层统一管理。
三条路线解决的是不同问题,没有必要强行只选一种。对于大多数开发者来说,先用API确认H3是否符合业务需求,再决定是否投入本地GPU和复杂工作流,通常是成本更可控的顺序。