2026 年 8 月,MiniMax 正式开源了 H3 全模态音视频生成模型。一夜之间,曾经只能在云端调用的 "Sora 级" 视频生成能力,被塞进了每个人的电脑里。 但问题来了:模型开源了,怎么装?本文带你从零开始,用两种 WEBUI 方案把 MiniMax H3 跑起来 —— 不管你是 24G 显存的顶配玩家,还是只有 4G 显存的 "战斗版" 用户,都能找到适合自己的路。
MiniMax H3 是一款原生支持音视频同步生成的多模态模型,简单说就是:
和之前的视频模型不同,H3 把视频 VAE、音频 VAE、文本编码器、Omni Transformer 全部打包成了自包含的模型仓库,开发者可以直接从 Hugging Face 下载使用。

目前主流的本地部署方式有两种:
方案 | 适合人群 | 最低显存 | 上手难度 |
|---|---|---|---|
ComfyUI 原生部署 | 追求完整功能、有一定基础 | 约 12GB(INT8 量化版) | 中等 |
ONNX Edge Workbench | 低显存用户、只想快速体验 | 4GB 起 | 简单 |
下面分别讲。
ComfyUI 从 0.30.0 版本开始原生支持 MiniMax H3,不需要装任何额外插件,开箱即用。这也是目前社区最成熟、文档最全的方案。
配置档位 | 显卡显存 | 可运行模型变体 | 体验 |
|---|---|---|---|
入门 | 12GB | INT8 剪枝版 + INT8 文本编码器 | 可生成,速度较慢 |
主流 | 16-24GB | INT8 / BF16 版 | 流畅,可开 Turbo 加速 |
顶配 | 40GB+ | BF16 完整版 | 全速,可跑高分辨率 |
注意:H3 模型文件体积较大,建议预留 80GB 以上硬盘空间 (SSD 更佳)。
方式一:桌面客户端(推荐小白)
方式二:Git 手动安装(适合开发者)
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
pip install -r requirements.txt
启动:
python main.py
浏览器打开 http://127.0.0.1:8188 即可看到 ComfyUI 界面。
模型文件托管在 Hugging Face 的 Comfy-Org/MiniMax-H3 仓库中。国内用户可以使用 ModelScope 镜像或 gitcode 镜像加速。
需要下载的核心文件(4 个):
文件 | 大小 | 放置路径 |
|---|---|---|
minimax_h3_ref2va_pruned_int8_convrot.safetensors | 19.5 GB | ComfyUI/models/unet/ |
qwen3vl_32b_minimax_h3_int8_convrot.safetensors | ~18 GB | ComfyUI/models/text_encoders/ |
minimax_h3_video_vae.safetensors | ~4.8 GB | ComfyUI/models/vae/ |
minimax_h3_audio_vae.safetensors | ~1.2 GB | ComfyUI/models/vae/ |
显存大于 24GB 的用户可以选择 BF16 版本(
minimax_h3_ref2va_pruned_bf16.safetensors,约 39GB),画质更好。
一键克隆命令(国内推荐):
git clone https://gitcode.com/hf\_mirrors/Comfy-Org/MiniMax-H3
克隆完成后,按上面的表格把文件分别复制到对应目录即可。
一个简单的提示词示例:
A cute cat wearing sunglasses, sitting on a beach chair,
waves crashing in the background, golden hour lighting,
cinematic, 4k
首次生成会比较慢(模型加载 + 预热),后续会快很多。
如果你觉得默认采样步数太慢,可以加载官方的 Ref2VA Turbo 4-step LoRA,把采样步数压缩到 4 步,速度提升数倍,画质损失很小。
使用方法:
minimax_h3_ref2va_lightx2v_turbo_4step_v0.1.safetensorsComfyUI/models/loras/ 目录如果你显卡显存不够 12GB,或者不想折腾 ComfyUI 的节点,那么社区开发者推出的 MinimaxH3-ONNX 项目可能更适合你。
这个项目把 H3 模型导出为 ONNX 格式,通过分片加载和内存映射技术,最低 4GB 显存就能运行,并且自带一个基于 Gradio 的轻量级 WebUI。
GitHub:https://github.com/MARK42IRPC/MinimaxH3-ONNX
git clone https://github.com/MARK42IRPC/MinimaxH3-ONNX.git
cd MinimaxH3-ONNX
双击 install.bat,脚本会自动:
如果不想安装 GPU 可选组件,可以在运行前设置环境变量
H3_INSTALL_GPU=0。
双击 start_webui.bat,或者命令行执行:
uv run h3-workbench --host 127.0.0.1 --port 7860
http://127.0.0.1:7860
WebUI 自带 "切片" 页面,可以直接从 ModelScope 下载经过验证的模型包,包括:
所有源文件来自官方 Comfy-Org ModelScope 仓库,无需手动找资源。
WebUI 界面非常简洁:
支持四种模式:
输出分辨率支持 128-1024 像素(自动对齐到 32 的倍数),默认 360p 边缘推理配置。
这个 WebUI 还自带 "超分" 页面,可以对已生成的视频进行分辨率提升:
有的,推荐以下镜像源:
https://modelscope.cn/models/Comfy-Org/MiniMax-H3https://gitcode.com/hf_mirrors/Comfy-Org/MiniMax-H3hf_transfer 或 aria2 多线程下载nvidia-smi 确认显卡可见H3_INSTALL_GPU=1 强制安装 GPU 组件最后给一个决策建议:
你的显卡显存 ≥ 16GB?
├── 是 → 选 ComfyUI(功能最全,社区资源多,可玩工作流)
│ └── 想省事 → ComfyUI Desktop 客户端
│ └── 想折腾 → Git 手动安装 + 自定义节点
└── 否 → 选 ONNX Edge Workbench(4GB 就能跑,界面简单)
└── 显存 8-12GB → 两种都可以试试,ONNX 更流畅
└── 显存 4-6GB → 只能 ONNX,分辨率开低一点
MiniMax H3 的开源,标志着 AI 视频生成正式进入了 "本地可玩" 的时代。不管你是内容创作者、独立开发者,还是单纯对 AI 视频好奇的爱好者,都值得花一个下午把它部署起来 —— 当你输入一段文字,看着电脑自己生成一段带声音的视频时,那种感觉真的很奇妙。
如果这篇教程帮到了你,欢迎点赞收藏,有问题评论区交流。祝大家出片顺利!
参考资源:
https://www.minimaxi.com/news/minimax-h3-open-sourcehttps://docs.comfy.org/zh/tutorials/video/minimax/minimax-h3https://github.com/MARK42IRPC/MinimaxH3-ONNXhttps://huggingface.co/Comfy-Org/MiniMax-H3