2026年8月3日,MiniMax正式开源了H3——一款33B参数的视频生成大模型。这个模型有几个让开源社区兴奋的点:最长15秒768p视频、原生32kHz立体声(开源视频模型中唯一支持音频的)、支持6种画面比例、可以接受15种多模态参考输入(图片+视频+音频混合)。
最关键的是:最低8GB显存就能跑起来。这意味着一张RTX 3060就能在自己的电脑上生成带音效的AI视频,不需要任何API费用。
这篇教程手把手带你从零部署MiniMax H3,跑通第一个视频。我提供两条路线:Windows用户用ComfyUI(最简单),Linux/开发者用DiffSynth-Studio(最灵活)。
一、硬件配置要求:先看看你的电脑够不够格
| 配置等级 | GPU | 显存 | 系统内存 | 硬盘空间 | 量化方案 |
|---|---|---|---|---|---|
| 入门(能跑) | RTX 3060/4060 | 8-12GB | ≥32GB | ≥50GB SSD | INT4/NF4 |
| 推荐(流畅) | RTX 3090/4090 | 24GB | ≥64GB | ≥80GB SSD | INT8 |
| 专业(生产) | A100/H100 | 80GB | ≥128GB | ≥100GB NVMe | FP16/BF16 |
| Apple Silicon | M4 Max/M3 Ultra | 64-192GB统一内存 | — | ≥100GB SSD | MLX量化 |
几个关键注意点:
- 系统内存很重要:模型加载时需要先在内存中解包,8GB显存方案至少需要32GB系统内存,推荐64GB
- SSD是必须的:模型权重文件约20-40GB(取决于量化精度),机械硬盘的读取速度会导致加载时间过长
- RTX 50系列独占NVFP4:NVIDIA Blackwell架构的RTX 5090/5080支持NVFP4量化(DiT部分仅需12.5GB显存),是当前消费级显卡中性价比最高的方案
- 操作系统:Windows 10/11(推荐ComfyUI路线)、Ubuntu 22.04+(推荐DiffSynth路线)、macOS(M系列芯片走MLX路线)
二、路线A:Windows用户——ComfyUI一键部署(最简单)
如果你用Windows且不想折腾命令行,ComfyUI是最简单的路线。整个过程大约30分钟。
第一步:下载ComfyUI便携版
访问ComfyUI官网下载最新便携版(Portable版),解压到你想要的目录,比如 D:\ComfyUI。
下载地址:https://github.com/comfyanonymous/ComfyUI/releases
选择:ComfyUI_windows_portable_nvidia.7z
解压后目录结构:
D:\ComfyUI\
├── ComfyUI\
├── python_embeded\
├── run_nvidia_gpu.bat
└── ...
第二步:下载MiniMax H3量化模型
ComfyUI官方已经提供了预量化好的H3模型,直接下载即可:
模型仓库:https://huggingface.co/Comfy-Org/MiniMax-H3
需要下载的文件:
1. MiniMax-H3-INT8.safetensors (约20GB,推荐24GB显存用户)
2. MiniMax-H3-NF4.safetensors (约12GB,8-12GB显存用户)
放置路径:
D:\ComfyUI\ComfyUI\models\diffusion_models\
国内用户下载加速:如果HuggingFace访问不畅,可以从ModelScope镜像下载:
ModelScope镜像:https://modelscope.cn/models/DiffSynth-Studio/MiniMax-H3-NF4
第三步:下载辅助模型文件
H3需要几个辅助模型才能正常运行:
1. 文本编码器(CLIP):
放到 D:\ComfyUI\ComfyUI\models\text_encoders\
2. VAE模型:
放到 D:\ComfyUI\ComfyUI\models\vae\
3. 音频VAE模型(用于生成声音,必须用fp32精度):
放到 D:\ComfyUI\ComfyUI\models\vae\
具体文件名和下载链接见ComfyUI的MiniMax-H3 workflow说明页。
第四步:导入工作流并运行
启动ComfyUI后,导入H3专用工作流:
1. 双击 run_nvidia_gpu.bat 启动ComfyUI
2. 浏览器打开 http://127.0.0.1:8188
3. 点击菜单 Load → 选择H3工作流JSON文件
(可从 ComfyUI 示例页面或社区获取)
4. 在文本框输入你的prompt
5. 点击 "Queue Prompt" 开始生成
如果一切正常,你会在右侧看到视频逐帧生成的进度。第一次生成可能需要3-10分钟(取决于显卡和分辨率),后续会更快。
三、路线B:Linux/开发者——DiffSynth-Studio部署(最灵活)
如果你是开发者或者用Linux,DiffSynth-Studio提供了最灵活的部署方式,可以精确控制每个参数。
第一步:环境准备
# 创建conda环境(推荐Python 3.10+)
conda create -n minimax-h3 python=3.10 -y
conda activate minimax-h3
# 安装PyTorch(根据你的CUDA版本选择)
# CUDA 12.1:
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu121
# CUDA 12.4:
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu124
第二步:安装DiffSynth-Studio
# 克隆仓库
git clone https://github.com/modelscope/DiffSynth-Studio.git
cd DiffSynth-Studio
# 安装依赖
pip install -e .
# 安装额外依赖
pip install diffusers transformers accelerate sentencepiece protobuf
第三步:下载模型权重
# 方式一:从HuggingFace下载(完整FP16模型,约65GB)
git lfs install
git clone https://huggingface.co/MiniMaxAI/MiniMax-H3
# 方式二:从ModelScope下载(国内更快)
pip install modelscope
modelscope download --model MiniMax/MiniMax-H3
# 方式三:下载NF4量化版(约12GB,适合8-12GB显存)
modelscope download --model DiffSynth-Studio/MiniMax-H3-NF4
第四步:编写推理脚本
import torch
from diffsynth import MiniMaxH3Pipeline
# 加载pipeline(根据你的模型路径调整)
pipe = MiniMaxH3Pipeline.from_pretrained(
"MiniMax-H3", # 模型路径
torch_dtype=torch.float16, # FP16推理
device="cuda"
)
# NF4量化用户加载方式:
# pipe = MiniMaxH3Pipeline.from_pretrained(
# "MiniMax-H3-NF4",
# torch_dtype=torch.float16,
# quantization="nf4",
# device="cuda"
# )
# 生成视频
prompt = "A golden retriever running on a beach at sunset, waves gently crashing in the background, cinematic lighting"
video = pipe(
prompt=prompt,
num_frames=73, # 必须是17k+5的格式(73,90,107...)
height=768,
width=1280, # 16:9比例
num_inference_steps=50, # 推理步数,越多越精细
guidance_scale=7.5, # 提示词引导强度
enable_audio=True, # 开启音频生成
)
# 保存输出
video.save("output.mp4")
print("视频已保存到 output.mp4")
第五步:运行
python generate.py
如果一切顺利,你将在当前目录下看到一个 output.mp4 文件——一段带立体声的AI生成视频。
四、关键参数详解:帧数、分辨率、步数
MiniMax H3有几个参数规则和其他模型不太一样,搞错了会直接报错:
帧数规则:必须遵循 17k+5 公式
H3的帧数不是随意设置的,必须符合 17k + 5 的公式:
| 帧数 | 时长(24fps) | 说明 |
|---|---|---|
| 22 | 约0.9秒 | k=1,最短可用 |
| 73 | 约3秒 | k=4,推荐入门测试 |
| 90 | 约3.75秒 | k=5 |
| 107 | 约4.5秒 | k=6 |
| 124 | 约5.2秒 | k=7 |
| 175 | 约7.3秒 | k=10 |
| 260 | 约10.8秒 | k=15,接近上限 |
如果设置了不符合公式的帧数(比如100帧),模型会报错或输出异常。入门测试建议用73帧,生成速度快且效果足够验证。
分辨率与画面比例
| 比例 | 分辨率 | 适用场景 |
|---|---|---|
| 16:9 | 1280×720 | 横屏视频/YouTube |
| 9:16 | 720×1280 | 竖屏/抖音/TikTok |
| 1:1 | 768×768 | 社交媒体方形 |
| 4:3 | 1024×768 | 传统横屏 |
| 3:4 | 768×1024 | 竖屏海报 |
| 21:9 | 1536×640 | 电影宽银幕 |
推理步数与引导强度
- num_inference_steps:推荐30-50步。30步速度快但细节略粗糙,50步质量最佳,超过50步提升不明显但时间翻倍
- guidance_scale:推荐5-9之间。太低(<3)视频内容会偏离prompt,太高(>12)会出现过饱和和伪影
五、性能参考:不同显卡要等多久?
以73帧、768p、50步为例,不同显卡的大致生成时间:
| 显卡 | 量化方案 | 生成时间 | 峰值显存占用 |
|---|---|---|---|
| RTX 3060 12GB | NF4 | 约8-12分钟 | 约11GB |
| RTX 4060 8GB | NF4 | 约10-15分钟 | 约7.5GB |
| RTX 3090 24GB | INT8 | 约4-6分钟 | 约20GB |
| RTX 4090 24GB | INT8 | 约3-4分钟 | 约20GB |
| RTX 5090 32GB | NVFP4 | 约2-3分钟 | 约12.5GB |
| A100 80GB | FP16 | 约1.5-2分钟 | 约65GB |
注意:首次生成时需要额外的模型加载时间(1-3分钟),后续生成不需要重复加载。
六、常见问题与解决方案
问题一:CUDA Out of Memory(显存不足)
这是最常见的问题。解决方案按优先级排列:
- 换用更激进的量化方案(FP16→INT8→NF4)
- 降低分辨率(从1280×720降到768×768)
- 减少帧数(从90帧降到73帧或22帧)
- 关闭音频生成(
enable_audio=False)可以节省约2GB显存 - 使用
torch.cuda.empty_cache()释放显存缓存
问题二:音频和视频不同步
解决方案:音频VAE必须以fp32精度加载。不要用fp16加载音频VAE,否则会导致音频时间轴偏移。在DiffSynth中,代码会自动处理这一点;在ComfyUI中确保使用最新版的工作流模板。
问题三:模型下载太慢
国内用户建议从ModelScope下载,速度通常比HuggingFace快5-10倍。也可以用 huggingface-cli 的多线程下载功能:
# 安装huggingface_hub
pip install huggingface_hub
# 多线程下载
huggingface-cli download MiniMaxAI/MiniMax-H3 --resume-download --repo-type model
问题四:生成的视频质量不理想
- 增加
num_inference_steps到50步 - 使用更详细的英文prompt(H3对英文prompt的理解显著优于中文)
- 尝试不同的
guidance_scale(推荐从7.5开始微调) - 如果使用NF4量化,效果不如FP16是正常的——量化本身会带来质量损失
七、进阶玩法
图片参考输入
H3支持传入最多9张参考图片,让生成的视频保持角色或风格的一致性:
video = pipe(
prompt="A character walking through a futuristic city",
reference_images=["character_front.png", "character_side.png"],
num_frames=73,
height=768,
width=1280,
num_inference_steps=50,
enable_audio=True,
)
搭建API服务
如果你想把H3部署成一个API服务供团队使用,可以用SGLang搭建OpenAI兼容的API:
# 安装SGLang
pip install sglang[all]
# 启动API服务
python -m sglang.launch_server \
--model-path MiniMaxAI/MiniMax-H3 \
--tp 4 \ # 多卡并行(根据GPU数量调整)
--port 8000 \
--trust-remote-code
# 调用方式与OpenAI API兼容
curl http://localhost:8000/v1/video/generations \
-H "Content-Type: application/json" \
-d '{"prompt": "A cat playing piano", "num_frames": 73}'
Apple Silicon用户
如果你用M4 Max或M3 Ultra的Mac,社区已经有了MLX移植版本:
git clone https://github.com/appautomaton/mlx-h3.git
cd mlx-h3
pip install -r requirements.txt
python generate.py --prompt "Your prompt here" --frames 73
八、模型许可证须知
MiniMax H3使用的是自定义社区许可证,不是Apache 2.0或MIT。主要条款:
- 个人研究和非商业用途:完全免费
- 商业用途:需要单独申请商业授权
- 生成内容的所有权:归使用者所有
- 禁止用于深度伪造、虚假信息生成等违法用途
如果你打算将H3用于商业项目,务必先阅读完整的许可证文本并联系MiniMax获取商业授权。
结语
MiniMax H3是目前开源视频生成模型中功能最全面的一个——不仅画质能打,还是唯一一个原生支持音频的。33B参数的规模意味着它的能力上限很高,而NF4量化让它可以在消费级显卡上运行。
如果你有一张RTX 3060或以上的显卡,花30分钟按这篇教程跑一遍,你就能在自己电脑上生成带音效的AI视频。这在一年前,是需要花几千块API费才能做到的事情。
如果你对AI视频生成感兴趣,也推荐阅读:
