
2026年7月31日,MiniMax发布新一代通用全模态生成模型H3;8月3日,模型权重正式开源。在第三方评测平台Artificial Analysis上,H3以Elo 1130分登顶视频编辑榜单全球第一,同时在文生视频和图生视频子榜单位列前三。这不是又一款”能生成视频的AI”——H3用一个模型统一了生成、编辑、参考和音频合成,将视频生成的竞争维度从”谁画得好看”推向”谁能真正理解创作意图”。
一、H3是什么:不是视频生成器,是全模态创作系统
MiniMax H3(海螺3.0)定位为”通用型全模态生成系统”。与传统视频模型将文生视频、图生视频、视频编辑、音频生成拆分为独立任务不同,H3在预训练阶段就将这些能力融为一体,通过自然语言描述任务关系,模型自行理解并执行。
一个典型用例:输入一段希区柯克式运镜的参考视频、一张人物图片、一段人声音频,用文字描述”参考视频1的运镜方式,让图片2中的人物唱歌,声音匹配音频3″。H3会自动理解三者之间的关联,生成一段带有正确运镜、人物形象和配音的视频。这种”全参考”模式是H3区别于市面上所有竞品的核心能力。
核心规格:最高2K分辨率 / 4-15秒时长 / 24fps帧率 / 32kHz原生立体声音频 / 支持21:9、16:9、4:3、1:1、3:4、9:16六种宽高比 / 稳定支持11种语言
二、技术架构:三模块协同,33B参数的统一Transformer
完整的H3系统由三个模块串联组成,只有H3-Base在本次开源中释放了权重:
| 模块 | 功能 | 开源状态 | 输出规格 |
|---|---|---|---|
| H3-Context-IR | 多模态指令理解与上下文中间表示生成 | 闭源(API) | 结构化Prompt |
| H3-Base | 核心视频与音频生成 | 已开源 | 768p音视频 |
| H3-Regenerate-2K | 基于上下文的2K再生成 | 闭源(API) | 2K音视频 |
2.1 H3-Context-IR:多模态指令的”翻译官”
H3-Context-IR是一套托管式预处理系统,负责理解用户输入的文本、图像、音频和参考视频之间的复杂关系,将其序列化为H3-Base可接收的结构化表示(Context Intermediate Representation)。内部工作流包括指令解析、跨模态关联、时序理解和复杂逻辑推理。大多数源素材需要约100K token的推理计算,最终蒸馏为平均约4K token的紧凑表示。
由于依赖多阶段工作流和多个托管模型,该模块不包含在开源发布中。MiniMax提供了API和详细的提示词指南,开发者可以参考指南搭建自己的预处理系统。
2.2 H3-Base:33B统一Transformer的核心引擎
H3-Base是整个系统的核心,采用33B参数的dense single-stream Transformer架构,其中约13B参数位于AdaLN(自适应层归一化)相关分支中。由于AdaLN调制输出可预计算并缓存,纯推理部署时无需加载这部分参数,实际推理参数量约20B。
- H3-Encoder:使用Qwen3-VL-32B的完整预训练权重,提取第50层hidden states提供给Transformer。这一选择意味着H3的语言理解能力直接继承了Qwen3系列的优势
- H3-VisualVAE:时间因果结构的视频自编码器,空间压缩16倍、时间压缩4倍、latent channel数24(f16t4d24)。进入Transformer前以1x2x2 patch size进一步patchify,等效32倍空间下采样
- H3-AudioVAE:独立处理左右声道再重组,支持立体声。将32kHz音频压缩为40Hz时间频率的latent token序列
- H3-Omni-Transformer:attention层和FFN层不含模态特定结构,模态相关参数仅存在于输入/输出层和AdaLN分支。使用三维MM-RoPE表达(t,h,w)位置关系
架构亮点:H3放弃了海螺02的架构优势,选择更简洁的设计以服务”任务泛化”目标。理解与生成工作负载分离的训练架构使训练吞吐量提升近30%。模型原生支持稀疏注意力训练与推理,但首个开源版本仅提供全注意力推理,稀疏注意力实现将在后续更新中发布。
2.3 H3-Regenerate-2K:In-Context再生成的巧思
2K输出没有采用传统专用超分模块,而是让H3基础模型对其自身生成的768p结果进行in-context重新生成。这一方法有两大优势:再生成过程最大限度复用了基础模型已有的生成能力;in-context方式能再次利用原始多模态上下文,还原传统超分只能”猜测”的信息——例如小文字和精细细节。这也是任务泛化设计理念的一个具体应用。
三、性能评测:独立榜单全球第一,编辑能力碾压级领先
H3的排名来自Artificial Analysis——业界公认最严苛的第三方视频模型评测平台,采用盲测人类偏好投票生成Elo评分,与LMArena用于文本模型的方法论相同。H3的视频编辑Elo 1130分基于超过5000个盲测样本,统计上具有参考意义。
| 排名 | 模型 | 视频编辑Elo | 开发者 |
|---|---|---|---|
| 1 | MiniMax H3 | 1130 | MiniMax |
| 2 | Gemini Omni Flash | 1122 | |
| 3 | HappyHorse 1.0 | 1096 | 阿里巴巴 |
| 5 | Seedance 2.0 (720p) | 1035 | 字节跳动 |
| 6 | Runway Aleph 2.0 | 1011 | Runway |
| 7 | Kling 3.0 Omni (1080p) | 1000 | 快手 |
在文生视频和图生视频子榜单上,H3同样位列前三。需要指出的是,H3在编辑榜单的领先部分源于架构优势——它是少数能接受视频作为输入进行编辑的模型,而非仅支持文本或图片输入。多数被它超越的模型并非为编辑任务而设计,因此”编辑第一”的精确含义是”最佳视频编辑器”,而非笼统的”最佳视频模型”。
评测总结:H3在编辑能力上建立了明显领先(领先Seedance 2.0近100分Elo),在生成能力上与头部模型处于同一梯队。考虑到它同时支持12个参考文件的多模态输入和原生立体声音频,综合能力在当前市场没有直接对标者。
四、定价与可及性:2K视频每秒不到主流模型三分之一
| 项目 | 价格 | 说明 |
|---|---|---|
| 2K生成(公开API) | 0.13美元/秒 | 15秒视频约1.95美元 |
| 768p生成 | 0.09美元/秒 | 目前为内测,需联系销售 |
| 参考音频 | 免费 | 最多3段 |
| 参考图片(1-5张) | 免费 | 超出部分0.04美元/张 |
| 参考图片(6-9张) | 0.04美元/张 | — |
MiniMax官方表示,2K分辨率下H3的每秒价格不到主流模型的三分之一,768p价格不到主流模型720p的一半。有创作者实测对比:同样的素材和提示词,H3生成2K画质仅需132积分,而Seedance 2.0生成1080P画质需要680积分——差距超过5倍。
访问渠道方面,H3同时通过MiniMax开放平台API(模型ID为MiniMax-H3)和消费级海螺AI应用提供,2K层级无需排队。开源后,开发者还可通过Hugging Face和魔搭社区下载H3-Base权重,本地部署768p生成。
五、开源生态:24小时百家适配,”视频界的DeepSeek时刻”
8月3日,MiniMax正式开源H3-Base模型权重,发布在Hugging Face(MiniMaxAI/MiniMax-H3)和魔搭社区。开源24小时内即获超百家国内外合作伙伴首日适配及接入,包括16家芯片及平台厂商。H3迅速登顶Hugging Face趋势榜榜首,MiniMax股价四天累计涨近25%。
- 推理框架支持:SGLang、vLLM、diffusers、ComfyUI,覆盖从研究到生产的全链路部署需求
- 两个Checkpoint:H3-Base-FL2VA支持文生视频和首尾帧生视频;H3-Base-Ref2VA支持全模态参考模式
- 完整2K工作流:本地H3-Base生成768p + 官方H3-Context-IR和H3-Regenerate-2K API组合使用,可复现官方2K质量
- 许可协议:基于MiniMax H3 Community License发布,支持商用
- 可复现案例:官方提供T2VA、FL2VA、Ref2VA三类可复现的768p音视频生成案例及完整代码
部署建议:对于需要2K输出的生产环境,推荐使用”完整2K工作流”——本地部署H3-Base处理768p生成,调用官方API完成上下文理解和2K再生成。纯本地部署目前仅支持768p输出,但已经足以满足大多数中小创作者的需求。
六、对视频生成领域的影响:四个维度的行业重构
6.1 开源设定市场”及格线”,闭源被迫重新定价
H3开源后,2K视频生成成本被压至约0.8元/秒的量级。有分析指出,开源模型设定了市场的”及格线”——闭源模型如果不能显著超越这条线(例如达到H3性能的120%以上),用户没有理由支付高昂的API费用。这一逻辑与DeepSeek对大语言模型市场的冲击如出一辙,H3因此被称为”视频界的DeepSeek时刻”。
6.2 任务泛化终结”单任务专家”模式
H3之前,视频生成领域被切割为文生视频、图生视频、首尾帧、主体参考、运镜参考、视频编辑等独立任务,每个任务需要单独的专家模型。H3用自然语言作为任务之间的桥梁,将所有能力统一到一个模型中。这意味着开发者不再需要为不同任务部署和维护多个模型,显著降低了系统复杂度和成本。
6.3 Sora退场后的真空被中国开源填补
2026年3月,OpenAI关停了上线不久的Sora,终止了与迪士尼的巨额合作。Sora的退场并非技术失败,而是日均高达百万美元的推理成本使其难以为继,揭示了闭源视频模型面临的深层商业困境。H3的开源恰好在Sora退场后填补了高端视频生成的市场真空,中国模型公司的开源范围正在从语言模型拓展到视频模型。
6.4 硬件适配从”事后考虑”变为”设计起点”
H3从设计最早期就将硬件兼容性作为核心考量。开源24小时内16家芯片及平台厂商完成适配,这种生态响应速度在视频模型领域前所未有。对于芯片厂商和推理框架开发者而言,一个高质量开源视频模型意味着可以直接在自己的硬件上验证和优化,无需依赖闭源黑盒——这加速了整个AI视频基础设施的成熟。
七、竞品对比:H3在2026年视频模型版图中的位置
| 维度 | MiniMax H3 | Seedance 2.0 | Kling 3.0 | Sora 2(已停服) |
|---|---|---|---|---|
| 开发者 | MiniMax | 字节跳动 | 快手 | OpenAI |
| 最高分辨率 | 2K | 2K | 4K | 1080p |
| 最长时长 | 15秒 | 15秒 | 10秒 | 12秒 |
| 帧率 | 24fps | — | 60fps | — |
| 视频编辑 | 全球第一 | 不支持 | 有限支持 | 不支持 |
| 原生音频 | 立体声 | 支持 | 支持 | 支持 |
| 参考文件上限 | 12个 | 12个 | — | 1张图片 |
| 开源 | 是 | 否 | 否 | 否 |
| 2K价格 | 0.13美元/秒 | 约0.45美元/秒 | 最低 | 未提供2K |
从对比中可以看出,H3在编辑能力、参考输入丰富度和开源可及性上具有独特优势。Kling 3.0在分辨率(原生4K/60fps)和多镜头叙事上领先,是角色驱动故事板的最佳选择。Seedance 2.0在生成质量和火山引擎生态整合上有竞争力,但缺乏视频编辑能力。H3的优势在于”全能”——一个模型覆盖生成、编辑、参考和音频,且价格最低。
八、局限与挑战:开源不等于无风险
- 2K和上下文理解模块未开源:H3-Context-IR和H3-Regenerate-2K仍为闭源API,本地部署只能获得768p输出。完整2K工作流依赖官方API,存在服务可用性和成本风险
- 稀疏注意力未首发:首个开源版本仅提供全注意力推理,长序列计算开销较大。稀疏注意力实现将在后续更新中发布,当前本地部署的推理效率受限
- 版权诉讼阴影:迪士尼、环球和华纳兄弟于2025年9月联合起诉MiniMax海螺平台,指控其未经授权使用版权角色进行训练。2026年5月法院驳回了MiniMax的驳回动议,案件仍在审理中。商业使用H3需评估这一法律风险
- 模型规模仍有空间:MiniMax官方承认H3当前模型规模在多项能力上仍有改进空间,计划在下一代H系列中整合M系列模型的多模态理解能力,并通过规模扩展释放任务泛化的全部潜力
注意:对于品牌方和商业内容创作者,版权诉讼是当前使用H3时需要重点评估的风险因素。案件涉及的角色复现问题(蜘蛛侠、达斯·维达等)直接影响商业场景中的合规性判断。建议在敏感内容生产中保留人工审核环节。
九、未来展望:从”生成片段”到”参与全流程”
MiniMax在官方博文中提出了一个值得关注的趋势判断:创作者正在从输入简单视觉提示词,转向用自然语言直接描述完整创作意图。随着多模态理解、指令遵循和复杂任务执行能力的持续提升,视频模型将从”生成一段片段”逐步走向”真正参与整个内容生产流程”。
H3的下一步规划包括三个方向:整合M系列模型的多模态理解能力以加强生成基础;通过规模扩展提升多项能力上限;持续推动更高分辨率和视觉保真度。这三个方向指向同一个终点——一个能理解创作者完整意图、在统一架构下完成从策划到成片全流程的通用创作系统。
“语言、图像、视频和音频是人类体验的基本模态,它们深度互联,构成了我们与世界交互的主要接口。表达和分享信息的能力本身就是一种生产力。”
— MiniMax官方博客
写在最后:MiniMax H3的发布和开源,标志着视频生成领域从”单任务专家模型”向”全模态通用模型”的范式转移。它在编辑能力上的全球第一、在生成能力上的头部梯队表现、以及将2K视频成本压至主流模型三分之一以下的定价策略,共同构成了对整个行业的三重冲击。对于开发者而言,33B参数的开源权重和SGLang/vLLM/diffusers/ComfyUI全框架支持意味着今天就可以开始本地部署和定制化开发。对于行业而言,H3设定了新的市场及格线——闭源模型要么在能力上显著超越,要么在价格上重新定位,否则将很难 justify 自己的存在价值。AI视频赛道已经进入”算账时代”。
延伸阅读
- AI大模型最新进展深度盘点(2026年8月篇):中国开源模型全球登顶、GPT-5.6三变体落地、参数竞赛进入万亿时代 — 拓展阅读,了解更多AI领域深度内容
- 2026年8月2日AI行业资讯速览 — 了解AI行业最新动态,掌握技术发展趋势
- 2026年7月19日AI行业资讯速览 — 了解AI行业最新动态,掌握技术发展趋势
- 2026年7月18日AI行业资讯速览 — 了解AI行业最新动态,掌握技术发展趋势
- 2026年7月17日AI行业资讯速览 — 了解AI行业最新动态,掌握技术发展趋势
