MiniMax H3 – 开源多模态AI视频生成模型|2K与15秒原生立体声视频输出|文本图片视频音频统一理解

如果你最近一直在关注开源视频生成模型,那么 MiniMax H3 值得重点关注。MiniMax 官方将它定义为一个通用全模态生成系统,能够统一理解文本、图像、视频和音频组成的多模态上下文,并进一步生成最高 2 K 分辨率、最长 15 秒、带原生立体声音频的视频。软件格律诗 认为与传统的视频生成工具相比,它更强调对复杂多模态指令的理解能力,让文字描述、参考图片、视频片段和声音素材可以共同参与一次生成任务。

MiniMax H3 有什么特点

它目前提供两类核心任务模式。H 3-Base-FL 2 VA 支持文本生成视频,以及使用首帧、尾帧或首尾两帧控制视频生成;H 3-Base-Ref 2 VA 则进一步支持多模态参考输入,可以同时使用图片、视频和音频作为创作依据。参考模式最多支持 9 张图片、3 个视频片段和 3 个音频片段,所有输入文件合计最多 12 个,其中视频和音频单个片段需要在 2~15 秒范围内,所有同类素材累计时长也不能超过 15 秒。

在输出方面,生成时长支持 4~15 秒,帧率为 24 FPS,并支持 21:9、16:9、4:3、1:1、3:4、9:16 等多种画幅比例。默认短边为 768 像素,同时可以通过 H 3-Regenerate-2 K 工作流进一步生成 2 K 视频。音频输出采用 32 kHz 立体声,并稳定支持中文、英语、日语、韩语、法语、德语、西班牙语、意大利语、葡萄牙语、俄语和阿拉伯语 11 种对白语言,其他语言也具备不同程度的支持。

为什么 H3 的 2K 输出值得关注

H3 的高分辨率生成采用了比较有意思的 In-context Regeneration 思路。系统首先由 H 3-Base 生成 768 p 音视频结果,然后将原始多模态上下文与低分辨率结果重新输入 H3,通过 H 3-Regenerate-2 K 生成更高分辨率版本。这样能够继续利用模型原本具备的生成能力,同时重新利用文字、图片、视频和音频上下文,在小文字和细节等方面减少传统超分辨率方案依靠猜测恢复信息所带来的损失。

模型架构也比较完整

整个 H3 系统由 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块组成。H3-Context-IR 负责理解文本、图像、音频和参考视频之间的关系,并处理指令解析、跨模态关联、时间理解以及复杂逻辑推理,再将这些内容转换为 H3-Base 可以直接使用的结构化上下文。该模块依赖多个托管模型和服务,因此目前没有包含在开源仓库中,但官方提供 API 用于复现官方工作流。

H3-Base 则负责真正生成音频与视频,其内部通过对应的编码器和 VAE 将不同模态组织成统一的多模态序列,再交给 H3-Omni-Transformer 联合预测视频和音频 latent。该 Transformer 为 33B 参数的 dense、single-stream Transformer,其中约 13 B 参数位于 AdaLN 相关分支,完整模型权重已经公开,可以用于进一步开发和微调。

MiniMax H3 怎么使用

在线使用

对于普通用户来说,最简单的方式是直接使用官方在线应用。GitHub 仓库目前提供 Global 与中国区的 WebApp,以及 MiniMax Hub 桌面端入口,同时也提供 Global 和 CN 两套 API 平台。

使用思路很简单:准备一段描述视频内容的文字,或者准备首帧、尾帧以及其他参考素材,然后根据创作目标选择对应的生成方式。第一次使用建议从单一文本或一张图片开始,先观察人物、镜头运动、环境和声音表现,再逐步加入更多参考素材。

本地部署

对于开发者而言,官方已经开放 H 3-Base 模型权重,并提供 FL 2 VA 与 Ref 2 VA 两个任务专用 checkpoint。官方推荐使用 SGLang、vLLM、Diffusers 或 ComfyUI 部署,其中 ComfyUI 还提供了对应的 T 2 V 和 R 2 V 工作流。

以 SGLang 为例,官方 README 给出了四张 GPU 的部署示例:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

如果使用 Ref 2 VA,则将模型变体修改为 ref2va,并使用另一个端口即可。需要注意的是,本地部署的 H 3-Base 主要用于验证 768 p 生成结果;完整的 2 K 工作流还需要结合 MiniMax 官方的 H 3-Context-IR 和 H 3-Regenerate-2 K API。

我的使用感受

从实际创作角度来看,我认为 H 3 最有吸引力的地方在于它把视频画面和声音放进了同一个生成逻辑里。过去制作一段包含人物、动作、镜头变化和环境声音的视频,往往需要分别处理视觉内容与音频,再通过后期软件进行组合,而 H 3 的设计让这些信息可以在同一个多模态上下文中共同参与生成。

对于内容创作者来说,这种工作方式尤其适合广告片、产品展示、短视频、游戏内容和概念视觉等场景。它的 2 K 输出、原生立体声音频以及多模态参考能力,也让模型更接近一个完整的视频创作基础设施。官方此前也明确将广告、品牌、电商、产品设计、UI/UX 和游戏等作为重点商业应用场景。

总结

MiniMax H3 是目前值得关注的开源视频生成模型之一,它将文本、图片、视频和音频统一纳入生成上下文,并提供文本生成、首尾帧生成、多模态参考生成以及原生立体声音频等能力。官方开放 H 3-Base 权重后,开发者可以通过 SGLang、vLLM、Diffusers 和 ComfyUI 等生态进行本地部署,同时利用官方 API 完成完整的 2 K 工作流。对于希望研究开源视频生成、搭建本地视频生成环境,或者探索多模态内容创作的用户来说,这个项目具有较高的尝试价值。

官方网站

https://github.com/MiniMax-AI/MiniMax-H3

相关推荐

Avatar photo

JameCling

我是 格律诗的软件世界 的作者,一名专注于软件工具、AI 技术和数字效率领域的独立研究者。
多年来,我持续关注互联网工具的发展趋势,体验不同平台的软件产品,并研究它们如何帮助用户提升效率。
我的工作不仅是整理软件信息,而是通过实际测试、功能分析和使用场景研究,帮助用户判断一个工具是否真正值得使用。
格律诗的软件世界 的每一篇文章都希望提供真实、有价值的信息,包括工具特点、使用方法、优缺点分析以及适合的人群。
我相信,好的工具能够改变工作方式,而准确的信息能够帮助用户做出更好的选择。