MiniMax H3 是一个通用型全模态生成系统,在 Artificial Analysis 榜单中视频编辑能力排名全球第一。它能够统一理解由文本、图像、视频和音频构成的多模态上下文,并可生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。得益于以任务泛化为导向的系统设计,H3 在预训练阶段便已具备广泛的多模态上下文理解与生成能力,因此能够出色地遵循复杂的多模态指令。
H3 系统由 H3-Context-IR、H3-Base、H3-Regenerate-2K 三个模块组成。开发者可以直接从 Hugging Face 下载 MiniMax H3 模型,H3-Base 目前支持通过 SGLang、vLLM、diffusers 和 ComfyUI 等推理框架和工作流进行部署。
MiniMax相关负责人表示,“我们将持续打造更加开放、通用、智能的模型,与合作伙伴携手共建繁荣的开源生态。”(文猛)