这并非MiniMax-H3原生模型,MiniMax-H3 x Z-Image 混合模型

一种自定义的混合版本MiniMax-H3,融合了模型的FL2VA和REF2VA两个分支

系统概览

MiniMax H3 是一个通用型、全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解,并能生成最高达 2K 分辨率、最长 15 秒、包含原生立体声音频的视频。得益于其面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力,从而在遵循复杂多模态指令方面表现出色。

完整的 H3 系统由以下三个模块组成:

  • H3-Context-IR:随着输入日益复杂,我们构建了一个专用系统,用于深入理解并优化输入的多模态指令,然后将其转换为 H3 能够轻松理解的形式——上下文中间表示(Context Intermediate Representation),以供生成使用。H3-Context-IR 对最终输出的质量至关重要,因此我们强烈建议将其集成到您的生成流程中,或遵循“提示指南”(Prompting Guidance)构建您自己的上下文处理系统。
  • H3-Base:基于 H3-Context-IR 的输出生成音频和视频,输出分辨率为 768p。
  • H3-Regenerate-2K:将 768p 的结果与原始上下文一同重新输入 H3,以重新生成 2K 分辨率的输出。该过程结合了 H3 强大的生成能力以及原始上下文中包含的丰富信息,从而能够生成细节更准确、视觉保真度更高的高分辨率输出。