8 月 3 日,人工智能企业 MiniMax 正式宣布开源其新一代通用视频模型MiniMax H3。作为一款全模态生成系统,该模型打破了传统单任务的界限,能够深度融合并理解由文本、图像、视频以及音频交织而成的多模态上下文,展现出极强的任务泛化能力。
在生成规格上,H3 支持 4 到 15 秒的时长输出,并提供 24 FPS 帧率以及 32 kHz 立体声。用户不仅可以根据需求选择 21:9、16:9、4:3、1:1 等多种常见宽高比,还能通过默认将较短边设为 768 像素的常规模式进行基础创作。而借助专用的 H3-Regenerate-2K 方案,模型更能输出高达 2K 分辨率的惊艳画面。在多语言交互方面,它能够稳定支持阿拉伯语、中文、英语、法德意、日韩及西葡俄等 11 种主流语言。
为了适应多样化的创作场景,H3 推出了灵活的模型版本与丰富的输入规格。其中,H3-Base-FL2VA 首尾帧模式支持输入 0 到 2 张图像,能够自由灵活地应对文生视频、首帧生视频、尾帧生视频以及首尾帧协同生成的不同任务。而 H3-Base-Ref2VA 全模态参考模式则支持最多 9 张图像、3 段视频(总时长不超过 15 秒)以及 3 段音频的混合输入,文件总数最高可达 12 个,为专业创作者提供了前所未有的精细控制手段。
在系统架构的底层设计上,完整的 MiniMax H3 包含三个核心模块。首先是 H3-Context-IR(上下文中间表示),它能够将复杂的多元指令深度剖析并转化为模型易于理解的结构,是保障高品质输出的关键环节;其次是负责生成 768p 基础音视频的 H3-Base 模块;最后则是通过将初始结果与原始上下文回传实现 2K 超分重构的 H3-Regenerate-2K 模块。这一组合既保留了生动的细节,又极大提升了视觉的保真度。
目前,该模型已基于 MiniMax H3 Community License 正式发布,相关开发者与技术爱好者可以通过Hugging Face获取完整的开源代码与资源。业内普遍认为,此次开源将进一步降低多模态视频生成的应用门槛,推动影视创作、视觉设计及 AI 交互迈向全新的高度。










