稀宇科技近日正式对外发布了一款名为MiniMax H3的通用多模态视频模型,该模型将于8月3日零时起在魔搭社区开源,供开发者与研究机构免费使用。这一举措标志着国内在多模态生成技术领域迈出了重要一步,为影视、广告、电商等行业的内容创作提供了新的技术工具。
据技术文档披露,MiniMax H3的核心优势在于其原生支持文本、图像、视频、音频四种模态的统一理解与生成。通过整合Contextual Omni Representation、H3-VAE编码架构及H3-Omni Transformer注意力机制,模型能够精准解析不同素材中的人物动作、声音情绪、镜头语言等复杂信息,并实现多模态内容的自然融合。例如,用户可同时输入剧本文字、角色照片和背景音乐,模型能自动生成符合要求的视频片段。
在生成能力方面,该模型突破了传统技术的分辨率限制,最高可输出15秒时长、2K分辨率的原生双声道音视频内容。通过独创的In-context Regeneration技术,模型在保持内容连贯性的同时,支持对人物表情、物体位置、场景光影等细节进行精细化编辑。测试数据显示,在2K分辨率下,其每秒生成成本不足市场主流模型的三分之一;即便在768P分辨率下,性价比仍达到720P模型的两倍。
针对商业应用场景,开发团队重点优化了三大功能模块:多模态精准编辑系统允许用户通过自然语言指令调整视频中的特定元素;商用级内容生成引擎可自动适配影视特效、广告创意、电商展示等不同需求;动态UI/UX演示模块则能将交互设计稿转化为高保真动画。这些特性使得模型在品牌宣传、游戏开发、短视频制作等领域具有直接应用价值。
技术实现层面,模型采用分层解码架构,将语义理解、运动预测和纹理生成等任务分配至不同计算单元,既保证了生成效率又提升了画面质量。稀宇科技研发团队透露,后续版本将增加对3D场景和实时交互的支持,进一步拓展模型在虚拟制片、数字人等领域的应用边界。











