ITBear旗下自媒体矩阵:

清华系团队再突破!全球首个千亿MoE视频生成模型MAGI-2开源,成本仅行业十分之一

   时间:2026-08-05 15:03:14 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

当视频生成领域还在为模型规模与成本如何平衡争论不休时,一支来自清华系的团队用行动给出了新答案——他们推出的MAGI-2-preview模型不仅将参数规模推至千亿级,更通过混合专家(MoE)架构将单次激活参数控制在60亿左右,同时宣布开源全部代码与权重。这一突破性成果在科技圈引发连锁反应,其生成效果与成本优势被业内人士评价为"重新定义了视频生成的技术路线"。

在视频生成领域,参数规模、生成时长与计算成本构成的"不可能三角"长期制约技术发展。传统稠密模型在处理视频数据时,需要将每帧画面拆解为数千个空间块,连续帧间还要记录物体运动轨迹与镜头变化,叠加音频信息后序列长度呈指数级增长。若采用千亿参数模型,其训练与推理成本将突破多数机构的承受极限。这正是MAGI-2-preview选择MoE架构的核心原因——通过将模型总容量与单次计算量解耦,在保持千亿参数规模的同时,将每次推理的计算量降低至可接受范围。

该团队独创的Multi-Head LatentMoE架构成为破局关键。不同于传统MoE将单个token分配给少数专家的做法,新架构将3072维隐藏表示拆分为12个256维子空间,每个子空间独立进行路由决策。这种设计使得单个token可同时激活72个细分专家,每个专家仅处理特定维度的特征(如人物轮廓、动作时序或背景纹理)。实验数据显示,这种"专家分工制"使模型在保持低激活参数的同时,能力组合数量较传统MoE提升两个数量级。

支撑千亿模型运行的,是一套从底层重构的自研系统。针对视频序列超长的特性,团队开发了Head Parallel并行策略,在路由阶段前按子空间分配计算资源,使设备间通信量恒定,彻底解决了传统专家并行中通信成本随激活专家数激增的难题。优化器方面采用混合设计:矩阵参数使用Muon优化器保证训练稳定性,专家参数则采用AdamW实现快速收敛。数据策略上,团队摒弃了"过滤式"处理,转而通过精准标注构建包含10亿级有效样本的多元化数据集,使模型在预训练阶段即可覆盖广泛场景。

成本优势成为该模型最直观的竞争力。以8卡H100配置为例,生成10秒1080P视频的成本仅需0.5元,仅为行业主流模型的十分之一。在AA视频生成榜单中,MAGI-2-preview以60亿激活参数跻身第六,其生成效果在运镜流畅度、人物表现力等维度已接近闭源模型第一梯队。特别在AI漫剧生成场景中,模型展现出的声画同步能力令开发者惊叹——从角色台词的唇形同步到背景音乐的情绪匹配,均达到商业级应用标准。

开源决策背后蕴含着团队对技术生态的深刻思考。当前公开的视频生成模型普遍停留在百亿参数规模,千亿级模型的开源将首次为学术界提供完整的研究对象。研究人员可借此深入探索专家分工机制、路由稳定性等核心问题,中小企业也能基于开源代码进行私有化部署与行业微调。这种开放姿态正在重塑行业竞争规则:当开源模型在效果上持续逼近闭源产品时,部署灵活性、接口开放性等维度将成为新的竞争焦点。

该团队的技术基因或可解释其突破性创新。创始人曹越作为Swin Transformer共同一作,在多模态架构设计领域积累深厚,其带领的团队成员多具有顶级会议论文发表经历。这种技术导向的团队文化,使其更愿意在基础模型与底层系统投入资源,而非追逐热点应用。正如创新工场董事长李开复所言,这支团队正沿着"非共识路径"重塑视频生成领域的技术版图——从自回归生成到音画协同,再到如今的千亿MoE开源,每次技术选型都精准卡位行业痛点。

目前,MAGI-2-preview的完整代码已通过GitHub公开,开发者可自由调用模型进行二次开发。尽管团队强调当前版本仍为预览版,但其展现的技术潜力已引发连锁反应:多家影视制作公司开始测试其在特效生成领域的应用,教育机构则探索将其用于虚拟课堂构建。这场由千亿MoE模型引发的技术革命,或许正预示着视频生成领域即将进入新的发展阶段。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version