德国人工智能领域迎来新突破,黑森林实验室推出的多模态基础模型Flux3正式亮相。该模型采用Self-Flow架构,集成了图像、视频、音频及动作的专用编解码器,实现了对物理世界与数字环境的统一理解与生成能力,标志着多模态技术迈入新阶段。
Flux3的核心优势在于音视频同步生成能力。作为首个支持原生音频生成的多模态模型,它能够一次性输出长达20秒的音视频同步片段,覆盖文本转视频、图像转视频、基于关键帧的转场以及多角色对话等复杂场景。这一突破使模型不再局限于单一模态,而是真正实现了"视听一体"的跨模态交互。
在性能测试中,Flux3展现出显著优势。在720p分辨率、10秒片段的基准测试中,该模型以93%的胜率超越Luma Ray3.2,对Runway Gen-4.5的胜率达77%。面对Seedance2.0与Gemini Omni Flash等顶尖模型时,仍保持微弱领先。测试数据表明,Flux3在视频生成质量、动作连贯性及音频匹配度等关键指标上均达到行业领先水平。
技术落地方面,黑森林实验室与Mimic Robotics合作开发的机器人动作模型Flux-mimic已进入实测阶段。该模型在奥迪工厂的生产线上完成首轮任务测试,将多模态能力从数字领域延伸至工业制造场景。这种跨领域应用验证了模型架构的通用性,为智能制造、人机协作等场景提供了新的技术路径。
产品发布采用分阶段策略:Flux3Video已率先上线,Flux3Image版本及开源权重版本"Flux3Dev"将于近期陆续开放。这种渐进式发布模式既保证了技术迭代的可控性,也为开发者社区提供了参与模型优化的机会。开源策略预计将加速多模态技术的生态建设,推动行业整体发展。











