Black Forest Labs近日正式推出FLUX3多模态基础模型,该模型通过统一架构实现图像、视频与音频的联合学习,标志着多模态生成技术进入新阶段。基于Self-Flow自监督流匹配框架的扩展设计,FLUX3突破了传统单模态训练的局限,在继承FLUX.1与FLUX.2系列技术优势的基础上,首次实现了多模态生成与理解的深度融合。
在视频生成领域,FLUX3展现出突破性能力。该模型支持单次生成20秒带原生音频的完整视频片段,覆盖文生视频、图生视频、视频续写等八大创作模式。其中,视频与音频的同步生成技术尤为突出,用户可输入视频片段或音频素材进行内容扩展,甚至通过关键帧指令实现多镜头动态串联。在第三方人工评测中,FLUX3生成的10秒720p带声视频以69%的胜率超越Grok Imagine Video,与Seedance 2.0和Gemini Omni Flash的对比中均取得52%的领先优势。
图像处理能力方面,FLUX3实现了全场景覆盖。从艺术创作到商业设计,该模型可生成多种风格的高分辨率图像,并支持任意宽高比调整与精细化编辑。更引人注目的是其技术延伸应用——Black Forest Labs与Mimic Robotics开展的跨界合作,将探索将多模态AI能力导入实体机器人领域。通过解析视觉、听觉与运动数据的时空关联,FLUX3有望为机器人提供环境感知与行为预测能力,构建数字世界与物理世界的交互桥梁。
技术架构层面,FLUX3的创新体现在三维数据流的统一建模。传统模型往往需要分别训练视觉、听觉模块,而FLUX3通过自监督流匹配机制,在共享参数空间中同步优化多模态特征。这种设计不仅提升了生成效率,更使模型具备跨模态推理能力,例如根据音频节奏自动调整视频运镜速度,或通过图像内容预测后续声音事件。官方透露,后续版本将进一步优化长视频生成稳定性,并拓展至3D场景重建等复杂任务。











