Black Forest Labs 近日宣布,其研发的 FLUX 3 多模态基础模型已通过 Early Access 方式正式上线。该模型采用统一架构,实现了图像、视频和音频的联合学习,标志着多模态生成技术迈入新阶段。
据官方介绍,FLUX 3 的训练基于 Self-Flow 自监督流匹配学习框架的扩展,能够同步处理视频、图像和音频数据。这一设计使其在 FLUX.1 和 FLUX.2 系列的基础上,进一步拓展至多模态生成与理解任务,为跨模态内容创作提供了更强大的支持。
在视频生成能力方面,FLUX 3 表现尤为突出。该模型可在单次生成中输出最长 20 秒的视频,并附带原生音频。其功能覆盖文生视频、图生视频、视频续写、关键帧转视频以及多镜头串联等多种场景,同时支持多语言对话和输入视频与音频的联合续写,为创作者提供了更灵活的创作方式。
性能对比数据显示,FLUX 3 在带声音的 10 秒、720p 视频生成任务中表现优异。人工评测结果显示,其对比 Grok Imagine Video 的胜率为 69%,对比 Seedance 2.0 和 Gemini Omni Flash 的胜率均为 52%,展现了在多模态生成领域的竞争力。
除了多媒体生成,FLUX 3 的应用场景还延伸至机器人领域。Black Forest Labs 正在与 Mimic Robotics 合作,探索将该模型用于机器人行为预测,通过分析多模态数据提升机器人的环境感知和决策能力。
在图像处理方面,FLUX 3 同样具备全面能力。官方称,该模型支持多种风格的图像生成与编辑,可适应不同的宽高比和分辨率需求,为图像创作和后期处理提供了高效工具。











