德国人工智能领域迎来重要进展,黑森林实验室(Black Forest Labs)推出的多模态基础模型Flux3,为生成式视频技术开辟了全新路径。该模型依托Self-Flow架构构建,集成了图像、视频、音频及动作的专用编解码器,能够以统一的方式理解并生成物理与数字环境中的内容,打破了传统单一模态的信息边界。
作为全球首个原生支持音频生成的多模态模型,Flux3可同步生成长达20秒的音视频片段,并具备文本/图像/视频转视频、基于关键帧的动态转场以及多语言对话等核心功能。在早期测试中,该模型在720p分辨率、10秒片段的生成任务中表现突出,其性能超越Luma Ray3.2(胜率93%)和Runway Gen-4.5(胜率77%),在与Seedance2.0及Gemini Omni Flash等同类顶尖模型的对比中亦占据微弱优势。
针对机器人领域的应用需求,黑森林实验室与Mimic Robotics联合开发了视频动作模型Flux-mimic。该模型已在奥迪工厂的生产任务中完成初步测试,通过将视觉信息转化为精准的动作指令,为工业机器人赋予了更强的环境适应能力。这一技术突破标志着AI开始从数字内容生成向物理世界交互延伸。
在产品发布策略上,黑森林实验室采用分阶段推进模式。目前Flux3Video已正式上线,支持视频生成的核心功能;Flux3Image版本及开源权重模型“Flux3Dev”计划于近期陆续发布。通过降低技术门槛,Flux3系列模型有望推动AI向具备感知与行动能力的“世界模型”演进,为跨模态AI应用提供新的技术范式。









