ITBear旗下自媒体矩阵:

FLUX 3多模态模型来袭:单次生成20秒带音视频,多领域应用潜力大

   时间:2026-07-24 21:46:10 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

Black Forest Labs 近日宣布,其研发的 FLUX 3 多模态基础模型已通过 Early Access 方式正式上线。该模型采用统一架构,实现了图像、视频和音频的联合学习,标志着多模态生成技术迈入新阶段。

据官方介绍,FLUX 3 的训练基于 Self-Flow 自监督流匹配学习框架的扩展,能够同步处理视频、图像和音频数据。这一设计使其在 FLUX.1 和 FLUX.2 系列的基础上,进一步拓展至多模态生成与理解任务,为跨模态内容创作提供了更强大的支持。

在视频生成能力方面,FLUX 3 表现尤为突出。该模型可在单次生成中输出最长 20 秒的视频,并附带原生音频。其功能覆盖文生视频、图生视频、视频续写、关键帧转视频以及多镜头串联等多种场景,同时支持多语言对话和输入视频与音频的联合续写,为创作者提供了更灵活的创作方式。

性能对比数据显示,FLUX 3 在带声音的 10 秒、720p 视频生成任务中表现优异。人工评测结果显示,其对比 Grok Imagine Video 的胜率为 69%,对比 Seedance 2.0 和 Gemini Omni Flash 的胜率均为 52%,展现了在多模态生成领域的竞争力。

除了多媒体生成,FLUX 3 的应用场景还延伸至机器人领域。Black Forest Labs 正在与 Mimic Robotics 合作,探索将该模型用于机器人行为预测,通过分析多模态数据提升机器人的环境感知和决策能力。

在图像处理方面,FLUX 3 同样具备全面能力。官方称,该模型支持多种风格的图像生成与编辑,可适应不同的宽高比和分辨率需求,为图像创作和后期处理提供了高效工具。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version