ITBear旗下自媒体矩阵:

德国黑森林实验室Flux3多模态模型发布:支持20秒音视频同步,性能超越多款顶尖模型

   时间:2026-07-24 18:27:13 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

德国人工智能领域迎来重要突破,黑森林实验室近日正式推出多模态基础模型Flux3。该模型采用创新的Self-Flow架构,集成了图像、视频、音频及动作的专用编解码器,能够同时解析和生成物理与数字环境中的复杂信息,为跨模态交互提供了全新解决方案。

作为全球首个原生支持音频生成的多模态模型,Flux3在音视频同步输出方面展现出显著优势。该模型可一次性生成长达20秒的音视频片段,并具备文本转视频、图像转视频、关键帧转场控制以及多语言对话生成等核心功能。在720p分辨率、10秒片段的基准测试中,Flux3以93%的胜率击败Luma Ray3.2,77%的胜率超越Runway Gen-4.5,与Seedance2.0及Gemini Omni Flash等头部模型相比也保持领先地位。

技术突破不仅体现在数字领域,黑森林实验室正通过战略合作伙伴关系拓展应用边界。公司与Mimic Robotics联合开发的Flux-mimic视频动作模型已进入实体制造场景测试阶段,目前正在奥迪工厂执行生产任务。该模型通过解析视频中的动作轨迹,将数字世界的AI能力转化为实体机器人的操作指令,标志着人工智能技术从虚拟空间向物理世界的实质性跨越。

产品发布采用分阶段推进策略:Flux3 Video版本已率先上线,支持专业级视频生成需求;面向图像生成场景的Flux3 Image版本将于近期发布;针对开发者的开源版本"Flux3 Dev"也在筹备中,预计将为学术研究和商业应用提供更灵活的技术支持。这种渐进式发布策略既保证了核心功能的稳定性,也为不同用户群体提供了适配的技术解决方案。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version