蚂蚁开源团队近日宣布,正式推出并开源百灵系列首款原生多模态大模型Ling-3.0-flash-VL。该模型在Ling-3.0-flash的MoE架构基础上进行深度拓展,总参数量达1240亿,单次推理仅激活55亿参数,可原生处理图像、文本和视频三种模态输入,上下文窗口容量突破256K Token,在多模态处理能力上实现重大突破。
研发团队针对行业长期存在的技术痛点展开创新实践。针对"视觉能力增强会削弱文本处理性能"的普遍担忧,通过大规模联合训练验证得出相反结论:多模态协同训练不仅没有降低文本理解水平,反而通过跨模态信息互补显著提升了模型的语言智能表现。这种原生多模态架构有效拓展了AI应用场景,使模型在复杂任务处理中展现出更强的适应性。
模型引入的动态视觉反馈机制构成核心技术创新点。通过构建"观察-比对-修正"的闭环执行系统,将传统静态生成过程转化为具备自我优化能力的动态流程。当执行结果与预期目标存在偏差时,模型能自动触发修正机制,通过多轮迭代逐步逼近最优解。这种设计使任务执行可靠性得到质的提升,特别在需要精确控制的场景中表现突出。
在保持高效执行特性的基础上,Ling-3.0-flash-VL完美继承了前代模型在Agent工作流中的优势。通过视觉反馈闭环与任务调度系统的深度整合,模型能够在保证输出质量的同时,以更低的计算资源消耗和更短的响应时间完成复杂任务流程。这种效率与质量的平衡特性,使其在需要多模态交互的工业级应用中具有显著竞争优势。











