蚂蚁集团近日正式发布并开源了其百灵系列的首个原生多模态大模型——Ling-3.0-flash-VL。该模型基于Ling-3.0-flash的MoE(混合专家)架构进行扩展,总参数量达到1240亿,但在单次推理时仅激活55亿参数,原生支持图像、文本和视频三种输入模式,上下文窗口容量高达256K Token。

与传统多模态模型不同,Ling-3.0-flash-VL引入了视觉反馈闭环机制,将任务处理流程从简单的"看图生成"升级为"观察-行动-验证-修正"的动态循环。这一设计使其在医疗报告解读、前端代码生成和GUI自动化等复杂场景中,能够根据视觉反馈持续优化执行结果。例如在图片转网页任务中,模型不仅能理解布局与组件关系生成代码,还能通过渲染结果对比实现自我修正。
技术层面,该模型通过原生多模态联合训练,使视觉信息的引入对文本能力产生正向提升。在Artificial Analysis Intelligence Index v4.1.1评估中,其得分较纯文本版本(Ling-3.0-Flash)提高4分。在Image-to-WebDev Arena官方评测中,代号linthium的模型表现优于GPT-5.4。作为GUI Agent时,模型可识别界面结构并完成跨工具操作;在医疗场景中,支持跨文档数据整合与风险标识。

架构设计上,Ling-3.0-flash-VL采用任意分辨率视觉编码器与VideoRoPE技术,语言主干延续42层混合架构(KDA与Gated MLA按5:1比例交替排列)。这种设计使其在实时视频对话、多轮视觉交互及长时任务中保持低延迟响应,256K上下文窗口可支持长文档和长视频分析。目前,该模型的BF16和FP8版本已在Hugging Face及ModelScope平台开源,FP4和INT4版本计划近期发布,用户可通过Ling Studio免费体验完整功能。












