蚂蚁集团旗下百灵大模型团队近日宣布,其自主研发的新一代原生混合推理模型Ling-3.0-flash正式开源。该模型采用1240亿参数总量、51亿激活参数的MoE架构,同时提供基础版本及FP8、FP4、INT4等量化版本,为不同场景的开发者提供多样化部署方案。
针对不同用户需求,Ling-3.0-flash推出三种落地模式:云端API调用服务支持开发者快速接入,无需自建推理基础设施;MXFP4与INT4量化版本可在单台NVIDIA DGX Spark服务器上完成端到端部署,满足数据不出域的企业需求;高性能模式在特定GPU配置下实现每秒1100 tokens的输出速率,特别适用于对时延敏感的实时应用场景。在Artificial Analysis评测中,该模型输出速度达353 tokens/s,展现出显著的性能优势。
成本效益方面,AA Intelligence Index榜单数据显示,Ling-3.0-flash每项任务的加权平均调用成本约0.04美元(约合人民币0.27元),解码时间约1.4分钟。该模型在"智能水平-任务成本"和"智能水平-任务耗时"两个维度均进入高效能区域,为开发者提供兼具性价比与性能的解决方案。对于需要快速验证产品原型的团队,云端API因其低接入门槛成为首选方案。
为促进技术普惠,Ling Studio平台将于2026年8月7日至8月31日期间推出限时优惠活动,期间Ling-3.0-flash服务费率将降至原价的25%,9月1日起恢复标准定价。开发者可通过Hugging Face(https://huggingface.co/inclusionAI/Ling-3.0-flash)和ModelScope(https://modelscope.cn/models/inclusionAI/Ling-3.0-flash)平台获取完整开源代码及技术文档。











