ITBear旗下自媒体矩阵:

蚂蚁百灵Ling-3.0-tiny开源:轻量高效,本地部署开启智能应用新可能

   时间:2026-08-12 11:49:38 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

蚂蚁百灵大模型团队近日宣布开源一款轻量级混合推理MoE模型——Ling-3.0-tiny,该模型以7.9亿总参数量和13亿推理激活参数量的设计,在保持高效计算的同时实现了本地化部署的突破性进展。通过提供BF16、FP8和INT4三种精度版本,模型已在DGX Spark服务器、MacBook笔记本及Mac mini等主流设备上完成验证,为开发者提供了覆盖专业工作站到个人电脑的完整解决方案。

在Artificial Analysis Intelligence Index评测体系中,Ling-3.0-tiny以25分的综合成绩展现出强劲实力,其得分仅比参数规模达260亿的Gemma-4-26B-A4B低1分,却在推理效率上形成显著优势。该模型采用独特的3:1 KDA-MLA混合注意力架构,通过128个稀疏专家与共享专家的协同工作,在长文本处理能力与计算成本间取得平衡。测试数据显示,在FP8精度下,模型于DGX Spark设备可实现每秒100-105个token的推理吞吐,在MacBook Pro上则达到86-90 tokens/s,8K上下文场景下的峰值内存占用仅8.34GB。

模型的核心创新体现在原生混合推理机制与智能体能力整合。通过enable_thinking参数,开发者可灵活切换快速响应模式与多步推理模式,使模型在代码生成、数理推理、指令遵循等场景中保持均衡表现。特别在Agent任务执行方面,该模型以16分的Artificial Analysis Agentic Index得分超越310亿参数的Gemma-4-31B,在GDPval-AA v2测试中取得772 Elo评级,τ³-Banking任务得分达20.80,展现出卓越的任务理解与工具调用能力。

针对不同硬件环境,三个精度版本展现出差异化优势:BF16版本确保研究级精度需求,FP8版本在效果与效率间取得平衡,INT4版本则将内存占用压缩至极致。在MacBook Pro的实测中,FP8版本复刻Infinite Wiki核心功能时,首token响应时间低于100毫秒,支持无限层级的知识下钻,全程本地推理避免了云端API调用产生的数据泄露风险与额外成本。Mac mini部署方案则侧重打造常驻式智能节点,为个人用户提供低功耗的文档处理、语法纠错等离线服务。

技术架构层面,模型采用每4层包含3层KDA(Kimi增量注意力)与1层MLA(多头潜在注意力)的堆叠设计,配合Multi-Token Prediction训练目标,在保证长上下文处理效率的同时优化推理速度。这种设计使模型在输出500个token的端到端任务中仅需18秒,其中包含完整的思考过程,为连续Agent任务执行提供了实时响应保障。

开发团队同步开放了Hugging Face与ModelScope双平台模型仓库,提供完整的部署文档与硬件适配指南。目前已有开发者将其应用于企业内部知识助手、研发代码辅助等场景,单台DGX Spark设备即可支撑小规模用户服务。在移动设备自动化演示中,模型成功完成工具调用、任务验证等复杂流程,验证了本地化部署在数据可控性与执行可靠性方面的独特价值。

针对后续优化方向,研发团队将重点提升长尾知识覆盖准确性与复杂Agent任务的稳定性,持续完善FP8/INT4版本的硬件生态支持。通过与硬件厂商、学术机构及开发者社区的深度合作,项目致力于构建覆盖算力优化、框架适配到应用开发的完整轻量模型生态链。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version