ITBear旗下自媒体矩阵:

蚂蚁集团百灵大模型再升级!Ling-3.0-flash参数量减少却能力超越,限时免费API开放

   时间:2026-07-25 05:03:05 来源:ITBEAR编辑:快讯 IP:北京 发表评论无障碍通道
 

蚂蚁集团旗下百灵大模型团队宣布推出新一代原生混合推理模型Ling-3.0-flash,在模型架构与性能优化方面实现重大突破。该模型通过创新的混合线性注意力架构,在参数规模缩减的情况下实现了能力跃升,官方数据显示其总参数量为124B,激活参数量仅5.1B,较上一代旗舰模型Ring-2.6-1T分别减少87.6%和91.9%,却在多项核心指标上达到甚至超越前代水平。

技术架构层面,Ling-3.0-flash采用原生混合线性注意力机制,通过5:1比例交替堆叠KDA(细粒度对角门控注意力)与MLA(混合线性注意力)模块,配合1/64稀疏度的MoE(专家混合)架构,在保持124B总参数规模的同时,将有效计算参数压缩至5.1B。这种设计使模型在长上下文处理效率、状态记忆能力与计算成本之间取得平衡,特别在复杂Agent场景中展现出显著优势。

性能表现方面,新模型在智能密度与效率比上实现突破。测试数据显示,其传统推理、指令遵循及长文本处理能力可媲美更大尺寸的SOTA模型,而激活参数需求仅为行业同类产品的1/10至1/5。在真实生产力场景验证中,模型通过扩展超10,000个可交互训练环境,实现了Coding、通用任务与深度研究三类Agent的全程闭环运作,任务响应速度提升60%-80%,协同稳定性达到工业级应用标准。

为优化长程交互体验,研发团队创新引入SGLang HiCache+Mooncake分级缓存架构。该系统采用物理双池设计配合集群共享L3缓存,使模型在处理长输入时首次token生成时间(TTFT)降低60%-80%以上,且无需重复计算历史交互内容。这项突破有效解决了大模型在持续对话场景中的算力浪费问题,为实时智能助手等应用开辟了新路径。

即日起至8月3日23:00(北京时间),用户可通过OpenRouter平台及百灵官方渠道免费调用Ling-3.0-flash的API接口。模型权重将于免费期结束后正式开源,开发者可基于开源代码进行二次开发。目前官方已开放模型体验通道,具体接入方式可参考OpenRouter平台公示信息。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version