ITBear旗下自媒体矩阵:

Liquid AI与Hugging Face联手,LFM2.5 DSpark草稿模型推理性能大幅提升

   时间:2026-08-22 00:46:57 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

Liquid AI与Hugging Face联合推出的LFM2.5系列模型迎来重要技术突破,其DSpark草稿模型检查点正式对外发布。此次共推出三款核心模型,包括LFM2.5-1.2B-Instruct、LFM2.5-2.6B以及LFM2.5-8B-A1B,通过引入创新的投机解码路径,在保持输出质量不变的前提下,显著提升了模型推理效率。该技术突破为端侧智能设备部署大型语言模型开辟了新路径。

在性能测试中,DSpark架构展现出惊人的加速能力。GPU环境下整体吞吐量提升最高达3.18倍,端侧设备提升幅度也达到2.87倍。以M4Max MacBook Pro为测试平台,LFM2.5-2.6B模型在函数调用场景中实现57%的延迟降低,输出速度突破每秒139个token。这一表现不仅大幅降低本地运行智能体的技术门槛,其用户体验甚至超越部分专有云服务,标志着端侧AI应用进入全新发展阶段。

该技术的核心创新在于重构了传统推理流程。针对内存带宽瓶颈问题,DSpark采用轻量级草稿模型预先生成候选token,再由主模型进行批量验证。这种设计将权重加载成本分摊至多个候选token,有效缓解了内存访问压力。系统架构包含三大核心组件:基于DFlash风格的并行主干网络实现隐藏状态统一生成;马尔可夫链模拟的顺序头增强token间依赖关系;置信度调度验证器动态优化验证流程。模型采用仅注意力架构,通过5层9块的精简设计将参数量控制在3亿左右。

训练阶段采用混合数据策略,涵盖监督微调、对话交互、代码生成和函数调用等多类型数据。经过严格的消融实验验证,这种多样化训练方式确保了模型在保持准确率的同时,具备更强的泛化能力。在质量验证环节,贪心解码机制确保草稿token与主模型分布严格对齐,各项基准测试显示输出质量与基线模型完全一致,没有出现任何准确率下降的情况。

生态建设方面,DSpark在发布首日即完成主流推理框架适配。SGLang通过专项集成支持加速器部署,llama.cpp实现官方构建支持并开放命令行加载接口。Hugging Face平台同步开源Safetensors和GGUF格式的模型检查点,覆盖从云端集群到边缘设备的全场景部署需求。这种开放策略为开发者提供了灵活的选择空间,推动技术成果快速转化为实际应用。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version