AI评测领域迎来新动作,Artificial Analysis与Liquid AI联合推出针对手机端本地AI性能的全新基准测试体系,重点聚焦苹果iPhone 17 Pro设备上的模型实际运行表现。该测试框架由两家机构分工构建:Artificial Analysis主导智能能力评估模块,Liquid AI则负责推理效率测试环节,最终形成涵盖函数调用、指令执行、知识理解、复杂问答及数学运算五大维度的综合评价体系。
此次测试严格限定模型规格:所有参评模型需经4 bit量化处理,存储体积不超过8GB,确保可在移动端独立运行。在16K tokens上下文窗口限制下,南北阁实验室研发的Nanbeige4.2-3B与Liquid AI自研的LFM2.5-2.6B并列智能得分榜首。当测试条件增加1分钟响应时间限制后,LFM2.5-8B-A1B凭借高效推理能力跃居榜首,LFM2-2.6B-Exp、Gemma 4 E4B及Granite 4.1 8B分列二至四位。
值得关注的是,BOSS直聘旗下实验室推出的Nanbeige4.2-3B模型展现出独特技术路径。该模型仅含30亿非嵌入参数,通过采用Looped Transformer架构实现计算层循环复用,在保持参数规模不变的前提下显著提升有效计算深度。这种创新设计使其在智能评估中达到与更高参数模型相当的性能水平,为移动端轻量化模型开发提供了新思路。
新基准测试的推出标志着手机本地AI竞争进入新阶段。相比早期单纯追求模型可运行性的发展模式,当前行业更注重在有限硬件资源下实现快速响应与精准回答的平衡。此次测试结果不仅明确了端侧小模型的智能能力边界,更反映出移动AI领域正从基础能力建设转向效率优化与体验升级的深度竞争。













