雷科技数码组 | 编辑:三明治 | 监制:罗超
什么?大模型终于也开始打减肥针了?
这可不是我瞎说,据CNBC报道,苹果正在接洽初创公司PrismML,后者以其最近推出的模型压缩技术而著称,苹果希望借此评估在iPhone上直接运行更大规模AI模型的可行性。
问题是,从我个人的体验来看,目前各家手机AI功能还是以云端为主,绝大部分功能断网以后就无法使用了。
为什么会出现这种情况?目前手机的端侧AI又发展到了什么水平呢?
正好,我最近也在Google AI Edge Gallery里试了Gemma 4 E4B,可以给大家分享一下使用体验。
还有Ask Audio,最多可上传30s音频并进行转写、总结等。
这个功能就比较逊色了,可能是因为我的录音比较模糊的缘故,语音转文字出来的内容和原音频几乎没有关系,目前可用性挺一般的,还是老老实实用豆包或者千问来总结比较好。
至于文本处理嘛...
我给几个能在手机端部署的模型喂了一篇2500字左右的文章,希望它们给出对应的文章总结。
最终,只有Gemma 3n E4B和Gemma 4 E4B能完成任务,但是前者耗时将近两分钟,而且给出的答案抓不住重点,后者给出的答案更加简明扼要,主要信息点基本都抓到了,拿来快速扫资料完全够用。
甚至就连一些过往解决不了的逻辑题,Gemma 4 E4B也能通过长时间思考拿下,只是思考时间远超在线大模型的响应时间罢了。
在雷科技看来,Gemma 4 E4B已经证明,手机本地模型确实能干活。
但只有在拿它做摘要、改写、简单识图,我愿意用;可任务稍微复杂一点,尤其涉及长中文、细节判断和内容创作时,它和在线大模型之间的差距依然很明显,就更别说Agent调用一类的任务了。
要知道,从压缩率和功能性上看,Gemma 4已经是目前最强的手机端侧AI了。
想要突破这个效果,苹果只能舍弃现有的压缩方式,通过在相同的空间内塞入更大参数量的模型,或许才能让手机拥有一个不那么容易犯傻的大脑。
参数规模不重要,
效率才是模型应用的关键
以前大家谈大模型,总觉得参数越多越有排面。
百亿只是起步,万亿也不嫌多,在发布会上报数字像菜市场称重,主打一个“我家萝卜,又大又壮”。
看起来没问题,但是实际运行起来就是另一回事了。
根据Jordan Hoffmann团队的Chinchilla scaling law研究,在相同训练算力下,训练数据更充分的70B模型能够全面超过欠训练的280B、530B模型,哪怕是万亿参数的MoE模型,显存占用和内存带宽依然是不小的问题。
更重要的是,参数如此庞大的模型,自然不可能进入消费级终端。
端侧模型想要常驻手机,就得提升效率,直面内存、功耗和散热问题。PrismML的压缩算法,算是给各家硬件厂商指明了一条路,再加上千问、百度与苹果的本地化合作,也算是让苹果三年前承诺的“苹果智能”距离真正落地又进了一步。
以后大模型的进步,未必还要靠参数数字吓人。
能在不大的存储空间里稳定工作,少犯傻,少发热,关键时候真能帮上忙,这才是端侧AI下一阶段最该卷的东西。









