在移动端运行大型语言模型的技术领域,一项名为Swiftlet的Swift与metal融合运行时方案引发关注。该方案专为Qwen3-Next及Qwen3.5/3.6系列混合专家模型(MoE)设计,通过创新的内存管理策略,成功将模型运行所需的内存资源压缩至传统方案的十分之一。以Qwen3.6-35B-A3B模型为例,其4-bit量化版本在M5Mac上仅占用2.6GB内存,而完整模型权重达18GB,解码速度维持在7-11token/秒。
技术实现层面,Swiftlet采用"核心驻留+专家流式加载"的混合架构。模型的基础稠密组件(包括注意力机制、DeltaNet投影层等)始终驻留内存,而数量庞大的路由专家权重则以固定大小的数据块形式存储在SSD中。当需要特定专家参与计算时,系统通过pread接口直接从存储设备读取数据,避免传统mmap方式引发的页缓存污染问题。针对高频使用的专家,系统配置了基于LFU与近期性策略的缓存池,实测缓存命中率在43%-70%之间,但令人意外的是,缓存容量变化对整体性能影响极小,这得益于Apple设备SSD的卓越随机读取性能。
在iPhone17上的实测表现更具突破性。35B参数规模的模型在该设备上仅消耗约2.5GB内存,解码速度达到1token/秒,开发团队确认这是同类量级模型首次实现纯本地运行。80B参数版本的Qwen3-Next-80B-A3B同样展现惊人效率,虽然磁盘占用达42GB,但峰值内存需求控制在4.3GB,解码速度4.5-5token/秒。这种性能表现建立在独特的专家路由机制上:35B版本每层将token分配至256个专家中的8个,80B版本则从512个专家中选取10个参与计算。
metal图形框架在方案中扮演关键角色。所有前向传播计算均通过运行时编译的着色器执行,这种设计使得同一套代码可无缝部署至macOS和iOS平台。特别值得注意的是,75%的网络层采用Gated DeltaNet线性注意力机制,其固定大小的循环状态设计彻底消除了传统Transformer模型中KV缓存随上下文增长而膨胀的问题,为长文本对话提供了技术保障。在量化实现方面,开发团队在metal环境中重构了MLX风格的int4/int8分组量化计算,通过字节寻址内核与64位偏移技术,成功支撑起数GB规模的分片数据处理。
该方案已形成完整的产品矩阵:作为开发库的SwiftletCore可嵌入任意Apple生态应用,提供流式输出与对话缓存功能;命令行工具集包含模型运行、基准测试及检查点转换等功能;服务器组件提供OpenAI兼容接口,支持现有聊天界面无缝迁移;iOS应用Priv AI则将技术封装为即用型对话引擎。所有组件均通过严格验证,前向传播结果与mlx-lm参考实现逐层比对,增量解码与完整序列输出完全一致,metal内核代码更经过CPU参考模型的反复校验。
技术溯源显示,Swiftlet吸收了TurboFieldfare项目在Mac平台验证的专家流式加载经验,特别是在pread数据读取、专家缓存策略等方面有所借鉴。但约一万行的Swift与metal代码均为自主开发,重点攻克了Qwen模型特有的Gated DeltaNet注意力、门控GQA结构及高稀疏MoE架构等技术难点。当前方案对硬件的要求明确:Apple Silicon芯片、macOS14/iOS17及以上系统,以及足够的存储空间(35B模型需18GB,80B模型需42GB)。iPhone用户可通过Priv AI应用的Experimental Models频道下载体验,该功能正在App Store审核中,开发者也提供了源码编译的替代方案。整个项目采用Apache2.0协议开源,模型权重需单独下载并遵守相应许可条款。










