一家叫 Acrab 的初创公司,今天正式把它的第一款边缘 AI 终端 SoC 端上了台面——GΞLIX 1。这块基于 5nm 制程的芯片,主打一个硬指标:能让 1000 亿参数规模的大模型,直接在本地跑起来,不必把数据送去云端。
硬件上,GΞLIX 1 走的是异构计算架构,把 20 核 Arm CPU、3TFLOPS 的 GPU、独立 NPU 以及音视频处理引擎全收进一颗芯片,AI 总算力拉到 650TOPS。横向摆一下就更清楚了:高通骁龙 X Elite 的 NPU 算力约 45TOPS,英特尔酷睿 Ultra 系列的 NPU 在 40TOPS 上下——GΞLIX 1 的 AI 算力差不多是它们的十几倍。
为喂饱大模型推理那张贪婪的胃口,缓存与内存子系统也专门按高吞吐需求设计。芯片配了 8MB L1 缓存,共享 L2 缓存带宽冲到 768GB/s,外挂 256-bit 位宽的 LPDDR5X 内存,传输速率 8533MT/s。大模型推理时,权重读取和 KV Cache 存取对内存带宽格外敏感,这套配置正是 100B 模型能落到端侧的地基。
这一回,Acrab 重点秀的是预填充阶段的性能。预填充,就是大模型接到用户输入后、开始一个字一个字往外蹦之前,先把整段输入做全量编码的过程,它的快慢直接决定长文本输入下的首 Token 延迟。Acrab 用矢量硬件单元给 Transformer 注意力机制计算加速,又对预填充路径做了针对性优化。官方放出的测试里,在 40k KV 缓存、10k Token 输入的 Gemma 26B A4B 配置下,这块芯片跑出了 1416.8 Token/s,是苹果 M4 Pro Mac Mini 的 7.5 倍。
软件侧,Acrab 同步端出了完整软件栈加智能体参考设计,从底层驱动一路覆盖到上层应用框架。第一方终端设备 Agent Box 也一并亮相,作为 GΞLIX 1 的参考实现,供开发者评估和做原型验证。










