智谱今日宣布推出并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型,总参数量达320亿,激活参数量仅18亿,层数从92层缩减至45层。该模型在AA综合智能指数中取得57分,与Anthropic旗下Claude Opus 4.8持平,但定价仅为后者的1/40,限时折扣期间更降至1/20,标志着前沿智能技术首次实现“平民化”应用。

在性能测试中,GLM-5.3-Flash全面超越参数量翻倍的GLM-5.2,其编程能力在自研Z.ai Code Bench评估中与Claude Opus 4.8相当。这一突破得益于全新混合架构设计:模型采用稀疏注意力与线性注意力结合的方式,通过递归机制捕获局部依赖关系,并借助轻量级索引器召回全局上下文。为进一步优化长文本处理效率,团队引入IndexPool技术,将索引器缓存向量从4个压缩至1个,使1M上下文场景下的时延与内存开销显著降低。
对比实验显示,GLM-5.3-Flash的注意力计算量较GLM-5.3降低3.01倍,KV缓存大小减少4.44倍,单Token计算效率在所有基线模型中位居首位。尽管KV缓存仍略高于Kimi-K3和DeepSeek-V4-Flash,但团队已将其列为后续优化重点。模型通过流形约束超连接(mHC)技术提升Scaling能力,结合30T Token多模态预训练语料,实现了计算资源与性能的平衡。

值得关注的是,GLM-5.3-Flash的推理服务完全基于国产芯片集群构建。为克服单芯片算力与内存容量限制,团队在SGLang框架上开发专用推理引擎,通过节点内张量并行、ReplaySSM、W8A8量化等技术,结合生产级EPD分离式架构,将编码、预填充和解码拆分为独立工作池。经优化后,端到端服务性能较初始基线提升3倍,单Token成本与主流英伟达GPU持平,验证了国产硬件在大规模场景下的可行性。
该模型已正式开源,并接入ZCode等编码平台。通过GLM Coding Plan,用户可每日领取10,000张体验卡,同步开放的API调用服务将进一步推动技术普惠。此次发布不仅展示了低成本架构的创新潜力,也为国产芯片生态建设提供了重要实践案例。











