智谱正式推出并开源了GLM-5系列的首个原生多模态模型——GLM-5.3-Flash (320B-A18B)。该模型总参数量达3200亿,但激活参数仅180亿,通过创新架构实现了高效计算与性能突破。在发布前,这款模型以匿名身份“Ox-Alpha”(中文社区昵称“牛来”)在OpenCode和OpenRouter平台进行大规模测试,迅速成为当周最受欢迎的模型,并创下双平台调用量新高。值得注意的是,所有测试请求的算力均由国产芯片提供支持。
性能方面,GLM-5.3-Flash在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,跻身全球前沿模型行列,与Anthropic旗下备受关注的Claude Opus 4.8模型得分持平。在自研的Z.aiCode Bench编程评估中,其代码生成能力同样与Claude Opus 4.8相当。更引人注目的是,该模型定价仅为GLM-5.3的1/10,限时折扣期间更降至1/20,仅为Claude Opus 4.8价格的1/40,显著降低了开发者的使用成本。
这一突破得益于GLM-5.3-Flash的全新架构设计。其总参数量与GLM-4.5相近(320B vs. 355B),但激活参数从320亿缩减至180亿,模型层数也从92层减少至45层,几乎减半。结合30T Token的多模态预训练语料,模型在计算资源需求大幅降低的同时,性能反而全面超越参数量翻倍的GLM-5.2。官方数据显示,GLM-5.3-Flash在各项基准测试和实际场景中均表现优异,实现了“以小博大”的技术跨越。
架构创新是GLM-5.3-Flash的核心优势。该模型首次采用稀疏注意力与线性注意力混合架构,在保持长上下文处理精度的同时,大幅降低了服务成本。通过引入流形约束超连接(mHC)技术,模型的扩展能力(Scaling Law)得到显著提升,为未来进一步优化奠定了基础。目前,GLM-5.3-Flash已面向全球开源,并接入ZCode等编码平台,纳入GLM Coding Plan(每日限量发放10,000张体验卡),同时开放API调用,为开发者提供高效、低成本的AI工具。











