ITBear旗下自媒体矩阵:

智谱开源GLM-5.3-Flash多模态模型:320B参数性能超越前代,成本大幅降低

   时间:2026-08-27 09:58:54 来源:快讯编辑:快讯 IP:北京 发表评论无障碍通道
 

智谱今日宣布推出并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列首个原生多模态模型,标志着大模型技术进入更低成本、更高效率的新阶段。该模型总参数量达320亿,激活参数量优化至18亿,在编程能力、综合智能指数等核心指标上与Anthropic旗下Claude Opus 4.8持平,而价格仅为后者的1/40,创下前沿模型性价比新纪录。

在技术架构层面,GLM-5.3-Flash通过混合注意力机制实现突破性创新。模型采用线性注意力与稀疏注意力结合的架构设计,其中线性注意力通过递归机制捕捉局部依赖关系,稀疏注意力则利用轻量级索引器召回全局上下文。为进一步优化性能,研发团队引入IndexPool技术,将索引器缓存向量从4个压缩至1个,使1M上下文场景下的时延与内存开销显著降低。对比实验显示,该模型单Token计算量较GLM-5.3降低3.01倍,KV缓存大小减少4.44倍,在同类模型中达到最低计算量水平。

在预训练数据方面,智谱构建了30T Token规模的多模态语料库,结合流形约束超连接(mHC)技术提升模型扩展能力。自研的Z.ai Code Bench评估体系验证显示,GLM-5.3-Flash在编程任务中的表现与Claude Opus 4.8相当,而在AA综合智能指数中取得57分,跻身全球前沿模型行列。值得关注的是,该模型总参数量与GLM-4.5相当(320B vs 355B),但通过激活参数量(18B)和层数(45层)的优化,实现了性能与成本的双重突破。

在硬件支持层面,智谱完成重要技术跨越。过去一周,GLM-5.3-Flash在全球首次实现国产芯片集群支撑大规模模型推理服务。通过自研高带宽互联网络连接的芯片集群,采用生产级EPD分离式架构,将多模态编码、预填充和解码拆分为独立工作池。技术栈整合了节点内张量并行、ReplaySSM、W8A8量化等12项优化技术,使端到端服务性能较初始基线提升3倍,单Token成本达到英伟达GPU相当水平。特别值得关注的是,整个推理引擎构建过程由GLM-5.3驱动的infra agent自动完成,形成模型优化系统、系统反哺模型的闭环。

商业应用方面,GLM-5.3-Flash已接入ZCode等主流编码平台,并纳入GLM Coding Plan每日限量发放10,000张体验卡。开发者可通过API直接调用模型服务,其定价策略极具竞争力:仅为GLM-5.3的1/10,限时折扣期间更降至1/20。在正式发布前,该模型以Ox-Alpha代号在OpenCode和OpenRouter平台进行匿名测试,创下双平台调用量历史新高,所有请求流量均由国产芯片集群提供算力支持。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version