近期,一款名为“牛来”(Ox Alpha)的神秘模型在科技圈引发热议,其真实身份终于揭晓——这是智谱公司最新发布并开源的GLM-5.3 Flash,也是该系列首个原生多模态模型。该模型凭借出色的性能迅速引发关注,不仅在海外平台创下调用量纪录,更以“国产算力+开源生态”的组合引发行业震动。
在匿名测试阶段,“牛来”便展现出惊人实力。OpenRouter平台数据显示,其首日即登顶榜单,并刷新单日tokens使用量纪录;OpenCode平台则证实,该模型终结了DeepSeek连续56天的霸榜历史。更令人瞩目的是,这些海外流量全部由国产芯片承载,标志着中国AI基础设施已具备支撑全球级应用的能力。
实测表现印证了模型的强大能力。在多模态任务中,GLM-5.3 Flash可精准识别视频中的说话人并生成动态字幕,甚至能捕捉仅出现一次的“名签”细节来匹配人物关系。当被要求将整部电影剪辑成解说视频时,模型能自动梳理剧情脉络、提取关键片段,并生成配音与字幕,最终呈现效果达到专业水准。在交互界面开发任务中,模型仅凭一张设计稿便实现了包含15个核心功能的购物APP,所有页面均支持流畅交互。
技术架构的创新是性能突破的关键。该模型总参数320B,但实际激活参数仅18B,通过将层数从92层压缩至45层,在缩小规模的同时实现了能力跃升。其采用的线性+稀疏混合注意力机制,使计算量较前代降低3.01倍,KV缓存缩小4.44倍,从而支持超长上下文处理。针对视觉任务,团队专门构建了数据合成流水线,使模型具备“边写边看边改”的迭代优化能力。
在算力优化方面,模型采用分离式架构设计,将多模态编码、提示预填充和逐token解码拆分为独立模块,配合混合缓存量化等技术,使国产芯片平台的端到端服务性能提升3倍,单token成本达到与主流GPU相当的水平。这种效率提升直接反映在定价策略上——GLM-5.3 Flash的价格仅为前代版本的1/10,限时折扣后更达到Claude Opus 4.8的1/40。
开源战略进一步扩大了模型的影响力。目前,GLM-5.3 Flash已通过Hugging Face等平台向全球开发者开放,同时提供ZCode和API接入服务。企业用户可基于开源权重自行部署,这种开放模式与国产算力形成协同效应,构建起从模型研发到应用落地的完整生态链。在AA评测中取得57分的成绩,更证明其性能已跻身全球顶尖行列。
相关技术文档显示,该模型在3D场景构建等复杂任务中展现出独特优势。智谱官方展示的案例中,GLM-5.3 Flash独立运行12小时后,成功生成具备完整物理特性的Blender场景。这种“低价格+高效率”的组合,正在改变前沿模型的应用范式——开发者无需在性能与成本间艰难抉择,AI技术得以更广泛地渗透到各类实际场景中。
开放平台链接:https://docs.bigmodel.cn/cn/guide/models/vlm/glm-5.3-flash
Z.ai技术指南:https://docs.z.ai/guides/vlm/glm-5.3-flash
开发计划入口:https://bigmodel.cn/glm-coding
技术博客详解:https://z.ai/blog/glm-5.3-flash
开源项目地址:https://huggingface.co/zai-org/GLM-5.3-Flash











