ITBear旗下自媒体矩阵:

连夜实测智谱GLM-5.3-Flash:价格降低97.5%

   时间:2026-08-27 18:12:20 来源:智东西编辑:快讯 IP:北京 发表评论无障碍通道
 

作者 | 毕伟豪

编辑 | 漠影

智东西8月27日报道,就在昨晚,火爆全网的神秘“牛来模型”被智谱官方认领,是其全新开源的原生多模态模型GLM-5.3-Flash (320B-A18B),支持图片、视频、文件和文本多模态输入。

此前,智谱为收集真实用户反馈,将这款模型以Ox Alpha的名称在OpenCode和OpenRouter上进行了测试,上线首日就登顶了OpenRouter调用量榜单,并刷新了单日tokens用量历史纪录,被称为“牛模王”。

在匿名期间,曾有谷歌研究员发文暗示Ox Alpha可能是Gemini的新模型,遭到一众网友的质疑和嘲讽。

虽然不少网友猜测这款模型是智谱的,但很多人并不相信,他们认为双平台上如此高的调用量,不可能是智谱的新模型,原因是“智谱没算力”。

而在官方认领后,我们不得不感慨一句:他们的嘲讽声好大啊。10万张国产芯片,承载了GLM-5.3-Flash模型1M超长上下文的多模态推理,以及全球超高用量负载,这也是国产芯片首次大规模集体出海。

性能上,GLM-5.3-Flash在基准测试和真实使用中全面超越了参数量高一倍的GLM-5.2,在Artificial Analysis Intelligence Index(AA综合智能指数)上,GLM-5.3-Flash分数与Claude Opus 4.8持平。

同时,稀疏注意力与线性注意力混合架构的采用,也大幅度降低了GLM-5.3-Flash的长上下文服务成本并不失精度。

而全国产卡与混合架构,带来的除了模型能力,还有性价比。GLM-5.3-Flash的输入价格为0.8元/百万tokens,输出为2.8元/百万tokens,缓存命中0.23元/百万tokens,现实5折优惠,缓存存储暂时免费。

作为一款多模态模型,GLM-5.3-Flash的定价仅为GLM-5.3的1/10、Opus4.8的1/40,限时折扣时期为GLM-5.3的1/20,虽然缓存价格不如DeepSeek-V4-Flash,但从输入和输出的价格以及模型能力的综合比对来看,GLM-5.3-Flash的性价比要更高一些。

智东西在智谱ZCode中深度体验了这款模型,围绕图片识别、办公任务、代码生成、3D游戏开发,以及视频剪辑等多方面能力进行了实测。

我们不仅测试了它处理日常图片和办公任务的表现,还让它从零复刻了《深海迷航》和《王者荣耀》两款游戏的片段,并为DeepSeek Harness打造了一套二次元皮肤。

01.

识图、做题、复刻网站

把吴恩达48分钟演讲视频

剪成5分钟金句合集

我们首先测试了GLM-5.3-Flash的基础识图能力,分别将《复仇者联盟4》海报和拍立得相纸包装盒的照片输入进去,这两张图片可以检验模型的人物识别、小字甄别以及对照片的识别精确度等能力。

能看到GLM-5.3-Flash准确地识别出了海报中演员名和对应的人物形象,还标注了火箭浣熊的配音演员。对拍立得包装盒照片的识别也相当准确,判断出了背面是7种不同语言的相同安全注意事项警告内容,下方小字也精确识别出来了。

除了简单的识图,我们还测试了GLM-5.3-Flash在混乱画面中的识别、理解与推理能力,在ZCode中上传了半页有首尾有缺失的公务员考试模拟试卷,让它识别题目并生成答案。上面全是密密麻麻的草稿,印刷油墨、圆珠笔与铅笔字迹混合。

GLM-5.3-Flash识别出了材料的缺失,然后将完整题目列出来并生成了答案,经过比对发现,依靠半份材料以及照片中的草稿信息,GLM-5.3-Flash仅答错了一题。

接下来,我们让GLM-5.3-Flash根据Hermes Agent官方网站的艺术风格,做一个智谱ZCode的网站,要求复刻风格以及动效。

ZCode用GLM-5.3-Flash抓取了Hermes Agent的网站,并提取了设计语言,然后用JS代码生成线稿,用时接近35分钟,产出网站如下:

整体网站风格和Hermes Agent完全一致,但内容替换为了ZCode,同时页面动效、下拉菜单以及双平台安装卡片都完美复刻。期间GLM-5.3-Flash还通过逐区截图核查,修复了光球遮挡标语等问题。

除了识图,我们对其多模态能力的另一个方向非常感兴趣——视频。虽然GLM-5.3-Flash不是视频生成模型,但通过多模态处理能力,可以实现视频剪辑功能。

我们上传了一段吴恩达接近48分钟的演讲视频,并让GLM-5.3-Flash将这个视频剪成金句合集的形式,GLM-5.3-Flash用时57分钟,从整段视频中提取了17个金句片段剪辑成片,并配上了中文字幕。

最终GLM-5.3-Flash剪好了金句视频,同时还导出了字幕文件,具体片段和转写稿等中间产物保留在了文件夹中。整个视频片段切换流畅,同时字幕准确,音画一致。

02.

复刻《深海迷航》《王者荣耀》游戏片段

给DSH做了一个皮肤插件

作为GLM-5系列模型,编程能力依然是GLM-5.3-Flash的重点,在智谱自研的Z.ai Code Bench体感评估中,其编程表现与Claude Opus 4.8相当。

智东西在编程方向做了三轮测试,从不同场景和用户角度切入。

首先,我们拟定了一份非常详尽的需求文档,让GLM-5.3-Flash开发一款类似《深海迷航》的3D游戏,没有提供任何视觉参考。

GLM-5.3-Flash的多模态能力在游戏编写过程中充分展现,基本代码编写完成后, ZCode会进入实机测试环节,它调用GLM-5.3-Flash在游戏中截图并查看状态,对鱼群受惊、氧气消耗以及探照光等细节进行了检查和调整。

随后,我还让GLM-5.3-Flash继续添加第一人称视角和玩家走出潜水艇的玩法,最后呈现出了这个山寨版的《深海迷航》。游戏的流畅程度、物理合理性、氧气消耗以及视角切换等方面完成度非常高。

接下来,为了检验GLM-5.3-Flash的视觉能力在游戏开发中能做到什么程度,我们上传了一段《王者荣耀》的训练营实机对战视频,并输入一段非常简短的提示词:

根据这个视频,做一个PVP对战游戏,要求还原技能、冷却、扣血机制、伤害机制、移动、技能特效、地图资源、防御塔机制等,网页可操作。

GLM-5.3-Flash根据视频中公孙离和孙尚香的英雄对战画面,开发了一个2D横版MOBA游戏,整体机制还原《王者荣耀》,公孙离的“换伞”和孙尚香的“强化普攻”都在游戏中实现了复刻。

虽然游戏因为提示词细节不足,在一些伤害机制和空A以及技能释放设定方面有所缺陷,但整体还是具有可玩性的,也可以看到GLM-5.3-Flash能够根据视频素材判断游戏基本逻辑,对于一些细节也能够做到还原。

最后,我们让GLM-5.3-Flash给最近开源圈爆火的DeepSeek Harness设计一个皮肤插件,以此测试其在代码理解、编程、图片素材处理以及前端设计等方面的综合能力。

首先我们用图片生成模型创作了一些二次元UI素材,然后将其输入到ZCode中,让它根据DeepSeek Harness的仓库自行设计一个皮肤插件。

GLM-5.3-Flash详细解读了需求,随后浏览DeepSeek Harness的仓库找到了插件设计规范并根据图片素材开发了插件。在我安装后遇到问题时,只需要将报错信息以及具体问题截图发给它,它就会识别问题并进行处理。

最终我的DeepSeek Harness拥有了一款非常好看并且不影响交互的皮肤,GLM-5.3-Flash在修改过程中自动处理了文字遮挡、明暗双色皮肤系统混乱等问题。

03.

长上下文、低成本、多模态

日常办公也在射程之内

GLM-5.3-Flash的设计架构,从一开始就把成本放在了重要的位置。

GLM-5.3-Flash总参数量为320B,与GLM-4.5的355B相差不大,但激活参数从32B降到了18B,层数也从92层减少到45层,几乎砍半。

智谱希望在整体参数规模没有明显缩小的情况下,结合最新30T Token多模态预训练语料,让模型尽可能少调用计算资源,同时实现更强的性能。

长上下文也是同样的思路,1M上下文真正难处理的,是注意力带来的计算和存储开销。对此,智谱采用了线性注意力与稀疏注意力的混合架构:线性注意力通过递归机制捕获局部依赖关系,稀疏注意力则借助轻量级索引器召回全局上下文。

面对超长上下文带来的索引器额外时延和内存占用,智谱进一步引入IndexPool,把索引器产生的4个缓存向量通过加权池化压缩成1个,以此减少这部分开销。

从结果来看,优化还是比较明显的。官方数据显示,相比GLM-5.3,GLM-5.3-Flash的注意力计算量降低了3.01倍,KV缓存降低4.44倍。

在所有基线模型中,GLM-5.3-Flash的注意力计算量最低。不过在KV缓存方面,它目前仍略高于Kimi-K3和DeepSeek-V4-Flash,这也是智谱后续还需要继续优化的地方。

除了编程,GLM-5.3-Flash在办公方面也不遑多让。其1M上下文为长文档场景提供了足够多的底气,同时,多模态能力以及更低的价格让GLM-5.3-Flash在日常办公场景也能够胜任。

在办公场景实测中,智东西上传了一篇58页的文学硕士论文,让GLM-5.3-Flash进行精华提炼。GLM-5.3-Flash仅用5分半就阅读并提取了论文的核心内容,随后生成了精华总结。

面向经营方向,我们上传了几张模拟甜品店经营数据中的图表,让GLM-5.3-Flash做一个经营状况分析,然后生成PPT,这些图片中只有可视化表格信息,并没有文字总结。

GLM-5.3-Flash通过对图表的分析,制作了一份经营状况分析与策略建议PPT,其图表并没有直接使用我提供的素材,而是根据自己的分析进行创作,整个PPT非常简洁美观,文字也相当准确。

在所有测试的最后,我们针对秋招场景让GLM-5.3-Flash搜集并整理一份新闻学秋招求职分析与行动报告,并以PDF形式输出。

GLM-5.3-Flash搜索并整合了多个信源的信息,生成了一份共计36页的求职报告,内容非常详尽,包括了今年秋招的变化、新闻学专业就业领域、岗位投递梯度以及简历写法等方面,在文字排版、图表以及配色上的完成质量很高。

整体体验下来,GLM-5.3-Flash的多模态能力从识别图片、剪辑视频到编程以及日常办公等各项任务都能够胜任,而其相比同水平模型更低的定价,也让这款模型的性价比卷到了一个非常高的地步。

04.

结语:智谱正在用技术和国产芯片

开启一场新型价格战

这次“价格战”不一样,降价不靠压缩利润,靠的是架构和芯片:混合注意力架构把长上下文推理成本压到极低,国产芯片把算力账单打下来。当降价源于效率而非烧钱,这个价格就能持续下去,与其说是价格战,不如说是定义价格。

对用户而言,换来的是更具性价比的模型:同样的预算能跑的活成倍增加,多模态能力也让GLM系列模型从代码开发,延伸到文档处理、金融分析这些日常办公工作流。

技术摊薄成本、国产芯片压低价格、多模态拓宽场景,这套打法跑通之后,冲击的不只是定价体系,还有整个行业对“前沿智能必然昂贵”的默认想法。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version