近日,一家总部位于北京的大模型公司宣布,其研发的GLM-5.3-Flash(320B-A18B)正式上线并面向全球开源。作为GLM-5系列的首个原生多模态模型,该产品一经推出便引发行业关注。与此同时,此前在OpenRouter(全球头部大模型聚合平台)和OpenCode(开源AI编程助手平台)上匿名测试的Ox Alpha模型,也被证实出自同一家公司。
GLM-5.3-Flash的定价策略成为一大亮点。据团队介绍,该模型的成本约为海外知名模型Opus 4.8的1/40。这一优势得益于其技术架构的突破性升级——通过结合稀疏注意力与线性注意力混合架构,模型在保持长上下文精准处理能力的同时,显著降低了服务成本。研发团队表示,这一设计让前沿智能技术得以更广泛地应用,无需“省着用”。
在正式发布前,团队以匿名模型Ox Alpha在两大国际平台进行了大规模测试。由于“Ox”在英文中意为“牛”,恰逢电影《牛来》热映,中文开发者社区将其亲切称为“牛来大模型”。测试期间,Ox Alpha迅速成为双平台最受欢迎的模型,创下调用量新高。数据显示,从8月20日匿名上线至8月26日的六天内,全球开发者累计使用该模型处理了数十万亿词元(Token)的数据。
值得关注的是,Ox Alpha在测试期间的所有请求流量均由国产芯片集群提供算力支持。这是该团队首次在大规模流量场景中完全采用国产芯片,并通过自研高带宽互联网络实现高效协同。这一实践不仅验证了国产芯片的可靠性,也为AI技术国产化提供了新的参考案例。











