ITBear旗下自媒体矩阵:

智谱GLM-5.3-Flash新突破:AI参与优化自身系统,10万国产卡显实力

   时间:2026-09-17 21:01:02 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

智谱团队近日宣布,其研发的GLM-5.3-Flash推理系统在国产AI加速器集群上实现重大突破。该系统仅用两周时间便完成从首次运行到稳定承载生产流量的全流程部署,端到端吞吐能力提升3.2倍,硬件利用率与单token成本达到国际主流GPU平台水平。这项成果标志着AI模型开始参与自身运行系统的优化工作,为人工智能技术发展开辟新路径。

此次部署基于超过10万颗国产AI加速器构建的集群,面临显存容量限制、互联带宽不足、软件生态不完善等多重挑战。智谱团队创新采用混合精度缓存、张量并行计算等技术方案,通过ReplaySSM算法用计算资源换取内存空间,引入分离式EPD架构实现推理阶段灵活调度。这些优化措施使系统在算力、内存、通信和调度之间达成新平衡,最终实现性能跃升。

项目核心创新在于引入由GLM-5.3驱动的Infra Agent。这个智能体不仅参与性能瓶颈分析、优化方案制定,还能自主完成部分代码修改。在处理KDA上下文并行路径时,Agent发现TF32计算导致的舍入误差累积问题,通过比较不同执行路径精准定位到状态传播环节的精度处理缺陷。该发现推动Flash Linear Attention项目完成关键修复,显著提升长序列计算精度。

在KV Transfer与DeepEP调度优化中,Agent展现出强大的系统分析能力。通过追踪Python与C++调用链,发现节点内路径未及时释放Python GIL导致传输延迟,优化后将额外开销从30%降至1%以下。另一个典型案例是Decode Kernel优化,Agent识别出重复执行的归一化计算,通过重组计算结构实现1.71倍性能提升。这些优化思路均来自对SGLang等开源项目代码的学习与实验验证。

智谱团队构建的dense feedback机制是支撑Agent工作的关键。该系统通过提供正确性验证、时间消耗分析、实验对比等精准反馈,使智能体能够模拟工程师的决策过程。当系统吞吐下降20%时,Agent不再依赖简单指标,而是通过分析执行时间线、运行微基准测试等工程手段定位问题。这种将经验转化为可调用反馈的设计,显著提升了AI解决复杂系统问题的能力。

人类工程师在优化过程中仍扮演重要角色,负责设定目标、搭建反馈环境及审核高风险修改。但工程师职能正从直接解决问题转向设计反馈系统,这种转变使优化工作更具可扩展性。智谱团队指出,每次Agent完成的工程任务都可转化为下一代模型的学习数据,这种"模型优化系统-系统服务模型"的循环机制,虽与递归自我改进仍有距离,但已形成最小规模的闭环。

GLM-5.3-Flash在真实环境测试中表现优异。以匿名模型Ox-Alpha运行在OpenCode和OpenRouter平台期间,六天内处理超过62万亿token,迅速成为两个平台使用量最高的模型之一。这项成果不仅验证了国产AI加速器的实用性,更展示了AI模型参与系统优化的巨大潜力,为人工智能基础设施建设提供全新范式。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version