智谱GLM团队近期在AI系统优化领域取得突破性进展,其最新发布的GLM-5.3-Flash推理系统在国产AI加速器集群上完成部署,仅用两周时间便实现从首次运行到全面承载生产流量的跨越。该系统端到端吞吐能力提升3.2倍,硬件利用率和单token成本已接近主流NVIDIA GPU平台水平,标志着国产AI算力应用迈入新阶段。
此次部署的核心创新在于引入由GLM-5.3驱动的Infra Agent,该智能体深度参与系统优化过程。与传统依赖人工调优的方式不同,Infra Agent能够自主分析性能瓶颈、生成优化方案并实施代码修改。在超过10万颗国产AI加速器组成的集群上,团队成功克服显存容量限制、互联带宽不足、软件生态不完善等挑战,通过混合精度缓存、张量并行计算等技术,在算力、内存和通信间建立动态平衡。
真实环境测试数据显示,匿名运行的Ox-Alpha模型在OpenCode和OpenRouter平台迅速获得认可,六天内处理超62万亿token数据,成为平台使用量最高的模型之一。这一成果不仅验证了系统稳定性,更凸显AI参与系统优化的独特价值。研究团队特别指出,Infra Agent已展现出超越基础代码生成的能力,开始理解复杂系统性能变化的深层原因。
在优化过程中,Infra Agent成功定位并修复多个关键问题。例如,通过对比不同执行路径结果,发现长上下文计算中TF32精度导致的舍入误差累积问题;通过分析Python与C++调用链,解决KV Transfer任务因GIL锁未释放造成的传输延迟;还通过重构计算结构,消除Decode Kernel中四倍冗余的归一化计算。这些优化方案均源自Agent对现有开源项目的深度学习,其提炼的"优化骨架"模式显著提升问题解决效率。
技术实现层面,团队构建的"密集反馈"机制起到关键作用。该机制通过提供正确性验证、性能分析数据和实验对比结果,使Agent获得接近人类工程师的决策信息。当系统吞吐下降时,Agent不再仅接收抽象指标,而是能获取执行时间线、模块输出对比等具体数据,从而精准定位问题层级。这种将工程经验转化为可计算反馈的创新,为AI参与系统优化开辟新路径。
目前,人类工程师仍承担目标设定、反馈环境搭建和关键修改审核等核心职责,但角色定位已发生根本转变。从直接解决问题转向设计反馈系统,工程师的工作重心转向构建AI可理解的优化框架。研究团队强调,这种基于真实基础设施任务的反馈环境,不仅提升当前系统效率,更为训练下一代具备系统优化能力的模型提供关键数据支撑。
在KV Transfer与DeepEP调度优化案例中,Infra Agent展现的跨层级分析能力令人印象深刻。通过追踪从Python接口到C++内核的完整调用链,Agent发现节点内路径未及时释放GIL锁导致传输任务阻塞,这一发现直接推动相关代码修改,使传输开销从30%降至1%以下。此类优化案例证明,AI已具备处理复杂系统问题的初步能力,尽管距离完全自主的递归改进仍有差距,但已形成最小循环的优化闭环。











