代码不仅要能运行,更要跑得快——这一看似简单的目标,在人工智能领域却长期难以实现。由meta AI基础研究团队联合法国科研机构开展的最新研究,通过强化学习技术成功突破这一瓶颈,让AI生成的代码在保持正确性的同时显著提升运行效率。这项成果以预印本形式发布于arXiv平台,为智能代码优化开辟了新路径。
传统AI代码生成模型普遍存在"重正确轻效率"的缺陷。研究团队指出,现有训练方法仅关注程序能否通过测试用例,对执行速度完全不作要求。但在现实场景中,处理百万级用户请求的代码效率差异可能直接导致服务器成本呈数量级增长。例如,某电商平台的支付系统优化后,单日节省的算力成本相当于数百台高端服务器的购置费用。
构建可靠的评估体系成为首要突破口。研究人员发现,主流编程竞赛数据集存在致命缺陷:测试用例规模过小导致测量误差远超实际速度差异。通过重建测试框架,团队开发出包含1302道题目的DMC-Optim数据集,其中每道题的优化测试用例输入规模达到传统数据集的1000倍以上。这种设计使得正确程序间的速度差异可达数秒量级,有效解决了测量噪声干扰问题。
在执行环境方面,研究团队摒弃了本地计时方案,转而采用独立集群的远程执行服务。通过物理隔离和沙箱技术,将环境干扰导致的测量误差从41个百分位点压缩至2个百分位点以内。针对硬件升级带来的时间基准漂移问题,团队建立线性校正模型,使跨时期测量结果的相关性从0.54提升至0.96。
奖励机制设计面临更大挑战。研究人员将现有方案归纳为三大类:执行前过滤、执行中限制和执行后排名。通过离线模拟器测试发现,单纯的时间阈值过滤会导致70%的测试用例被错误排除,而绝对时间限制方案又使85%的AI代码因超时无法获得反馈。最终采用的"折叠二值奖励"机制,仅在代码同时满足正确性和速度要求时给予正向激励,这种简洁设计使训练稳定性提升3倍以上。
针对速度奖励信号稀疏性问题,研究团队对GRPO算法进行关键改进。通过将单题生成答案数量从8个增加至16个,使有效训练批次比例从55%提升至82%。引入动态批次调整机制后,梯度估计方差降低60%,模型在训练初期即可获得稳定的速度优化信号。特别设计的"新鲜度过滤"系统,自动淘汰超过30个优化步骤的旧数据,防止过时反馈干扰模型学习。
实验数据显示,经过优化的70亿参数模型在速度前50%的测试中通过率从18%提升至31%,320亿参数模型更实现88%的显著提升。在公开基准测试LiveCodeBench上,优化模型的中位速度较基线模型快83%。深入分析发现,47%的速度提升源于更高效的IO处理,34%来自计算过程的常数因子优化,这表明AI已掌握实质性的代码优化技巧。
与人类顶尖程序员相比,AI仍存在明显差距。数据显示,人类最快解法在67%的测试中保持优势,尤其在算法复杂度改进方面,人类程序员实现突破的比例是AI的2倍。但研究团队强调,AI在常数优化和IO处理等基础层面已展现专业水准,这为后续研究奠定了重要基础。目前团队正探索将算法复杂度感知机制引入奖励系统,以期实现更本质的代码效率提升。









