人工智能领域的一项突破性研究,为AI的“隐性思维”赋予了自我优化的能力。这项由香港理工大学与四川大学联合开展的研究,提出了一种名为代理潜在策略优化(SLPO)的新方法,使AI在处理复杂问题时能够像人类一样动态调整思考时长,并通过结果反馈不断改进推理策略。
传统AI推理主要分为显式思维链与潜在推理两种模式。显式模型通过文字逐步展示推理过程,便于人类理解与监督学习,但存在计算资源消耗大的问题;潜在模型则将中间步骤压缩为数学向量,在“隐空间”中完成运算,虽然效率更高,却因缺乏可解释的中间概率信息,难以通过强化学习实现自我提升。研究团队针对这一瓶颈,设计了SLPO框架,使潜在推理模型也能接受结果导向的训练。
SLPO的核心创新包含两大模块。第一模块通过“代理密度”机制为隐性步骤构建概率评估体系。研究团队借鉴质量控制理念,对每个推理步骤施加随机扰动,生成多个输出向量,并利用这些向量的统计特征拟合高斯分布作为代理概率。该数值虽非精确概率,但足以支撑强化学习所需的奖惩信号传递。第二模块引入“停止门”神经网络,使模型能够自主判断何时终止思考。通过预训练阶段积累的“不同步数截断正确率”数据,停止门学会了将停止概率分配给最可能得出正确答案的思考长度。
实验表明,SLPO显著提升了潜在推理模型的性能。在GSM8K数学推理测试中,搭载SLPO的COCONUT模型准确率从38.13%提升至41.85%,CODI模型则从67.48%增至70.28%。更关键的是,模型在保持平均6.3步推理时长的情况下,达到了显式模型25.4步才能实现的准确率,展现出更高的计算效率。停止门的自适应机制尤为突出,难题平均需要6步以上思考,而简单题在5.2步内即可完成,实现了计算资源的动态分配。
该方法的通用性通过多项测试得到验证。在软令牌推理架构上,SLPO使模型生成的序列长度随训练稳步增长,最终突破1000词,而传统方法序列长度基本停滞。潜在空间几何分析显示,训练后的模型相邻推理步骤差异增大3.8%-17.8%,有效秩降低12%-25%,表明推理过程既保持阶段跳跃性,又避免无效探索。超参数敏感性测试进一步确认,每题采样8条完整路径(G=8)对性能提升最显著,而代理概率估算次数(K=4)达到阈值后继续增加收益有限。
这项突破为潜在推理开辟了新路径。此前研究者面临两难选择:要么接受显式模型的高计算成本,要么忍受潜在模型的自我提升瓶颈。SLPO通过添加停止门与代理概率模块,在不改动底层架构的前提下,使现有强化学习工具可直接应用于潜在推理。研究团队已在数学推理任务上完成验证,未来计划将其扩展至写作、编程等更复杂的开放领域,并探索多模态潜在架构的应用可能性。
Q&A
问:代理概率如何解决潜在推理的强化学习难题?答:潜在推理的中间步骤是连续向量,缺乏显式模型中“选择某个词”的概率信息。SLPO通过多次随机扰动生成输出向量,用统计分布拟合出代理概率。虽然这个概率是近似的,但足以支撑强化学习所需的奖惩信号传递,使模型能够根据结果反馈调整推理策略。
问:停止门如何判断题目难度并决定思考时长?答:在预训练阶段,模型对每道题在不同思考步数处截断并解码答案,记录哪些步数能得出正确结果。停止门据此学习将停止概率集中分配给可能正确的步数位置。经过强化训练后,停止门进一步精细化判断,使难题获得更长的思考时间,简单题则快速作答,实现计算资源的动态分配。
问:SLPO与现有显式推理强化学习方法有何本质差异?答:显式模型直接利用词汇表概率进行强化学习,而潜在模型缺乏这种现成概率。SLPO的创新在于构建代理概率估算机制,填补了潜在推理与强化学习之间的接口空白。在代理概率建立后,SLPO可直接套用GRPO、RLOO等现有算法,无需发明新优化方法,专注于解决潜在推理的自我提升问题。











