在人工智能领域,如何让AI智能体像人类一样具备长程规划能力,一直是困扰研究者的核心问题。中国科学院自动化研究所认知与决策智能重点实验室与中国科学院大学人工智能学院的研究团队,通过构建可控实验环境,系统分析了AI长程规划能力的形成机制,为这一领域提供了全新视角。相关研究以预印本形式发布于arXiv平台,编号为arXiv:2607.24720v1。
当前AI在处理简单任务时表现优异,但面对需要多步骤协同的长程任务时,往往因目标意识模糊或行动计划混乱而失败。研究团队将这一挑战定义为“多轮长程规划”,并指出其根源在于现有大语言模型训练数据的不可控性——互联网数据的不透明性使得研究者难以追踪特定能力的形成过程。为此,团队搭建了一个完全可控的“合成宇宙”实验环境,包含奇幻炼金术、畜牧农场和电子组装三个虚构领域,每个领域均设计了五层树状结构的物品合成规则,任务难度分为短程(1-5步)、中程(6-8步)和长程(9步以上)三档。
实验环境的核心设计在于,AI智能体需通过与环境互动自主推断合成规则,而非直接获取规则信息。研究团队从头训练了一个基于Qwen2.5架构的1亿参数模型,采用avg@8(独立运行8次平均成功率)和pass@8(8次中至少一次成功比例)作为评估指标,每个测试子集包含160个实例,确保结果可靠性。这一设计为精准分析AI规划能力的形成提供了基础。
在预训练阶段,研究团队对比了“直接预测动作”与“世界模型内化”两种训练方式。前者要求AI根据当前状态直接输出操作,类似厨师凭肌肉记忆执行食谱步骤;后者则要求AI在行动前构建推理链,模拟每一步操作的后果,类似厨师理解烹饪原理后自主规划。实验数据显示,世界模型内化方式在长程任务中的成功率比直接预测高出45.8个百分点,证明AI需建立环境运转的“内心模型”才能实现有效规划。然而,直接预测方式在训练初期表现更优,因其本质是“背答案”,而世界模型内化需“理解规律”,这一发现为训练策略选择提供了参考。
进一步研究揭示,仅靠短程数据训练的AI无法自动组合出复杂任务。当训练数据仅包含短程任务时,AI在中程和长程任务中的表现几乎为零;但加入5%的中程轨迹后,中程任务成功率跃升至51.88%,加入5%的长程轨迹后,长程任务成功率提升至11.46%。这表明AI已具备基础技能,但需少量长程示范激活组合能力。相反,若训练数据中混入次优轨迹,短程任务成功率会从100%跌至73%,中程任务更是崩溃至不足1%,长程任务归零,且增加采样次数无法改善结果。这一发现强调了数据质量对长程规划能力的决定性影响。
后训练阶段,研究团队引入强化学习(RL)提升规划能力,并区分了“规划模式”(跨任务通用的思维框架)与“规划知识”(任务特定的程序性知识)。实验表明,当预训练数据质量中等且任务步骤适中时,强化学习可有效筛选出高期望回报的规划模式;但当数据质量差且任务步骤长时,强化学习效果有限。对比GRPO(基于最终结果奖励)和OPD(在线策略蒸馏)两种算法,OPD在困难场景下表现更稳健,因其提供实时模仿信号,避免GRPO因稀疏奖励导致的梯度混乱。然而,OPD会降低模型输出多样性,限制其在多次采样中的上限。
多教师融合训练的实验则揭示了规划知识的高互信息特性带来的挑战。当学生模型已掌握路径A的合成规则,而教师模型按路径B指导时,学生因原有知识被干扰且未能建立新知识,导致中等难度任务成功率从42.19%骤降至6.09%。研究团队指出,现有训练数据缺乏“从错误中恢复”的纠错示范,而这类数据对模型学会犯错后重新规划至关重要。多教师融合的成功取决于领域间规划模式的兼容性:若模式兼容,可实现跨领域泛化;若部分兼容,支持持续学习但伴随遗忘;若完全冲突,则导致灾难性遗忘。
该研究通过系统实验,明确了AI长程规划能力的形成路径:预训练阶段需构建世界模型、加入少量长程示范、严格控制数据质量;后训练阶段需区分规划模式与规划知识,合理选择强化学习算法;多教师融合阶段需确保领域间规划模式兼容。这些发现不仅为AI系统开发提供了实践指导,也揭示了人类学习与AI训练的共通性——优质基础教育、针对性实践训练与跨领域优秀导师的指导,同样是提升规划能力的关键要素。完整论文及实验代码、数据集已开放获取,供研究者进一步探索。











