ITBear旗下自媒体矩阵:

循环语言模型“多轮思考”:复杂工具调用任务准确率提升新路径

   时间:2026-09-17 22:39:48 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在人工智能领域,工具调用任务一直是衡量模型实用性的重要场景。当用户要求AI完成订机票、规划行程等复杂操作时,模型需要精准调用多个工具并传递中间结果,但现有模型常因参数错误或步骤错乱导致任务失败。剑桥大学最新研究提出,通过引入循环语言模型结构,让AI在生成结果前进行多轮推理,可显著提升复杂任务的执行成功率。

传统Transformer模型采用层级堆叠结构,每层参数独立且仅运行一次,如同学生做题时直接写出最终答案。而循环语言模型(Looped Language Models)则采用共享参数模块,对输入进行多轮迭代加工。研究团队形象比喻:这相当于允许学生在草稿纸上反复验算,每轮检查前序步骤的合理性后再决定是否继续计算。这种设计将模型参数量与计算深度解耦,无需扩大模型规模即可提升推理能力。

实验设置了三个评测基准:BFCL测试单次与并行调用能力,NESTful专注嵌套依赖任务,API-Bank考察真实API选择精度。结果显示,在需要多步骤协同的Parallel-Multiple类别中,26亿参数的Ouro-2.6B模型准确率达76.5%,超越参数规模更大的Qwen3-4B模型(56.7%)。特别是在嵌套调用任务中,其胜率指标达到0.371,较同规模非循环模型提升近一倍。

研究团队开发了两种技术路线:原生循环模型从预训练阶段即采用循环结构,支持最多4轮迭代;改造循环模型则基于现有模型(如Llama-3.2-1B)改造部分层为循环模块,支持8轮迭代。实验发现,原生模型在复杂任务中表现显著优于改造模型,例如在NESTful基准上,改造版Llama即使运行8轮仍是个位数胜率,而原生Ouro-2.6B仅需4轮即可达到35%以上胜率。这表明预训练阶段的表征方式对循环结构的适配性至关重要。

为平衡计算效率与准确率,研究引入自适应退出机制。模型在每轮迭代后评估继续计算的必要性,通过概率分布决定是否停止。在BFCL测试中,自适应推理用比固定4轮更少的计算量,达到同等准确率;在NESTful任务中,Ouro-2.6B模型平均计算轮数减少23%,胜率却保持不变。这种机制使简单任务快速完成,复杂任务深度推理,显著优化资源分配。

进一步分析显示,模型规模与迭代轮数存在替代关系。26亿参数的Ouro-2.6B在3轮后性能趋于饱和,而14亿参数的Ouro-1.4B需4轮才能达到相近水平。这表明更聪明的模型可通过减少迭代次数实现效率优化。研究同时指出,改造模型性能受限的原因可能在于预训练阶段未针对循环结构优化,如同成年人练琴难以达到童子功的肌肉记忆水平。

在工具调用任务的具体案例中,模型表现差异显著。处理"整数列表转字符串再标准化"的任务时,非循环模型首轮调用虚构函数且遗漏步骤,次轮函数名仍错误且变量引用混乱;直到第3轮才给出完全正确的调用序列。这证明循环结构能修正函数选择、调用顺序、变量绑定等深层语义错误,而非仅处理格式问题。

该研究对AI应用开发具有重要启示。在需要多工具协同的场景中,循环语言模型可降低任务失败率,特别是在金融、物流等依赖复杂流程的行业。自适应推理机制则为成本控制提供了新思路,通过动态分配计算资源,使简单查询的响应速度提升数倍,同时保障复杂任务的准确性。随着模型架构与训练方法的持续优化,AI工具调用能力有望突破现有瓶颈,向更接近人类思维的推理模式演进。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version