人工智能视觉助手在处理复杂任务时,常面临一个关键难题:何时该调用工具,何时该直接回答。北京大学、快手团队、香港科技大学(广州)、中文大学、浙江大学和清华大学的联合研究团队,针对这一问题提出了创新性解决方案。他们开发的Beacon模型通过独特训练机制,使模型能够智能判断是否需要调用工具,显著提升了视觉推理任务的准确性。
当前主流的多模态大语言模型虽配备图像裁剪、数值计算等工具,但在实际应用中常出现两种极端情况:要么过度依赖工具导致简单问题复杂化,要么完全不使用工具导致复杂问题处理失败。研究团队将这两种现象分别称为"工具伤害"和"工具收益不足"。前者指模型在无需工具的简单任务中调用工具,反而因工具使用错误导致答案出错;后者指模型在需要精确计算的复杂任务中拒绝使用工具,仅凭视觉估算给出错误答案。
为量化评估模型工具使用能力,研究团队设计了精细测量体系。他们将测试题分为"文本简单题"和"文本困难题"两类:前者指模型在不使用工具情况下,五次回答中四次及以上正确;后者指五次回答中零次或一次正确。通过记录模型在不同类型题目中的工具调用情况和最终准确率,衍生出MAtext、MAtool、Tool-Gain和Tool-Harm等关键指标。评测结果显示,四款代表性前沿模型在工具使用适应性上表现不佳,工具带来的净收益几乎为零。
Beacon模型的训练分为监督微调和强化学习两个阶段。在监督微调阶段,研究团队从16个公开数据集收集21万余道题目,涵盖数学几何、图表理解等多个领域。他们先让基础模型Qwen3-VL-8B回答这些题目,筛选出困难题目后,由Gemini 3.1 Pro生成带Python代码调用的解题轨迹。经过二次精炼,最终保留约1.57万条高质量轨迹,同时混入部分无需工具的简单题目,防止模型形成过度依赖工具的习惯。
强化学习阶段引入了两项核心设计。首先是"必要性感知自适应奖励"机制,该机制根据模型当前能力动态调整奖励标准:对于模型能直接答对的简单题,使用工具答对仅得四分之一分;对于模型无法直接答对的难题,使用工具答对则得满分。这种设计使模型逐渐学会根据题目难易程度自主选择回答方式。其次是"提示引导能力扩展"机制,当模型对某道题完全无法解答时,系统会提供不含最终答案的解题提示,帮助模型学习工具使用策略。训练时去掉提示,使模型能够内化这些技能,在无提示情况下也能正确调用工具。
实验结果表明,Beacon模型在13个视觉推理基准测试中表现优异,其中11个测试位列开源模型第一,平均得分58.98%,较基础模型提升约6个百分点。在工具使用适应性方面,Beacon的曲线呈现理想趋势:简单题工具调用比例低,困难题工具调用比例高。其他模型的曲线则基本平直,显示缺乏根据题目难易调整工具使用策略的能力。Beacon的工具净收益达+3.1个百分点,文本保留率高达91%,均显著优于其他模型。
消融实验验证了设计机制的有效性。单独使用普通强化学习时,模型工具净收益仅为+1.4个百分点;加入必要性感知奖励后,净收益提升至+2.54个百分点;加入提示引导能力扩展后,净收益进一步升至+2.96个百分点。两者结合使用时,模型整体准确率达到58.98%,工具净收益最高达+3.14个百分点。训练过程分析显示,模型推理模式与题目类型的匹配准确率持续提升,而非简单偏向某种回答方式。
具体案例展示了Beacon模型的实际应用效果。在计数任务中,模型通过像素级检测和连通分量算法准确数出轨道上的蓝色弹珠数量;在街景识别任务中,模型通过多次裁剪图像区域,成功判断出照片中的白色汽车数量;在复合推理任务中,模型按照提示步骤裁剪比分区域、标注球场边界,正确计算出羽毛球比赛的新比分和比赛年份。这些案例证明,Beacon模型能够根据任务需求灵活调用工具,在复杂视觉推理任务中表现出色。
该研究重新定义了人工智能工具使用的评价标准,强调模型不仅需要具备调用工具的能力,更需要具备判断何时调用工具的智慧。这种"元认知"能力被认为是人工智能走向实用化的关键。完整论文已以预印本形式发布,论文编号为arXiv:2607.28595,详细介绍了提示词设计、数据统计和训练参数设置等内容。










