ITBear旗下自媒体矩阵:

浙大等团队联合攻关:让AI视觉“通才”兼具“专才”精准感知力

   时间:2026-08-11 00:27:05 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在人工智能视觉领域,通用模型与专业模型的能力互补始终是亟待突破的难题。浙江大学联合多所高校及科研机构的研究团队近日提出名为SpatialCLI的创新训练框架,通过"借用-学习-内化"三阶段策略,成功将专业视觉工具的感知能力迁移至通用模型内部,相关成果以预印本形式发布于学术平台arXiv。

传统AI视觉系统存在显著的能力断层:以GPT为代表的通用模型虽具备任务拆解与逻辑推理能力,却无法精准判断物体位置、轮廓或深度信息;而SAM等专业模型虽能完成高精度测量,却无法理解任务目标或整合测量结果。这种"有脑无眼"与"有眼无脑"的矛盾,导致现有系统在处理复杂空间任务时表现欠佳。研究团队开发的SpatialCLI框架,正是为解决这一核心矛盾而设计。

该框架首创"三阶段递进"训练模式。第一阶段通过工具调用机制为模型配备"外置望远镜",集成定位、分割、深度、姿态四大专业工具。模型在推理过程中可按需调用工具,每次交互最多允许10次调用,调用后系统会实时更新剩余次数,防止资源浪费。实验数据显示,经过该阶段训练的模型在MindCube基准测试中得分从29.3%提升至47.2%。

第二阶段引入冷启动监督微调与强化学习机制。研究团队先使用教师模型生成高质量推理轨迹,再通过GRPO算法让模型在真实交互环境中不断优化工具调用策略。这种训练方式使模型工具调用次数稳定在2.56次/轨迹,较未冷启动模型减少61%。特别值得注意的是,强化学习阶段仅对模型生成的推理内容、工具指令和最终答案计算损失,工具返回结果不参与梯度更新,确保训练效率。

第三阶段的能力内化堪称技术突破。研究团队设计渐进式证据轨迹语言化流程,将工具交互记录转化为自然语言监督信号。通过双视角训练机制,模型在保留工具调用能力的同时,逐步将专业感知能力编码至内部参数。实验表明,经过完整训练的80亿参数模型在无工具状态下得分达73.8%,超越GPT-5.6 Sol使用工具组合时的72.1%,且推理速度提升3倍。

为准确评估模型综合空间感知能力,研究团队同步构建SpatialCLI-Bench评测体系。该基准包含516道多选题,每题需组合运用至少两种空间能力(如定位+深度、姿态+分割)才能解答。题目数据源自8个权威视觉数据集,经专业工具验证与人工双重审核,确保答案客观性。测试结果显示,SpatialCLI-8B模型在该基准上无工具得分72.7%,有工具得分91.3%,显著优于同类方案。

能力内化指数(CII)的提出为技术评估提供新维度。该指标通过比较模型自主输出与专业工具实际输出的结构化结果相似度,量化感知能力迁移效果。在包含1000道题的评测集中,SpatialCLI-8B的综合CII达61.6,证明其确实将工具能力转化为内在参数。规模扩展实验进一步显示,模型参数量从80亿增至350亿时,无工具表现提升28%,而工具使用性能仅提升1%,印证能力内化对模型容量的更高要求。

具体案例分析揭示技术优势。在判断两个垃圾桶距离的测试中,无工具模型根据画面大小误判米色桶更近,而工具增强版本通过深度测量准确识别蓝色桶距离更短。更引人注目的是,完成能力内化的模型在无工具状态下输出的深度值(0.362米/0.615米)与工具测量值(0.351米/0.637米)高度接近,直观展现技术迁移效果。工具调用行为分析则显示,双视角训练模型在保持稳定工具使用频率(1.27次/轨迹)的同时,实现无工具性能的显著提升。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version