ITBear旗下自媒体矩阵:

复旦创智联合推出RSAgent:多轮纠错让视觉分割迈向更精准未来

   时间:2026-09-09 02:07:28 来源:快讯编辑:快讯 IP:北京 发表评论无障碍通道
 

在智能体技术蓬勃发展的当下,视觉分割领域迎来了一项突破性成果。复旦大学与上海创智学院联合研发的RSAgent框架,通过创新的多轮工具调用机制,为提升视觉分割准确性提供了全新思路。该研究已成功入选国际机器学习顶级会议ICML 2026,标志着视觉智能体技术迈入新阶段。

传统视觉分割任务看似简单,实则充满挑战。当面对模糊目标、遮挡物体或需要推理定位的复杂场景时,现有模型往往难以一次性生成准确掩码。研究团队发现,问题根源不在于分割头的设计缺陷,而是缺乏动态确认与纠错机制。RSAgent框架突破性地将静态预测转化为动态交互过程,通过多轮观察、推理和修正,显著提升了分割可靠性。

该框架的核心创新在于构建了完整的智能体系统。模型不再直接输出分割结果,而是作为智能体动态调用视觉工具:每轮接收原始图像、文本指令和历史交互记录,输出结构化推理与工具调用指令;工具返回局部视图或候选掩码后,模型基于反馈决定后续行动。这种循环机制使模型具备"观察-思考-行动-验证"的完整能力链。

技术实现层面,研究团队构建了高质量训练数据集。通过自动合成与严格筛选,生成包含5000条多轮推理轨迹的cold-start SFT数据,配合2000个强化学习示例和8000个RefCOCOg训练样本,形成完整的训练闭环。数据管线设计确保模型既能掌握工具调用规范,又能学习最优交互路径。

实验数据充分验证了框架有效性。在ReasonSeg测试集上,RSAgent的gIoU指标达到66.5%,较基准模型提升9个百分点;RefCOCOg数据集上取得81.5%的平均cIoU,并生成超过5000条多轮推理轨迹。消融实验显示,cold-start SFT与强化学习的组合策略是性能提升的关键,适当增加工具调用轮数可进一步优化结果,但需避免上下文冗余。

这项突破对多个领域具有重要价值。在交互式标注场景中,可显著减少人工试错成本;机器人感知系统能通过动态确认提升目标定位精度;设计编辑领域可将自然语言意图转化为稳定可编辑区域;科学图像分析则获得可回溯的中间处理过程。研究团队强调,RSAgent的价值不仅在于指标提升,更在于为视觉智能体提供了可验证的像素级行动空间。

该成果由跨学科团队共同完成,主要研究者包括复旦大学硕士生何星旗与联合培养博士生张钰杰。两位研究者专注于视觉语言模型推理与强化学习方向,其工作展现了多模态大模型从"理解图像"向"视觉行动"演进的技术路径,为构建更接近真实应用场景的视觉智能体奠定了基础。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version