ITBear旗下自媒体矩阵:

AI在GUI操作中为何总“点错”按钮?七种基础空间关系成最大“绊脚石”

   时间:2026-09-08 05:20:25 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

当你让手机助手点击屏幕上的某个按钮时,是否遇到过它总是点错位置的尴尬?这并非个别现象,而是当前最先进人工智能模型普遍存在的短板。最新研究显示,即便是市场上最强大的商业AI模型,在完成基础空间判断任务时的准确率也仅有三成左右,与人类96.9%的正确率形成巨大反差。

这项由南加州大学和卡塔尔计算研究院联合开展的研究,通过构建名为GUI-PRIMITIVES的专项测试体系,揭示了AI在图形界面操作中的深层缺陷。研究团队设计了一套包含994道题目的诊断工具,重点考察七种基础空间关系:左右方向、上下方向、包含关系、对齐关系、远近关系、列表序号和遮挡关系。这些看似简单的空间认知能力,实则是完成复杂界面操作的基础构件。

测试方法突破传统评测框架,采用"最小对"设计原理。每道题目由两张完全相同的截图构成,仅通过替换空间关系关键词(如将"左侧"改为"右侧")来改变正确答案。这种设计彻底封堵了AI通过统计规律蒙混过关的可能性——若模型无法真正理解空间词汇,其答案必然呈现一对一错的规律性错误。研究显示,19个主流模型在这类题目上的得分普遍低于随机猜测水平,暴露出严重的空间认知缺陷。

深入分析发现,AI的错误模式与人类认知偏差截然不同。60%至92%的预测坐标完全偏离目标区域,表明模型连最基本的视觉定位都未能完成。在真实软件界面测试中,所有模型在严格标准下的正确率几乎为零,即便放宽至"点击附近区域"的宽松标准,准确率也仅维持在6%至23%的低位。这与合成界面测试中60%至76%的宽松正确率形成鲜明对比,揭示出真实场景中按钮密集、尺寸微小的特殊挑战。

研究团队通过三种干预手段验证问题本质。标记候选区域(Set-of-Mark)方法使GPT-5的正确率从30%跃升至87%,证明视觉定位是当前模型的核心短板。相比之下,思维链提示和激活值引导等改进方法效果微弱,进一步证实模型并非缺乏空间推理能力,而是无法将视觉信息与语言指令有效关联。这种"看得见却找不到"的困境,恰似人类在陌生环境中迷失方向时的状态。

测试数据还揭示出有趣的训练数据偏差。15个模型在处理"左侧元素"题目时的表现显著优于"右侧元素",平均差距达17个百分点。这种系统性偏差与西方软件界面设计中"左主右辅"的布局传统高度吻合,反映出模型对空间词汇的理解仍停留在统计关联层面,而非真正的空间认知。

当前测试体系已覆盖英文界面和单次点击场景,但复杂操作如拖拽动作、多语言支持等仍待探索。研究人员特别指出,包含关系和遮挡关系等基础能力的测试严重依赖合成数据,因为真实界面中缺乏足够标注样本。这种数据获取困境,折射出AI落地应用时面临的现实挑战——实验室环境与真实场景之间存在着难以逾越的鸿沟。

在改进方案评估中,标记候选区域方法虽能显著提升表现,却属于"治标不治本"的权宜之计。该方法通过将定位题转化为选择题,绕开了模型的核心缺陷,本质上并未提升其空间认知能力。这种矛盾现象提示,现有技术路线可能已触及瓶颈,需要从视觉编码、跨模态融合等基础层面进行革新。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version