ITBear旗下自媒体矩阵:

AI模型“眼见”却难为实:多模态大模型视觉认知的矛盾与破解之道

   时间:2026-08-19 17:42:36 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

当人工智能模型面对一张红色瓜瓤的西瓜图片,被明确要求“仅根据图片内容回答西瓜通常的颜色”时,多数模型能给出正确答案。但若将场景换成紫色沙漠中的埃菲尔铁塔,要求“仅参考图片”描述铁塔周边环境,部分模型却会无视画面中的沙漠,转而复述“巴黎街景”等常识性内容。这种时而机械遵循图像、时而顽固依赖先验知识的矛盾表现,暴露了多模态大语言模型在视觉信息处理中的深层缺陷。

这类模型通常由预训练语言模块与视觉编码器拼接而成,其语言部分通过海量文本训练形成强先验知识。哥本哈根大学等机构的研究发现,模型在处理反常识图像时存在两种典型失效模式:要么完全忽视图像细节,要么过度依赖常识判断。例如面对五条腿的马匹图片,模型可能坚持回答“四条腿”;而面对明显超重的物体对比图,却无法通过视觉线索判断重量差异。

为区分“视觉感知失败”与“信息使用障碍”,研究团队采用图像重建技术进行验证。他们选取三个主流模型家族的六个版本,针对其回答错误的反事实图像(如异常腿数的动物),仅利用模型最终层的视觉词元进行图像重建。实验结果显示,重建图像在物体轮廓、姿态等粗粒度特征上与原图高度吻合,异常细节保留率超过93%。这证明视觉信息已完整传递至模型内部,但未在回答环节被有效调用。

基于此发现,研究团队开发了专用测试集WhatIfVis,包含3049道人工校验题目,覆盖空间关系、颜色、数量等五个维度。每道题均设计“仅看图片”与“仅凭常识”两种矛盾答案,通过配对准确率(PairAcc)指标严格评估模型表现。测试表明,未经特殊训练的模型平均配对准确率仅14.7%,在需要推理的数量和重量任务中几乎全军覆没,而在颜色等直接感知任务中表现稍好。

通过监督微调技术,研究团队显著提升了模型表现。仅使用1136个样本对注意力层进行低秩适应(LoRA)训练后,六个模型的平均配对准确率跃升至52.7%。这种提升具有跨任务泛化性,在未参与训练的颜色、空间关系等任务中同样有效。但数量和重量任务仍表现不佳,揭示出单纯强化视觉注意力无法弥补推理能力的缺失。

进一步的可解释性研究定位了决策关键层。通过激活修补技术,研究人员发现不同架构模型的“视觉-先验”博弈集中在特定层区间:Qwen3.5-9B在第13至21层,Gemma-4-E4B在第20至27层。这种跨架构的共性现象,为后续干预提供了明确靶点。

研究团队提出的可控视觉上下文敏感性框架(CVCS),通过学习一维操控向量实现了无指令行为控制。在关键层内部表示中沿该向量调整数值,即可使模型行为发生可预测偏转。实验显示,这种“隐形旋钮”将平均配对准确率提升至37.7%,虽低于监督微调效果,但证明了视觉敏感性可被压缩至低维空间进行操控。

对比实验揭示出图文处理能力的显著差异。当输入形式从图像换为文字描述时,模型配对准确率从14.7%跃升至43.4%,且差距随模型规模扩大而加剧。这种差距主要源于“遵循证据”能力的不足——模型能轻松调用常识知识,却难以像理解文字那样精准解读图像信息。研究指出,提升视觉信息的“可解释性”而非单纯增强感知能力,才是解决矛盾的关键。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version