当用户向人工智能助手发送一张照片,询问“画面中有几棵树”或“帽子颜色是什么”时,得到的答案却常常令人啼笑皆非。这种现象并非偶然失误,而是暴露了当前人工智能系统在视觉感知领域的根本性缺陷。月之暗面(Moonshot AI)研究团队通过系统性测试发现,即便是全球最先进的AI大模型,在基础图像识别任务中的准确率也普遍低于60%。这项以预印本形式发表于arXiv平台的研究(编号2607.24957),为评估AI视觉能力提供了全新视角。
传统AI测试往往将视觉识别、知识储备与逻辑推理混合考核。例如,要求模型通过仪表盘图片计算车辆剩余续航里程时,错误可能源于指针读数偏差、油耗数据缺失或计算失误,但现有测试无法精准定位问题根源。月之暗面团队将此现象定义为“感知能力碎片化评估困境”,并开发出专攻视觉感知的基准测试PerceptionBench。该测试剥离其他能力干扰,仅考察AI对图像内容的直接理解水平。
研究团队通过逆向工程构建测试体系:先让16个主流AI模型完成42项现有视觉测试,收集9000余个错误案例,再利用更强大的AI模型分析错误根源。最终归纳出22种错误类型,其中10种直接关联视觉感知,包括物体定位、属性识别、数量统计、空间关系判断等。这些错误在各类测试中反复出现,证明是行业共性问题而非个别模型缺陷。
在正式测试中,16个顶尖模型无一突破60分大关。表现最佳的GPT-5.6-Sol得分为59.7%,开源模型Kimi K3以58.5分位居次席,甚至超越多数商业闭源模型。具体能力差异显著:所有模型在“感知性幻觉”(虚构图中不存在物体)上的平均正确率仅36.7%,而视觉关系理解和OCR文字识别的平均分分别达53.2%和52.4%。更值得注意的是,总分领先的模型在特定能力上可能大幅落后——冠军GPT-5.6-Sol的幻觉能力得分仅26.9%,而中游模型Gemini-3.5-Flash在该项获得50.6%的全场最高分。
测试稳定性分析显示,各模型四次独立运行的总分波动极小,但具体题目正确率波动明显。以Kimi K3为例,其“至少答对一次”的比例达73.9%,但“四次全对”比例骤降至42.7%,揭示出AI视觉感知的随机性特征。研究团队认为,当前模型更多依赖概率性判断而非确定性理解,导致相同题目出现不同结果。
公开题库包含3000道精选题目与17000道储备题目。统计分析表明,两者能力得分相关系数达0.84,证明小规模测试能有效代表整体水平。研究团队展示的典型题目包括:通过星盘图案判断星座方位、区分书桌笔筒的粉灰配色、统计花丛中完整花朵数量等。这些看似简单的任务,却让多数顶尖模型折戟沉沙,例如在“办公室白色桌子数量”的幻觉测试中,众多模型错误报告存在白色桌子。
这项研究为AI开发者提供了精准诊断工具。通过PerceptionBench的细分能力评估,研究者可快速定位模型短板,而非笼统判断视觉能力优劣。例如,GPT-5.5与Gemini-3.1-Pro总分仅相差0.4分,但前者在物体定位领先13分,后者在OCR识别和细粒度区分上优势明显。这种差异化能力图谱,为模型优化指明了具体方向。
对于普通用户而言,研究结果警示需对AI图像分析保持审慎态度。当模型在基础感知层面出现错误时,其后续推理结论可能完全建立在错误前提之上。例如在医疗影像诊断中,若AI误判肿瘤位置或大小,后续治疗方案推荐将失去价值。这种风险在自动驾驶、工业质检等安全关键领域尤为突出,凸显出提升AI视觉可靠性的紧迫性。









