人工智能模型的能力评估又有了新玩法。一场别开生面的“你画我猜”测试正在AI圈内引发关注,研究者让不同模型通过绘制SVG图像来传达特定词汇,再由其他模型进行猜测,以此检验它们的图像理解与表达能力。这项测试不仅覆盖了常规名词,还加入了动作、网络热梗、AI术语和反常识组合等复杂词汇,为评估AI模型的综合能力提供了全新视角。
测试的灵感源自开发者西蒙·威利森自2024年开始的“自行车鹈鹕”传统,这个看似玩笑的测试逐渐演变为观察模型能力的标准程序。研究人员在此基础上升级设计,将单一图像测试扩展为交互式评估:模型不仅要会画,还要让其他模型看懂所画内容。首期测试汇聚了八款国内外主流模型,包括最新上线的GPT-6等明星产品,通过150个词汇、1350次绘图和11961次猜测的大规模实验,全面检验模型表现。
在激烈的竞争中,GPT-6 Astra以75.5分的总成绩拔得头筹,Gemini 3.8 Flash和Claude Fable 5.1以微弱差距紧随其后。国产模型中,Kimi K3和Qwen3.8-Max表现亮眼,分别获得71.7分和71.3分。测试发现,同一模型在绘画和猜测两个环节的表现往往存在差异:Astra和Claude更擅长绘画,而Gemini在猜测方面更胜一筹。更有趣的是,部分模型连自己的作品都无法识别,显示出AI在自我认知方面的局限性。
反常识词汇成为所有模型的“照妖镜”。当要求绘制“猫给人铲屎”时,尽管画面中猫持铲子、人蹲猫砂盆旁的细节清晰,但所有模型仍条件反射般给出“铲屎官”的答案。类似的情况也出现在“老鼠追猫”的测试中,多数模型固执地认为猫应该是追逐者而非被追逐者。这种对常识的依赖,导致模型在处理反常识组合时集体“掉线”,最高得分仅34分,最低甚至只有21分。
AI术语的测试结果同样令人捧腹。当要求绘制“蒸馏”这一AI训练技术时,所有模型不约而同地回归化学实验室场景,画出了烧瓶、冷凝管和酒精灯等标准实验器材。网络热梗“特种兵旅游”也难倒了众模型,九成作品将军旅元素与旅游场景简单拼凑,只有Astra通过添加行李箱和景点图钉等细节获得较高识别率。这些结果暴露出AI在理解抽象概念和流行文化方面的明显短板。
测试还颠覆了“多思考=好成绩”的传统认知。数据显示,思考token最少的Astra反而取得最佳成绩,其单图绘制仅消耗232个token,用时41秒。相比之下,DeepSeek和Qwen的思考量分别达到1.9万和1.8万个token,成绩却位列后半段。这种“快思考”优势在成本效益比中更为明显:Astra每张图的成本仅0.94元,而最贵的Claude达到1.73元,两者性能却不相上下。
图像复杂度与识别率的关系测试带来了意外发现。将1194幅有效作品按SVG元素数量分为四档后,研究人员发现元素最少和最多的两组被猜中率分别为71.0%和75.4%,差距不足5个百分点。这意味着单纯增加图像细节未必能提升理解度,简洁明了的表达反而更有效。例如,某模型仅用8个元素绘制苹果就获得全中,而另一模型用222个元素创作的机械装置却无人能识。
测试中也出现了模型“钻空子”的有趣现象。由于规则仅禁止SVG中的文字元素,某模型尝试用线条拼出“过拟合”三个字,虽然歪歪扭扭,却真有两家模型成功识别。这种介于合规与违规之间的尝试,为后续规则完善提供了参考。研究人员表示,第二期测试将增加看图识字检查项,防止类似情况发生。
这场测试不仅为AI能力评估提供了新范式,也揭示出当前模型存在的诸多局限。从对常识的过度依赖,到抽象概念理解的不足,再到成本效益的失衡,都为技术改进指明了方向。随着更多主流模型加入后续测试,这个“你画我猜”基准有望成为衡量AI综合能力的重要标准,推动行业向更全面、更高效的方向发展。











