在材料科学领域,一篇论文中的图表往往承载着研究者数月实验的心血,坐标轴的微小变化、光谱峰的精确位置,都可能成为关键证据。然而,这些高度专业化的图表能否被人工智能真正理解?国际文档分析与识别大会(ICDAR 2026)上,一套名为ALD/E-ImageMiner的数据集给出了答案:当前AI在解析科学图表时仍存在显著局限,但研究已清晰定位了能力缺口。
该数据集聚焦于原子层沉积与刻蚀(ALD/E)这一前沿领域。这项技术通过原子级精度控制材料生长或去除,广泛应用于芯片制造与光伏产业。研究团队从205篇专业论文中提取1951张图表,涵盖光谱曲线、极图、分子结构示意图等49种类型。每张复合图均由多国材料科学家手工标注,精确到像素级坐标框——例如明确标注“某子图从左上角第120像素开始,宽300像素、高200像素”。这种标注方式并非多余,实验表明,若缺乏像素级定位,多模态大模型常将A图数据误判为B图结论,导致推理错误。
为系统评估AI的读图能力,研究设计了四项递进任务:图表分类要求模型识别光谱图、极坐标图等混合类型;数据表提取需将散点图中的数值转化为结构化表格;摘要生成考验模型提炼核心科学信息的能力;视觉问答(VQA)则通过布鲁姆分类法分层设计问题,从“记住事实”到“分析评价”逐步提升难度。例如,针对二硫化铅薄膜生长的五联图,问题从“能否在蓝宝石基底生长”到“缩短吹扫时间的影响”,答案格式涵盖是否题、简答题直至段落分析题,全面检验模型的综合推理水平。
现有模型的表现暴露出关键短板。在化学材料领域基准测试MaCBench中,模型虽能识别实验仪器与直接读数,但涉及空间推理或跨模态整合时准确率骤降。另一项研究显示,当移除图表周边文字提示后,模型仅依赖图像内容的判断能力显著下降。更基础的研究揭示,强模型如GPT-4V存在“视觉绑定错误”,例如混淆“红色圆形”与“蓝色方形”的属性关联。这些发现表明,模型的语言流畅性常掩盖其视觉理解的真实缺陷——看似合理的回答可能只是训练数据的套路复现,而非针对具体图表的深度解析。
该基准的深层目标在于推动AI像科学家一样思考。当前评测常将理解简化为单一分数,而真实科研需通过多证据关联、条件对比与结论验证形成完整逻辑链。为此,研究规划了三大延伸方向:其一,拓宽领域至薄膜合成、催化等材料科学子领域,再扩展至化学工程、能源生物医学等学科,按图表功能分类以测试模型迁移能力;其二,引入反事实测试,例如修改关键数值或交换标签,观察模型答案是否合理变化,以此区分真实推理与表面解释;其三,设计“影子挑战”,要求AI综合未发表研究的文献与图表,提出假设并生成研究提案,由专家评估其科研独立性。
ALD/E-ImageMiner数据集已通过GitHub与Hugging Face公开,包含图像、标注与评测脚本,采用混合授权模式:标注数据遵循CC BY 4.0开放协议,但原始图片版权仍归论文作者所有,商用需另行核实。四个竞赛赛道长期开放提交,涵盖图表分类、数据提取、摘要生成与视觉问答。研究强调,像素级标注与反事实测试等设计,本质上是对评测方式的革新——若允许模型“差不多正确”地回答,将纵容其蒙混过关,而科学理解需要近乎苛刻的精确性。











