在半导体制造领域,原子层沉积(ALD)与原子层刻蚀(ALE)技术堪称核心工艺。它们如同高精度的积木搭建,以原子级别的精度在材料表面逐层添加或去除物质,支撑着手机芯片、电脑处理器乃至未来量子计算机的研发。然而,这些关键技术的科研成果往往隐藏在复杂的图表中——反应速率曲线、光谱图、能带结构示意图……这些信息密度极高的图表,人类专家能快速捕捉关键结论,但人工智能(AI)能否理解?一场名为ICDAR 2026 Sci-ImageMiner的竞赛试图给出答案。
竞赛聚焦于测试AI对专业科学图表的理解能力,任务设计从简单到复杂层层递进。第一关是图表分类,要求AI从49种预定义类型中识别图表归属,看似基础,实则暗藏挑战——例如“多光谱图”与“堆叠光谱图”的细微差异,可能只有资深研究者才能分辨。第二关是数据提取,AI需将图表中的数据还原为结构化的Markdown表格,这一任务需同时衡量数值准确性(相对映射相似度)与表格结构合理性(树编辑距离相似度)。第三关为摘要生成,考验AI将视觉信息转化为自然语言的能力,要求文字总结简洁且信息完整。第四关视觉问答(VQA)则是终极挑战,问题由人类专家设计,涵盖反应机制、材料性能、实验现象与实际器件关联等深度推理内容,例如“随着锗含量增加,导带预计如何变化?”,这要求AI不仅读懂图表,还需理解背后的物理化学规律。
数据集的构建是竞赛的基础。研究团队从205篇ALD/ALE领域论文中提取了1951张图表,涵盖折线图、分子结构图、光谱图等49种类型,几乎覆盖该领域所有常见图表形式。标注工作由10名具备研究生到博士后学历的领域专家完成,标注一致性(Fleiss' Kappa值)为0.46,属于中等水平。这一数字反映了任务的主观性——即使人类专家之间,对图表分类或问题设计的判断也存在分歧,更遑论训练AI。
竞赛吸引了68名参与者,累计提交1263次结果。分类任务中,冠军团队Ricoh_SRCB采用分层策略:先训练粗粒度模型将图表分为6大类,再训练精细模型区分49种具体类型,并针对易混淆类别添加辅助分类器。推理阶段同时输入整图与局部裁剪图,兼顾全局与细节。这一策略使其准确率达0.79,F1分数0.81,显著优于基线模型。数据提取任务冠军TeleOCR-VL则将“结构理解”与“数值识别”拆分为两个模型分别训练,并通过合成数据弥补标注不足,最终得分41.81(满分100)。摘要生成与视觉问答任务均由DeepVitminC团队夺冠,其方法核心是“上下文增强”——通过检索论文原文、图注等信息注入模型输入,避免AI凭空猜测专业术语或数值背景。例如,在视觉问答中,该团队结合规则提取与RAG(检索增强生成)技术,使加权得分达0.31,虽仍低于其他任务,但已属当前最佳水平。
竞赛结果揭示了AI的强项与短板。分类与摘要任务表现较好,准确率与加权得分分别达0.7以上与0.5以上,说明AI已能处理相对宏观的任务;但数据提取与视觉问答得分明显偏低,尤其是后者,反映出AI在精确数值提取与科学推理上的不足。例如,从能带图中推断材料性能变化,或理解掺杂对半导体电子结构的影响,这些需结合领域知识的推理,仍是AI的“盲区”。
获胜团队的共性策略值得关注。几乎所有排名靠前者均使用了Qwen系列开源视觉语言模型作为基座,并通过LoRA(低秩适应)等参数高效微调技术降低训练成本。注入文字上下文信息成为关键——图注、论文段落甚至前置任务输出,均被用于弥补纯视觉理解的局限。例如,Ricoh_SRCB团队在分类任务中,通过DPO(直接偏好优化)技术构造“硬负样本”(对正确答案进行随机扰动生成的错误版本),训练模型区分好坏答案,效果优于使用弱模型生成的错误样本。这一细节表明,教AI“识别错误”有时比“记忆正确”更有效。
竞赛也暴露了技术应用的边界。VLMinators团队尝试集成多个模型提升性能,结果因模型间判断分歧过大导致效果下降,说明“堆模型”并非万能。更深层的挑战在于标注一致性——人类专家对“深度理解”的判断尚未统一,又如何要求AI达到完美一致?例如,视觉问答中,问题设计需参照布鲁姆认知分类法,从“记住”到“创造”层层递进,但不同专家对“分析”与“评价”的界定可能存在差异,这为数据标注与模型评估增添了复杂性。
这场竞赛的意义不仅在于测试AI能力,更在于推动方法论的公开与复现。获胜团队已被邀请将方法整理为论文提交会议,为后续研究提供参考。此前,ICDAR相关竞赛聚焦化学结构识别,MacBench则针对化学材料科学设计多模态基准,而Sci-ImageMiner通过聚焦ALD/ALE领域,在标注质量与任务深度上实现突破。未来,若数据提取任务准确率能从40分提升至70分以上,实验室中堆积的图表数据或可被自动化转为结构化数据库,供检索与二次分析——这一前景,正等待技术进一步突破。











