在人工智能被视为推动科学进步重要力量的当下,一项新研究却给这一乐观预期泼了冷水。最新实验表明,即便配备充足资源,当前最先进的AI系统仍无法独立完成高质量的科学研究任务,其撰写的论文甚至难以通过顶级学术会议的初审。
由国际研究团队主导的这项测试,选取了多款被设计用于自主执行复杂任务的AI系统,要求它们在六天内围绕两个尚未公开的人工智能前沿课题展开研究并撰写论文。这两个课题分别聚焦语言模型"人格"的构建机制,以及表格型基础模型的分布偏移检测方法,均为当前AI领域的热点研究方向。
为确保测试真实性,研究人员为AI提供了相当于三千美元的模型使用额度、无限制的互联网访问权限,以及专属计算资源。这些条件理论上足以支持AI进行大量实验验证和数据分析。然而当人类专家按照顶级学术会议标准评审时,两篇论文分别仅获得2分和1分(满分6分),均达到直接拒稿标准。
评审专家指出,AI虽然能理解研究问题并提出初步方向,但其科学推理存在根本性缺陷。实验设计被形容为"缺乏逻辑连贯性",研究结论更像是"从结果倒推的拼凑产物"。有专家特别批评某篇论文存在"以偏概全"的逻辑错误,仅通过少量失败案例就得出普遍性结论,这种"举例证明"的推理方式严重违背科学规范。
更令人意外的是,这些AI系统在面对评审意见时表现出明显的局限性。它们往往只是在原有结论上添加补充说明,而非重新设计实验方案。尽管拥有充裕时间和预算,其实际资源使用率不足50%,却仍呈现出"赶工"特征,提交的论文在方法论和论证深度上均未达到发表标准。
这种表现与真实科研场景形成鲜明对比。国际权威期刊《自然》近期发布的行业报告显示,在需要创造性思维和复杂推理的科研任务中,人类科学家仍具有不可替代的优势。中国科学院院士周志华也公开指出,当前AI系统在原创性研究方面存在明显短板,这从侧面印证了AI在科研核心环节的局限性。
不过研究团队强调,这并不否定AI在科研领域的价值。目前AI系统在代码编写、文献检索、实验流程自动化等辅助性工作中已表现出色。但要从"科研工具"升级为"科研主体",AI仍需突破关键瓶颈:如何形成完整的科研闭环,包括自主提出假设、设计实验、处理失败结果并进行自我修正。
图灵奖得主姚期智在近期学术会议上指出,认识AI的局限性恰是推动人机协作的关键。科学发现本质上是在不确定性中探索的过程,需要研究者具备承受失败、调整方向的能力。这种基于经验积累的判断力和韧性,目前仍是人类独有的优势。










