当人工智能视觉问答系统给出正确答案时,人们往往容易忽略其推理过程是否可靠。近期,由香港科技大学(广州)、香港大学、清华大学及萨塞克斯大学联合研发的LedgerMind框架,为解决这一核心问题提供了全新思路。该系统通过建立结构化证据台账,确保AI每一步推理都有实际证据支撑,有效遏制了"答案正确但理由虚构"的行业痛点。
研究团队发现,当前多模态大语言模型存在四大典型缺陷:答案正确但推理过程掺杂无依据声明、引用证据编号真实但内容被篡改、简单问题过度复杂化导致错误、自我修正时引入新虚构内容。这些隐患在医疗诊断、法律分析等高风险场景中尤为危险,可能因虚假推理链引发严重后果。LedgerMind框架的提出,正是为了构建可审计、可追溯的AI推理机制。
针对不同复杂度的问题,LedgerMind设计了自适应双路径调度器。对于"图片中有几只猫"等简单问题,系统直接调用基础工具快速作答,避免过度推理;对于需要结合外部知识的复杂问题,则启动完整推理流程,包括视觉元素提取、多轮网络搜索、证据综合分析等步骤。这种动态调整机制使系统在通用视觉语言基准测试中,准确率提升幅度达11.8至23.3个百分点,尤其在需要精确读图的数学、物理子集表现突出。
在修复机制方面,系统摒弃传统AI的自由文本重写模式,转而采用七种严格限定的操作类型。当检测到工具错误、证据过期或引用不一致时,系统只能通过废弃旧证据、调用备用工具、补充关键证据等预设操作进行修正。这种设计确保修复过程不会引入新的无依据内容,实验显示修复成功率提升40%以上,同时将"错误答案看似有依据"的情况减少65%。
为全面评估推理质量,研究团队定义了四个核心指标:无证据支撑声明比例、决策声明证据覆盖率、正确答案的依据充分率、错误答案的虚假依据率。在包含200道高难度题目的压力测试中,LedgerMind使所有底层模型的推理质量指标均提升11.2至19.7个百分点,特别是在需要细粒度视觉感知的任务中,表现尤为显著。
该框架的突破性在于将AI推理从"黑箱操作"转变为"可审计账本"。在医疗影像分析场景中,系统能清晰展示每个诊断结论依据的原始图像区域和文献片段;在合同审查应用中,可追溯每条法律条款的匹配证据和推理路径。这种透明度对于需要理解AI决策逻辑的用户具有重要价值,尤其在需要问责制的专业领域。
尽管当前版本主要针对静态图文问答优化,研究团队已指出未来改进方向:开发动态时效策略以处理视频流数据,增强跨语言实体链接能力,以及探索学习型调度策略应对更复杂的问题分布。该框架的完整技术细节,包括算法伪代码、提示模板和实验数据,已通过预印本平台公开共享,供全球研究者验证与拓展。











