ITBear旗下自媒体矩阵:

AI数据侦探大挑战:港科大团队设“数据迷宫”检验真实能力

   时间:2026-08-22 03:37:34 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

基金公司分析师面临突发任务时,需要从分散在JSON文件、CSV表格、数据库、PDF报告和风控视频中的碎片信息中,拼凑出符合要求的完整数据表格。这种真实场景中的复杂数据分析需求,正成为人工智能领域的新挑战。香港科技大学(广州)与清华大学联合团队构建的DataSpace测试平台,通过模拟这种真实环境,揭示了当前AI数据助手的性能边界。

研究团队开发的评测体系包含410道跨语言任务,覆盖金融、医疗等四大领域,配套7439个测试文件总容量达15GB。这些资料以CSV、JSON、SQLite等六种格式呈现,包含中英文混排内容。测试要求AI不仅需要自主定位关键信息,更要完成多源异构数据的清洗、关联和计算,最终输出符合严格格式规范的完整表格。实验结果显示,六款主流多模态大模型中表现最优者正确率仅66.34%,集体解题覆盖率不足82%。

评测平台构建过程采用创新技术路线。研究人员基于医疗EHRSQL和金融BULL两个权威数据库,通过"关联感知翻译"技术实现跨语言转换,确保同一实体在不同文件中的表述一致性。在数据抽样阶段,开发的"关系闭包"算法能智能保留查询所需的关键行及其关联数据,避免破坏数据间的逻辑链条。对于长文档生成,系统强制要求AI准确还原数据单元格内容,同时允许在连接词等非关键部分自由发挥。

视频证据处理是该评测体系的突出创新。研究团队借鉴DataMagic研究成果,将表格数据转化为可视化证据时采用两种策略:对于复杂查询,将筛选条件转化为视频中的配置面板;对于结果紧凑的查询,则将关键数值分散展示在不同画面。这种设计有效防止AI直接截取视频中的结果表格,迫使其必须理解视频内容与查询逻辑的对应关系。

实验发现不同AI模型在跨模态整合任务中表现差异显著。需要同时处理文档、视频和数据库的题目,对所有模型的正确率影响幅度在1.8至14个百分点之间。表连接操作成为普遍难题,导致正确率下降9.7至19.8个百分点。值得注意的是,52.2%的错误发生在最终答案组装环节,22.8%源于题目理解偏差,而资料定位错误仅占0.7%。这表明当前AI在逻辑推理和结果交付精度方面存在明显短板。

工具框架选择对AI性能影响突出。使用Grok Build工具箱的模型正确率比使用DataSpace-Agent高出17.8个百分点,显示优化行动模式和工具链设计的重要性。效率对比显示,GPT-5.6 Sol在保持64.63%正确率的同时,消耗资源仅为冠军模型的四分之一。但追求准确性仍需付出成本代价,Grok 4.5每题处理成本是MiMo-V2.5的15倍。

错误分析揭示深层挑战。在"列数错误"的案例中,仅58%源于最终组装失误,其余则与早期理解、计算错误相关。这种"症状与病因分离"现象,凸显现有评测体系仅关注最终结果的不足。研究团队特别开发的13阶段验证流程,通过专家盲测和证据讨论机制,确保每道题目的标准答案和评分规则经得起推敲。

该研究已公开60道完整测试题及标准答案,供学术界进行本地化测试。剩余350道题的标准答案采取保密措施,防止模型通过针对性训练获得不公平优势。详细技术方案记载于arXiv论文,涵盖跨语言对齐、安全抽样、视频渲染等关键算法的实现细节,为后续研究提供重要参考。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version