← 最新论文
💻 computer science

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

本文介绍了 DataSpace,这是一个全面的基准测试和 KDD Cup 2026 评估框架,旨在评估数据智能体从异构、多模态工作空间中生成可验证表格结果的能力,揭示了在多模态证据整合方面的显著性能差距,以及智能体控制工具(harness)选择对可靠性的实质性影响。

原作者: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜团的侦探,但你的线索散落在各处。有些在电脑上整齐的电子表格里,有些埋在长达50页的PDF报告中,有些隐藏在数据库内部,而最重要的线索可能是一段监控摄像头的视频。这正是“数据智能体”(data agents)的日常现实——这些聪明的计算机程序旨在通过搜寻组织内杂乱无章的数字文件来回答问题。长期以来,科学家们一直在用干净、单一类型的谜题来测试这些智能体,比如在电话簿中查找一个名字,或者向数据库询问一个简单的问题。但在现实世界中,数据是语言、格式和媒介交织在一起的混乱混合体。研究人员提出的核心问题是:这些数字侦探是否真的能够从一堆杂乱的证据中拼凑出一个完整的故事,还是说当线索看起来不再统一时,它们就会迷失方向?

这篇论文介绍了一个全新的、极具挑战性的测试,名为 DataSpace,旨在精确评估这些数据智能体的能力。研究人员构建了一个庞大的游乐场,其中包含 410 个不同的任务7,439 个数字人工制品(文件),总数据量达 15.01 GB。他们并非只是随机地将文件堆在一起;他们创建了一个“异构工作空间”,在这里,一个问题可能需要你观看一段视频、扫描一份 PDF、查询一个数据库,并交叉引用一个 JSON 文件,同时还要处理用英文和中文编写的线索。其目标不仅仅是找到一个单一的事实,智能体必须生成一张完整的、可验证的表格作为答案,就像一份最终的成绩单一样。

测试结果发出了一记警钟。即使是经过测试的最聪明、最先进的 AI 模型(包括像 Grok 4.5 和 GPT-5.6 这样的巨头)也仅能正确解决约 66.34% 的任务。这意味着它们大约每三个谜题中就会出错一个。研究人员发现,当智能体需要结合不同类型的媒体信息(例如将视频线索与电子表格进行关联)或需要执行复杂的“连接”(将来自两个不同来源的数据进行关联)操作时,它们的表现最为吃力。有趣的是,“控制框架”(harness)——即告诉 AI 如何使用其工具的软件框架——的选择几乎与 AI 本身的大脑一样重要,它会导致高达 15.36 个百分点的分数差异。

最终,这篇论文表明,尽管数据智能体正在变得越来越好,但远未达到完美的程度。它们经常能得到正确的数字,却无法正确格式化最终表格,或者漏掉了隐藏在视频中的关键线索。作者得出结论:在这些智能体能够完全独立处理复杂的、多格式数据分析之前,我们还有很长的路要走;他们提供这一基准测试,旨在为未来的工程师提供一份帮助其修复这些特定弱点的地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →