技术摘要:DataSpace:针对异构工作空间中可验证分析的数据智能体基准测试
1. 问题陈述
数据智能体(Data agents)正成为组织数据的自然语言接口,但现实的分析场景提出了复杂的挑战:回答查询所需的证据很少仅包含在单个、干净的表格中。相反,信息散落在关系型数据库、结构化/半结构化文件(CSV、JSON)、长文档(PDF、Markdown)以及多媒体制品(视频)中,且往往涉及跨语言的变化。
现有的基准测试未能统一现实数据分析的三个关键属性:
- 工作空间范围(Workspace Scope): 它们通常孤立地处理结构化查询(如 Spider)或非结构化检索(如 HotpotQA),未能捕捉需要在任务局部工作空间内发现并整合跨异构模态证据的任务。
- 输出契约(Output Contract): 许多基准测试接受事实性答案、开放式报告或可执行流水线。而现实世界的分析通常要求一个完整的、类型化的表格结果,以便直接被消费。
- 评估语义(Evaluation Semantics): 当前的评估通常依赖于模型评判器,或者无法确定性地处理等价表示(例如,不同的列顺序、标题措辞或数值精度)。
本文认为,如果缺乏一个通过异构、跨语言工作空间并强制执行完整表格输出契约的统一基准测试,就无法准确衡量数据智能体可靠性的进展。
2. 方法论
2.1 DataSpace 基准测试
DataSpace 是一个包含 410 个跨语言任务和 7,439 个制品(总计 15.01 GB)的基准测试。
- 模态: 工作空间包括 CSV、JSON、SQLite、Markdown、PDF 和视频。
- 语言: 任务涉及跨语言场景,其中问题和工作空间中的制品可能混合使用中文和英文。
- 任务形式: 智能体接收一个自然语言问题和一个任务局部的工作空间。它必须自主发现来源、对齐实体/模式(schema)、执行多步计算(过滤、连接、聚合),并返回完整的请求表格结果(作为 CSV 文件)。
- 领域: 金融分析(基金、股票)、宏观经济数据和医疗分析。
2.2 DataSpace-Builder:构建框架
为了可靠地构建这些复杂的任务,作者提出了 DataSpace-Builder,这是一个执行落地(execution-grounded)的框架,旨在将现有文本转 SQL 基准测试(EHRSQL 和 BULL)中的实例转化为异构工作空间任务。该过程包含四个阶段:
- 跨语言转换(CLT): 对问题、数据库状态和可执行 SQL 进行联合迁移。它通过翻译实体名称和数值来确保引用一致性,同时保留标识符和代码。LLM 评判器负责验证翻译后的问题与 SQL 之间的语义对齐。
- 约束感知关系采样: 为了避免重复的工作空间,该框架在保留完整模式的同时对源数据库中的行进行采样。它使用安全集(主键/外键、查询谓词)来确保在采样过程中保持关系完整性(例如,保留连接路径)。
- 模态路由与制品渲染:
- 基础路由: 根据模式属性将表格分配给渲染器(CSV、JSON、SQLite、Markdown、PDF)。
- 文档渲染: 利用 LLM 从表格数据生成长篇文档(Markdown/PDF),确保“基于事实的生成”,即特定的单元格可以从文本中恢复。
- 视频渲染: 将表格数据转换为数据洞察视频。使用了两种策略:谓词抽象(将过滤条件移入视频叙述)和答案-证据渲染(将结果单元格分布在不同的视频场景中)。
- 人工审查与任务修复: 一个由 11 名领域专家组成的专家组进行盲审、独立评审。他们解决任务、验证金标准,并编写评估配置。分歧将触发针对问题、工作空间或金标准答案的基于证据的修复。
2.3 确定性评估器
评估协议是**无模型(model-free)且标题无关(header-invariant)**的:
- 列对齐: 评估器会寻找预测列与参考列之间的一一映射,无论其标题措辞或顺序如何。
- 归一化: 数值根据语义类型(文本、数字、日期、布尔值)和精度规则(例如,小数位数、百分比惯例)进行归一化。
- 行比较: 要求顺序的任务按序列进行比较;其他任务则作为无序多重集进行比较。
- 评分: 只有当完整的表格预测在这些语义下与参考值匹配时,任务才被视为正确。
3. 核心贡献
- 一个异构工作空间基准测试: DataSpace 引入了 410 个任务,要求将结构化文件、数据库、长文档和视频综合为一个可验证的表格输出。
- 一个执行落地的构建框架: DataSpace-Builder 将可执行的文本转 SQL 资源转化为复杂的多模态任务,通过采样安全机制和专家评审确保数据一致性。
- 一个语义感知的评估器: 一个确定性的协议,允许等价表示(列重排序、格式化),同时拒绝不完整或错误的输出,消除了对 LLM 评判器的依赖。
- 经验基准测试: 本文建立了六种前沿多模态模型和五种智能体框架(agent harnesses)的性能基准,识别了当前智能体能力的特定瓶颈。
4. 实验结果
作者评估了六种多模态骨干模型(Grok 4.5, GPT-5.6 Sol, Kimi K3, MiMo-V2.5, Claude Sonnet 5, MiniMax M3)和五种智能体框架(包括他们自己的 DataSpace-Agent)。
- 整体性能: 表现最好的配置(Grok 4.5 配合 DataSpace-Agent)实现了 66.34% 的准确率。这表明该基准测试是未饱和的,因为有 76 个任务被所有六种骨干模型漏掉,而只有 56 个任务被所有模型解决。
- 框架影响: 智能体框架的选择显著影响性能。在固定 MiMo-V2.5 骨干模型的情况下,不同框架之间的准确率差异高达 15.36 个百分点(范围从 30.98% 到 46.34%)。
- 主要挑战:
- 多模态集成: 与单模态任务相比,需要多模态证据的任务使所有骨干模型的准确率降低了 1.8–14.0 个百分点。
- 连接(Joins): 连接操作使准确率降低了 9.7–19.8 个百分点。
- 效率: 在使用比表现最好的 Grok 4.5 少 74.2% 的 Token 和 50.3% 的动作量的情况下,GPT-5.6 Sol 达到了接近顶尖的准确率 (64.63%)。
- 失败分析: 对 Grok 4.5 的 136 个失败案例进行的审计显示,52.2% 的错误源于答案物化(answer materialization)(例如,在计算出正确的内部结果后添加或遗漏了列或行),而非证据发现或提取。在 13 个“未提交”案例中,只有 5 个是纯粹的终止失败;大多数源于早期的持续性错误。
5. 重要性与主张
本文声称 DataSpace 为推进可靠数据智能体建立了一个严谨的试验场。其主要意义在于将评估范式从孤立的技能(如 SQL 生成或文档检索)转向端到端的工作空间求解,并辅以严格的可验证输出契约。
作者谦虚地总结道,虽然当前的前沿模型展现出了潜力,但在跨模态集成和连接(joins)方面仍存在显著差距。该基准测试强调,仅仅具备“寻找”数据的能力是不够的;智能体还必须能够忠实地物化精确请求的输出结构。结果表明,提高数据智能体的可靠性需要解决从异构证据发现到精确表格序列化的全流程问题,而不仅仅是关注推理能力。
DataSpace 作为 KDD Cup 2026 “复杂数据分析中的数据智能体”竞赛的官方评估基准,为该领域的未来研究提供了一个标准化、可复现的环境。