← 最新论文
💬 NLP

DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

本文介绍了 DSAgentBench,这是首个旨在评估 AI 智能体在真实计算机环境中自动化端到端数据科学工作流能力的基准测试,揭示了即使是最强大的模型在工具编排和多步推理方面也存在显著的性能差距。

原作者: Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque Prince

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque Prince

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:DSAgentBench

问题陈述

现实世界的数据科学涉及复杂的、长程的工作流,涵盖数据清洗、探索、建模、可视化和验证。这些任务需要协调使用多种工具——包括笔记本(Notebooks)、IDE、终端、浏览器和数据库——并在一个功能完备的操作系统内运行。虽然最近的大型语言模型(LLM)进展已展示了生成代码或执行孤立分析任务的能力,但现有的基准测试未能评估智能体是否能在真实的计算环境中自主执行完整的端到端数据科学工作流。

目前的基准测试主要分为两类:一类是仅评估孤立的代码生成(如 DS-1000, DSEval),不需要系统交互;另一类是评估通用的计算机控制(如 OSWorld, WebArena),但未评估特定领域的分析推理能力。因此,目前缺乏能够测试智能体在真实操作系统环境下导航文件系统、管理依赖、解释错误并根据中间输出优化分析能力的评估框架。

方法论

基准测试构建 (DSAgentBench)

作者引入了 DSAgentBench,这是首个旨在评估真实操作系统内自主数据科学工作流的基准测试。该基准测试包含 275 个多样化的、由人类编写的任务,覆盖了整个数据科学生命周期。

  • 任务公式化: 任务被定义为三元组 (Ci,Ii,Vi)(C_i, I_i, V_i),其中 CiC_i 是初始系统配置(数据集、文件结构、已安装库),IiI_i 是自然语言指令,ViV_i 是确定性的 Python 评估器。
  • 数据来源: 数据集取自异构的真实世界来源,包括 Kaggle、OpenML、GitHub、SQLite 数据库和 Web API。数据包含表格型(95.3%)、图像型(3.6%)和文本型(1.1%)模态。
  • 任务类别: 任务分为六个能力类别:数据获取、探索性数据分析 (EDA)、特征工程、建模、评估/部署以及可视化/报告。
  • 评估协议: 不同于仅对代码执行进行评分的基准测试,DSAgentBench 采用确定性评估器来验证分析正确性、视觉输出质量和模型性能。只有当智能体的最终输出满足评估器标准(得分 0.95\ge 0.95)时,任务才被视为成功。
  • 构建流水线: 该基准测试通过三个阶段构建:获取数据集、由人类专家协作设计任务/评估器(仅使用 LLM 进行优化),以及双重标注员验证以确保可复现性和技术正确性。

环境架构

DSAgentBench 扩展了 OSWorld 框架以创建真实的执行环境:

  • 操作系统: 预装了 Python 和数据科学库的 Ubuntu。
  • 工具: Visual Studio Code、Jupyter Notebook、Chrome,以及访问 Kaggle/OpenML API 的权限。
  • 观测空间: 智能体接收 1920×1080 截图,或混合了 截图 + 可访问性树 (A11y Tree) 的模态,后者提供了结构化的 UI 元数据(角色、边界框、交互状态)。
  • 动作空间: 智能体通过 GUI 动作(鼠标点击、键盘输入)和元动作(WAIT, DONE, FAIL)进行交互。环境在每次动作后捕获状态转换。

评估的模型

作者评估了 15 个闭源和开源智能体,包括:

  • 闭源模型: GPT-4o, GPT-5 (及 mini), O4-mini, Claude Sonnet 4/4.5/4.6, Gemini 2.5 Pro, 以及 OpenAI 的 Computer Agent。
  • 开源模型: UI-TARS (2B/7B), GUI-OWL-7B, OpenCUA-72B, 以及混合模型(由 Jedi 搭配 GPT-4o 组成)。

关键结果

整体性能

实验揭示了当前智能体系统与真实数据科学需求之间存在巨大的能力差距:

  • 最强智能体: Claude-4.6-Sonnet 在“截图 + A11y Tree”设置下取得了最高性能,任务成功率为 56.70%
  • 其他闭源模型: 其他模型的性能显著下降,GPT-5 为 29.81%,而其他模型(如 GPT-4o, Gemini-2.5-Pro)则在 20% 左右徘徊。
  • 开源模型: 所有开源智能体的成功率均 低于 1%,经常在工具编排、OS 落地(grounding)和多步推理方面失败。
  • 人类基准: 人类专家达到了 85.09% 的成功率,凸显了即使是最强的 AI 智能体也存在的差距。

消融实验与错误分析

  • 任务复杂度: 性能随难度增加而单调下降。“困难”任务(5 步以上)仍然是最具挑战性的。多阶段工作流(占任务的 56.7%)由于需要维护状态和错误恢复,比单阶段任务要困难得多。
  • 工具使用: 在 Jupyter Notebook 中执行的任务表现优于 VS Code,这主要是因为减少了与终端和环境相关的失败。
  • 观测模态: 添加 A11y 树信息通常能提高性能,表明结构化的 UI 元数据有助于实现落地(grounding),尽管增益因模型而异。
  • 失败模式:
    • 开源智能体几乎完全失败(97–98%),原因是 落地错误(无法将指令与桌面状态对齐)。
    • 较强的闭源智能体表现出混合型失败,包括终端错误、代码生成缺陷和推理不足。
    • 时间结构: 开源模型和较弱的模型经常在早期失败(无法打开终端),而较强的模型则倾向于在经过长时间且无效的探索后,在后期阶段失败。
  • 预算敏感性: 将交互预算从 15 步增加到 50 步仅带来了微小的收益(24.54% \to 25.81%),这表明失败的主要原因并非步骤限制,而是规划和推理方面的根本问题。

重要性与主张

本文将 DSAgentBench 定位为开发具备落地能力、可验证且自主的数据科学智能体的基础资源。其主要贡献在于:

  1. 首个真实 OS 基准测试: 它是第一个在功能完备的操作系统内评估自主数据科学工作流的基准测试,覆盖了从数据获取到验证的完整生命周期。
  2. 基于执行的评估: 它将评估范式从“代码正确性”转向“分析正确性”,要求智能体产生由确定性脚本验证的有效产物(可视化图表、模型、报告)。
  3. 揭示差距: 结果暴露了当前智能体系统的重大局限性,证明了即使是最强的模型,在处理数据科学所需的工具协调、长程推理和 OS 落地方面也面临困难。
  4. 未来方向: 通过识别特定的失败模式(落地、规划、工具编排),该基准测试为开发能够执行现实世界数据科学任务的智能体提供了清晰的研究路线图。

作者发布了该基准测试,地址为 https://github.com/vis-nlp/DSAgentBench,以促进该领域的进一步研究。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →