← 最新论文
🤖 machine learning

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

本文介绍了Workspace-Bench,这是一个具有真实文件依赖关系和多样化任务的大规模基准测试,用于评估AI智能体的工作空间学习能力,结果表明当前模型在处理复杂的跨文件推理和决策方面显著落后于人类表现。

原作者: Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Weizheng Wang, Hongzhang Huang, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen
发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Weizheng Wang, Hongzhang Huang, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen, Chunwei Liu, GuoLiang Li, Jihua Kang, Fan Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位超级聪明的机器人助手来协助你的工作。你给它一个装满文件的文件夹:电子表格、电子邮件、PDF 文档、代码和旧草稿。你的目标是让机器人找到正确的信息片段,理清它们之间的关联,并撰写一份报告。

Workspace-Bench 是一项庞大而逼真的测试,旨在检验当今的 AI 机器人是否真的能够胜任这项工作,而不会迷失方向、陷入困惑或捏造事实。

以下是用简单类比对论文发现的拆解:

1. 问题所在:“洁净室”与“凌乱办公桌”

以往大多数针对 AI 的测试,就像给学生一本完美的教科书,然后提一个问题。AI 只需阅读页面并作答。

  • 现实情况:真实的工作就像一张凌乱的办公桌。你有 20,000 个文件,散落在 74 种不同的格式中(Excel、代码、PDF、电子邮件)。有些文件是旧草稿,有些是最终版本,还有些只是笔记。
  • 测试内容:研究人员构建了5 个不同的“数字办公室”(分别针对物流经理、研究员、开发人员等)。每个办公室都是一个拥有数千个文件的庞大且凌乱的数字空间。随后,他们向 AI 提出了 388 项不同的任务,例如“根据去年的销售数据和本周的电子邮件撰写一份战略报告”。

2. 重大发现:AI 仍然容易迷失

研究人员测试了 28 种不同的 AI“大脑”(模型)与 AI“身体”(允许 AI 使用工具的软件框架)的组合。

  • 得分:表现最佳的 AI 组合仅正确掌握了约 69% 的细节。平均水平的 AI 得分甚至低于 50%
  • 人类对比:当真实人类在工具辅助下完成同样的测试时,得分为 81%
  • 类比:想象一场比赛,人类选手在 10 分钟内完成,而最快的机器人却花了 20 分钟,并且仍然被自己的脚绊倒。论文指出,对于真实的办公室工作而言,当前的 AI“远不可靠”。

3. 它们为何失败?(三大主要瓶颈)

论文发现了 AI 表现不佳的三个具体原因:

  • “时间旅行”问题(谱系追踪)
    真实的工作空间中有名为 report_v1report_reviewedreport_final 的文件。AI 经常抓取错误的版本(例如使用旧草稿而非最终版本)。它无法理解文件的“家族树”。
  • “翻译”问题(异构理解)
    AI 擅长阅读文本,但难以将 PowerPoint 中的图表与 Excel 表格中的原始数据联系起来,或者无法将代码文件与会议记录结合起来理解。它将不同类型的文件视为无法相互翻译的独立语言。
  • “大海捞针”问题
    当任务变得困难(需要 AI 在 6 个以上的不同文件之间建立联系)时,AI 的性能会急剧下降。它被海量数据压垮,错过了关键的联系。

4. 尝试的“成本”

论文注意到 AI 解决问题方式的一个有趣现象:

  • “原地打转”效应:某些 AI 设置非常努力,进行了 60 多步的自我对话,并消耗了巨大的计算资源(tokens)。但尽管付出了如此多的努力,它们仍然给出了错误的答案。
  • “聪明且快速”效应:表现最佳的 AI(OpenClaw + Opus-4.7)以较少的步骤和更少的计算资源快速解决了问题,并给出了正确答案。这表明推理质量比单纯的努力尝试更重要

5. 未来:五个成长阶段

作者设想了 AI 学习在办公室工作的五个阶段,就像攀登梯子一样:

  1. L0(被动顾问):AI 仅提供建议;人类负责执行工作。
  2. L1(被动执行者):人类说:“打开文件 A 并复制到文件 B。”AI 执行操作,但不理解为什么要这样做。
  3. L2(依赖推理者):AI 开始理解文件 A 依赖于文件 B。(当前的 AI 正挣扎于无法超越这一阶段)。
  4. L3(主动探索者):AI 能够环顾整个办公室,自主找到所需的文件并解决问题。(这是论文指出我们尚未达到的“能力奇点”)。
  5. L4(自我进化伙伴):AI 从每项任务中学习,记住你的习惯,并随着时间推移在你的特定工作中变得更强。

总结

Workspace-Bench 是一次现实检验。它表明,虽然 AI 在交谈和写作方面有所进步,但在驾驭真实人类办公室那种混乱、相互关联且版本受控的世界方面,它仍然非常糟糕。在 AI 能够可靠地追踪文件历史并连接不同类型的文档之前,它将需要一名人类“飞行员”来确保其不偏离轨道。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →