← 最新论文
💬 NLP

WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

本文介绍了 WorkSurface-Bench,这是一个包含 1,151 个可审计任务的新基准,旨在评估企业级智能体在异构知识表面(文档、表格和图谱)之间路由查询的能力,研究表明,虽然智能体可以实现较高的路由准确率,但仅靠正确的表面选择不足以实现高任务完成率。

原作者: Hao Liang, Meiyi Qiang, Sizhe Qiu, Linzhuang Sun, Wentao Zhang

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Liang, Meiyi Qiang, Sizhe Qiu, Linzhuang Sun, Wentao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一个超级聪明的机器人助手来帮你管理一个繁忙的办公室。你问它一个复杂的问题,比如:“上个月我们的运费支出是多少,哪些文件导致了延迟?”为了回答这个问题,机器人不能靠瞎猜;它需要去查找信息。但问题在于,这个办公室有三种截然不同的信息架:一个是装满书面报告和 PDF(文档)的图书馆;一个是堆满行与列、包含数字和计算的电子表格室;还有一个是展示每个文件如何与其他文件连接的地图室(图谱)。

长期以来,测试这些机器人的科学家们主要是在问:“你得到正确答案了吗?”如果机器人找错了房间、选错了书或者算错了数学题,测试结果只会简单地显示“失败”。但这并不能告诉我们失败的原因。是机器人不知道自己需要去地图室吗?还是它去了地图室,找到了正确的地图,但在阅读时产生了困惑?这篇论文针对这一空白提出了解决方案。它引入了一种新的测试方式,通过将选择正确房间的行为与进入房间后解决谜题的行为进行分离。它在问:机器人能否在开始寻找之前,就搞清楚自己需要哪种类型的知识?

新的游戏:WorkSurface-Bench

研究人员构建了一个新的测试场,叫做 WorkSurface-Bench。你可以把它想象成一个巨大的、真实的办公室模拟器,其中包含 1,151 个不同的任务。他们设置了五种不同的“人格”(比如物流经理或财务分析师),并让他们可以使用三种不同的“表面”:文档库、表格数据库和文件关系图。

这里最大的创新在于他们是如何给机器人评分的。他们不再仅仅根据最终答案给出通过或失败的判定,而是分别对两件事进行评分:

  1. 路径(Route): 机器人是否选择了正确的“表面”(图书馆、电子表格或地图)?
  2. 答案(Answer): 在选择了正确的表面后,它是否真正正确地解决了问题?

他们为每一个答案都创建了一个“金标准”。如果任务涉及数学计算,他们会运行实际的代码来获取真实答案。如果需要阅读文档,他们会检查源文件中的确切文字。如果需要文件连接,他们会追踪实际的路径。这意味着“正确”的答案不仅仅是另一个 AI 的猜测,而是一个经过验证的事实。

大惊喜:知道去哪里看并不足够

团队在六种不同的场景下测试了四种目前最智能的 AI 模型(包括 GPT-4o-mini、DeepSeek-V4-Pro、Gemini-3.1-Pro 和 GPT-5.5)。他们想看看,如果通过明确告诉机器人应该去哪个房间来简化工作,是否能修复它的错误。

以下是他们的发现,这有点像剧情反转:知道去哪里看并不能保证你能找到答案。

当研究人员强制要求机器人只能使用正确的表面(一种“金约束”设置)时,机器人在选择正确房间方面的表现近乎完美。它们的“路径”得分跳升到了 98.7% 到 99.8% 之间。它们完全知道该去哪里。

然而,它们的“答案”得分——即最终解决方案的正确率——仅达到了 56.1% 到 75.3% 之间。

这意味着,即使机器人站在正确的房间里,手里拿着正确的地图,它仍然有一半以上的时间会答错。它可能找到了正确的文件,但读错了数字,或者可能错误地组合了来自电子表格和文档的信息。这篇论文表明,“选择正确的工具”和“正确使用工具”是两种完全不同的技能,擅长其中一项并不自动意味着擅长另一项。

提示 vs. 限制

研究人员还玩了一个有趣的“给提示”与“去干扰”的游戏:

  • 提示(The Hint): 他们告诉机器人:“你需要查看电子表格和地图。”这有助于机器人更好地选择正确的表面,并且对于某些模型来说,这略微提高了它们的最终答案质量。
  • 限制(The Restriction): 然后,他们拿走了所有机器人不需要的其他工具。这让机器人的运行速度更快、效率更高,并且它们选择正确表面的表现也更好。但令人惊讶的是,这并不总是能让最终答案变得更好。事实上,对于某些模型来说,移除多余的工具反而让它们解决问题的能力下降了,这很可能是因为它们失去了利用另一种工具来反复检查工作的能力。

这对未来意味着什么

论文的结论是,我们不能再仅仅通过最终得分来衡量 AI 智能体了。如果一个 AI 答错了问题,我们需要知道它是由于不知道该找什么而失败,还是因为它虽然找到了正确的地方,却无法处理所发现的信息。

作者通过对机器人进行的 27,624 次不同尝试进行了测量,并且由于他们通过人工检查和严格规则对结果进行了审计,因此非常确定这些数字。他们发现,虽然顶尖的机器人正在变得越来越擅长路径选择(98%+),但它们在最后一步——即正确整合信息——方面仍然感到吃力(大约 56–75%)。

简而言之,智能办公室机器人的未来不仅仅在于给它们提供更好的办公室地图,更在于教会它们如何在到达目的地后阅读指示牌并进行数学计算。这篇论文提供了一个全新的、详细的计分板,帮助开发者精确追踪机器人在哪里跌倒,从而让他们能够修复那个特定“坏掉”的大脑部分,而不是仅仅寄希望于整个系统能自行变好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →