← 最新论文
💬 NLP

Holistic Evaluation and Failure Diagnosis of AI Agents

本文提出了一种整体评估框架,该框架将自上而下的诊断与自下而上的跨度级评估相结合,以有效定位和分类人工智能智能体的故障,在 TRAIL 基准测试中实现了最先进的性能,并证明了评估方法而非模型能力才是智能体诊断的主要瓶颈。

原作者: Netta Madvil, Gilad Dym, Alon Mecilati, Edo Dekel, Jonatan Liberman, Rotem Brazilay, Liron Schliesser, Max Svidlo, Shai Nir, Orel Shalom, Yaron Friedman, David Connack, Amos Rimon, Philip Tannor, Shir
发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Netta Madvil, Gilad Dym, Alon Mecilati, Edo Dekel, Jonatan Liberman, Rotem Brazilay, Liron Schliesser, Max Svidlo, Shai Nir, Orel Shalom, Yaron Friedman, David Connack, Amos Rimon, Philip Tannor, Shir Chorev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一支 AI 机器人团队来解决一个复杂的谜题,比如在一部 20 分钟的 YouTube 视频中寻找隐藏的具体数字,或者修复一段损坏的软件代码。有时,机器人会成功;有时,它们会失败。

根据这篇论文,问题在于当前检查它们工作的方式,就像一位只看试卷最终答案的老师。如果答案错了,老师就标记为“失败”然后继续。他们不会告诉你为什么错了,也不会指出在 50 步的过程中机器人是在哪一步感到困惑的。是它误读了指令?还是使用了错误的工具?或者只是编造了一个数字?

来自 Deepchecks 的作者们构建了一个新的“整体评估框架”,它就像一个超级细致的侦探。它不只是给最终结果打分,而是将机器人的整个旅程分解成微小、可管理的步骤(他们称之为“片段”),以精确定位问题出在哪里。

以下是他们系统的工作原理,使用简单的类比来说明:

1. 双管齐下的侦探方法

作者们意识到,仅从一个角度观察机器人的工作是不够的。他们结合了两种不同的视角:

  • “自下而上”的侦探(显微镜):
    想象一下检查机器人使用的每一个工具。机器人是否提出了正确的问题?它得到的回答是否合理?在尝试打开文件时是否崩溃了?

    • 类比: 这就像机械师检查汽车引擎中的每一个螺栓和电线。如果一个螺栓松动,他们会立即发现。这对于发现具体错误(如命令中的拼写错误或工具损坏)非常有效,但可能会忽略大局(比如机械师完全看错了车)。
  • “自上而下”的侦探(鸟瞰图):
    这着眼于整个旅程。机器人是否遵循了自己的计划?它是否浪费了时间,把同一个问题问了五遍?它是否忘记检查关键信息?

    • 类比: 这就像空中交通管制员观察整个飞行路径。即使每个引擎部件都完美运行,他们也能看出飞机是否走了奇怪的弯路或浪费了燃料。

魔力所在: 通过同时使用“显微镜”和“鸟瞰图”,该系统不仅能告诉你什么出错了(例如“幻觉”),还能告诉你在哪里出错的(例如“第 14 步,当询问搜索工具时”)。

2. 旧方法为何失败

该论文使用一项名为 TRAIL 基准 的严苛测试(该测试使用查找数据或修复代码等现实世界任务)来测试他们的新系统与旧方法。

  • “单体法官”(旧方法):
    想象一下,要求一个非常聪明的人类一次性阅读一份 100 页的报告并找出所有错误。

    • 问题: 随着报告变长,人类会感到不堪重负。他们可能会漏掉第 45 页的错误,因为他们正专注于第 100 页。在论文中,即使是最聪明的 AI 模型(如 GPT-5.4),在被要求一次性完成时,也无法在长而复杂的任务中准确找出具体错误。它们或许能猜出什么类型的错误发生了,但无法指出在哪里发生的。
  • “新框架”(聪明的方法):
    与其让一个人读完整本书,不如想象一个专家团队。一个人检查第 1 页,另一个人检查第 2 页,依此类推。然后,一位主管汇总他们的笔记。

    • 结果: 即使任务非常长,系统也没有感到不堪重负。它以高得多的准确率发现了错误。

3. 结果:巨大的胜利

当他们把新系统与现有的最佳方法进行比较时:

  • 定位“在哪里”: 他们的系统在精确定位哪一步失败方面,表现比现有方法好 3.5 倍。在最难的测试中,它在同时发现错误类型及其位置方面,表现好 12.5 倍
  • “同一大脑,更好方法”的惊喜: 他们在旧方法和新方法中使用了完全相同的超智能 AI 模型(GPT-5.4)。
    • 旧方法: 该 AI 在查找长代码任务中的错误时,准确率为 7%。
    • 新方法: 同一个 AI 的准确率达到了 86%。
    • 结论: 问题不在于 AI 不够聪明;问题在于方法本身——即要求它评估工作的方式是行不通的。改变方法释放了 AI 的真正潜力。

4. 这意味着什么(根据论文)

论文得出结论,要修复 AI 智能体,我们需要停止只关注最终得分。我们需要一个系统,将工作分解为小的、独立的块,以精确诊断故障。

他们还指出,他们使用的测试数据(TRAIL)存在一些混乱的标注(例如人类将错误的步骤标记为错误),但即使存在这些缺陷,他们的新方法仍然彻底击败了竞争对手。

简而言之: 该论文认为,我们不需要更“聪明”的 AI 来评估 AI 智能体;我们需要一种更聪明的方法来评估它们。通过将大问题分解为小的、可管理的部分,他们的系统发现了其他方法完全遗漏的错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →