← 最新论文
🤖 AI

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

本文介绍了 Counsel,这是首个针对智能体任务中“LLM 作为评判者”所生成的批判性内容的、经过人类验证的元评估公开数据集,它通过分析自动化评估器在错误定位和推理质量方面与人类判断的一致性,实现了对自动化评估器的校准与改进。

原作者: Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在组建一支由 AI 助手(智能体)组成的团队来处理复杂的任务,比如管理客户的香水订单或编写计算机代码。随着这些任务变得越来越难,检查 AI 是否做得出色就成了一个巨大的难题。

问题所在:“人类瓶颈”
把 AI 智能体想象成一个正在参加长篇多步考试的学生。为了完美地为考试评分,人类老师过去必须阅读学生采取的每一个步骤。

  • 现实情况: 对于复杂的任务,这需要花费数小时。如果你有 1,000 份试卷,你就需要一小支老师组成的军队工作数周。
  • 捷径: 为了节省时间,公司开始使用“AI 老师”(称为 LLM-as-a-Judge,即大模型作为评判者)来自动为考试评分。这些 AI 老师会写下评论,例如:“你忘记先检查用户的 ID 了!”或者“做得好,找到了那个文件!”

新问题:这些 AI 老师可靠吗?
问题在于,我们开始在没有检查它们是否真的擅长“撰写评论”的情况下,就盲目信任这些 AI 老师。

  • 有时,AI 老师能发现真正的错误并完美地解释它。
  • 有时,它会发现一个并非错误的错误(误报)。
  • 有时,它发现了真正的错误,但对于“为什么这是一个错误”给出了混乱或错误的解释。

直到现在,我们还没有一种方法来衡量这些 AI 老师在“撰写评论”这一特定工作上的表现究竟如何。我们只知道它们是否判断对了最终的“通过/失败”,但不知道它们的推理过程是否合理。

解决方案:“Counsel”
作者创建了一个名为 Counsel 的新数据集。你可以把它看作是 “老师的老师” 数据集。

  1. 设置: 他们选取了两个真实世界的场景:
    • 客户服务: 一个试图帮助客户更换香水的 AI 智能体。
    • 编程: 一个试图分析财务数据文件的 AI 智能体。
  2. 角色:
    • 学生: 尝试完成任务的 AI 智能体。
    • AI 老师(评判者): 一个观察学生并撰写评论(例如:“错误!你跳过了一个步骤”)的 AI。
    • 人类专家(元评估者): 一个真实的人类,负责阅读 AI 老师的评论,并判定其为:
      • “精准到位”: 你找到了正确的错误,并且解释得非常完美。 ✅
      • “位置正确,推理拙劣”: 你找到了正确的错误,但你的解释很弱或者是不正确的。 ⚠️
      • “不应标记”: 你认为存在错误,但学生实际上做得很好。 ❌

他们的发现
通过让通过人类来为 AI 老师评分,他们发现:

  • 更聪明意味着更好: 更强大的 AI 模型能成为更好的老师。
  • 思考得更深更有帮助: 当 AI 老师被要求在评分前进行更长时间、更深入的“思考”时,它犯错的情况会减少。
  • 最好的老师: 他们测试的最强的 AI 老师在关于“错误发生位置”上与人类专家的意见一致率为 88%,而在“推理过程”上的一致率为 65%

为什么这很重要
这个数据集就像是构建更好 AI 老师的“训练手册”。与其仅仅希望一个 AI 擅长评分,我们现在可以使用这些数据来:

  1. 测试 一个新的 AI 老师有多好。
  2. 训练 AI 老师写出更好的、更准确的评论。
  3. 过滤 掉糟糕的评论,以便开发者只看到高质量的评论。

简而言之
这篇论文介绍了一种“给评分者评分”的方法。正如你不会雇佣一个无法解释学生为什么答错题的老师一样,AI 领域也需要一种方法来确保其自动化评估工具确实能提供有用的反馈。Counsel 提供了第一个此类“关于评分的评分”的公开库,旨在帮助构建更可靠的 AI 系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →