← 最新论文
💬 NLP

An Empirical Study of Automating Agent Evaluation

本文介绍了 EvalAgent,这是一个通过将领域特定专业知识编码为可复用技能来自动化智能体评估的 AI 助手,证明了此类知识对于生成可执行且具有实质意义的评估代码至关重要,且该代码在性能上显著优于前沿代码助手和基线方法。

原作者: Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram, Aosong Feng, Vinayak Arannil, Muhyun Kim, Ishan Singh, Darren Wang, Zhichao Xu, Megha Gandhi, Nirmal Prabhu, Soumya Smruti M
发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram, Aosong Feng, Vinayak Arannil, Muhyun Kim, Ishan Singh, Darren Wang, Zhichao Xu, Megha Gandhi, Nirmal Prabhu, Soumya Smruti Mishra, Vivek Singh, Gouri Pandeshwar, Lin Lee Cheong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你构建了一个聪明、自主的机器人助手。它能预订航班、编写代码,还能诊断医疗问题。但你如何知道它是否真的表现良好呢?

过去,我们只检查最终答案:“它预订的航班对吗?”但现代 AI 智能体非常复杂;它们需要执行许多步骤,使用不同的工具,有时还会在过程中犯错,随后再自行修正。仅检查最终结果,就像只根据学生的期末考试成绩来评分,而忽略他们是否作弊、是否挣扎或是否掌握了知识。你需要观察整个过程。

问题在于,观察和评估这些复杂的机器人极其困难、昂贵,且需要人类专家。AWS AI 实验室的研究人员提出了一个简单的问题:我们能否构建一个“超级机器人”,自动为其他机器人评分?

以下是他们研究发现的简要说明。

问题:“聪明”的机器人却不懂如何评分

研究人员首先尝试使用最先进的编程助手(即“前沿”模型)来编写评分软件。他们向编程助手提供机器人的代码,并询问:“编写一个测试,看看这个机器人是否有效。”

结果是一场灾难。这些编程助手就像从未见过考试的过度热情的实习生

  • 它们衡量了错误的指标:它们没有检查机器人是否解决了问题,而是统计它使用了多少单词或思考了多长时间(如“延迟”和"token 计数”等指标)。
  • 它们过度复杂化一切:它们编写了庞大而混乱的测试套件,包含 12 个以上的不同测试,而实际上只需要 2 个。这就像用大锤砸坚果。
  • 它们迷失了方向:它们制定了完美的策略,但随后编写的代码却与计划不符。

教训:一个机器人擅长编写代码,并不意味着它知道如何评估代码。它缺乏什么是好测试的特定“常识”。

解决方案:EvalAgent(“专家评分员”)

为了解决这个问题,团队构建了EvalAgent。请将 EvalAgent 视为一个拥有专用工具包的机器人,而非通用的智能机器人。

EvalAgent 不只是靠猜测,而是携带一个包含评估技能的“背包”。这些是预先打包的指令、模板和最新的手册,明确告知机器人如何评分。

  • 程序化指令:“首先,观察机器人的旅程,而不仅仅是目的地。”
  • 可重用模板:“这是编写测试的标准方式,这样你就不必重复造轮子。”
  • 实时手册:“这是机器人所用工具的当前操作手册(这样我们就不会使用过时的命令)。”

EvalAgent 利用这些技能构建了一个基于轨迹的流水线。想象一下,一台监控摄像头记录了机器人的整个旅程。EvalAgent 观看视频,挑选出关键时刻(它是否使用了正确的工具?它是否从错误中恢复?),并基于实际发生的情况而非代码看起来的样子来撰写报告。

验证:它奏效了吗?

研究人员创建了一个名为AgentEvalBench的“健身房”,其中包含 20 个不同的机器人(从旅行规划器到医疗文档处理器),以测试他们的系统。他们将 EvalAgent 与“通用编程助手”及其他方法进行了比较。

结果

  1. 它确实有效:EvalAgent 的测试在首次尝试中就有**65%**的成功运行并给出了有意义的结果。而其他方法约有 70% 的情况失败或给出了无用的结果。
  2. 人类更青睐它:当人类专家查看报告时,**80%**的情况下更倾向于 EvalAgent 的工作成果。
  3. 它更高效:EvalAgent 编写的代码更短、更简洁。其他方法编写的代码量是必要量的 6 倍(产生了大量从未运行的“死重”代码),而 EvalAgent 则保持了专注。

关键要点(“秘密配方”)

研究发现,EvalAgent 之所以成功,而其他方法失败,主要有三个原因:

  1. 观看电影,而不仅仅是阅读剧本:基于机器人实际的执行轨迹(即它做了什么的视频)进行评估,远比仅仅阅读其代码要好得多。它能捕捉到静态代码分析所遗漏的错误。
  2. 技能胜过规划:仅仅要求机器人“先规划,再构建”效果不佳。机器人可能会制定完美的计划,但随后却建造出一座混乱的房子。评估技能(即工具包)才是真正的英雄,它让机器人保持专注,防止其编写出无意义的代码。
  3. 保持手册更新:机器人使用的工具变化迅速。EvalAgent 使用了一个系统来即时获取最新文档。如果没有这一点,它编写的代码经常因为使用了过时的指令而失效。

结论

自动化评估 AI 智能体是可行的,但你不能只是让一个聪明的机器人去“自行解决”。你必须给它一个专用工具包,并展示如何观察机器人的实际行为。EvalAgent正是这样做的,它将一项混乱且昂贵的人工任务,转化为一个 streamlined( streamlined 意为精简高效)、自动化的流程,从而生成可靠、可操作的报告。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →