The Necessity of a Unified Framework for LLM-Based Agent Evaluation
本文认为,由于提示词和环境等混杂因素导致基于大语言模型的智能体评估缺乏标准化,因此亟需一个统一框架,以确保对模型性能进行公平、可复现且严谨的评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和创意类比对该论文的解读。
核心问题:“盲测”困境
想象一下,你想找出哪位厨师最擅长烹饪某道特定菜肴。你组织了一场盲测。然而,这里有个陷阱:
- 厨师 A 配备了高端专业烤箱、顶级食材,还有一位副厨帮忙切菜。
- 厨师 B 只有一台生锈的烤面包机、冷冻食材,且没有任何帮手。
如果厨师 A 做出一道美味佳肴,而厨师 B 把菜烧焦了,你可能会认为厨师 A 更厉害。但实际上,结果的差异不仅仅源于厨师的技艺,更在于他们工作的厨房不同。
这正是该论文指出的大型语言模型(LLM)智能体所面临的问题。
目前,当研究人员测试 AI 智能体(能够使用工具、进行规划和做出决策的 AI)时,他们会将每个 AI 包裹在不同的“厨房”(称为测试框架)中。一个 AI 可能获得精心设计的提示词、智能记忆系统和严格的工具接口;而另一个 AI 可能只得到简单的提示词和混乱的接口。当分数出炉时,我们无法确定是 AI 更聪明,还是仅仅因为它拥有了更好的“厨房”。
论文的解决方案:标准化的“赛道”
作者认为,为了公平地比较 AI 模型,我们需要一个统一框架。这就好比为所有赛车(AI 模型)建造一条单一、标准化的赛道。
- 赛车(AI 模型): 这是我们要测试的对象。它快吗?效率高吗?
- 赛道(框架与环境): 这包括路面状况、天气、燃油类型以及比赛规则。
论文指出:必须确保每个人的赛道完全一致。
如果我们为每一次测试都改变赛道(提示词、记忆工具、AI 与互联网交互的方式),我们就无法判断更快的成绩是因为赛车本身更好,还是因为路面更平整。
需要修复的部分(“赛道”组件)
论文将“厨房”或“赛道”分解为五个具体部分,必须对其进行标准化,以免干扰测试结果:
- 道路规则(推理): 有时,一个 AI 会被安全过滤器拦截,而另一个不会,仅仅是因为它们使用了不同的互联网服务提供商。测试必须确保规则对所有人一致。
- 操作手册(提示): 有些 AI 测试给模型提供 200 字的指令,而另一些则提供 2000 字的手册,基本上直接告诉 AI 该如何思考。论文指出,任务可以不同,但给出指令的方式必须一致。
- 笔记本(记忆): 有些 AI 智能体拥有一个整理得井井有条的笔记本,用于记录过去的事件;而另一些则只有一堆杂乱无章的纸张,旧信息会被随机丢弃。测试必须确保每个 AI 都获得相同类型的笔记本。
- 工具腰带(工具调用): 有些 AI 模型被训练成以非常严格的格式使用工具;而另一些则被允许随意发挥。如果一个 AI 因为工具调用中漏掉了一个逗号而失败,而另一个 AI 因为测试标准宽松而成功,这就不是公平的比较。
- 世界(环境): 这是一个关键点。如果在一个“实时”网站上测试 AI,该网站明天可能会发生变化。如果 AI 因为网站变更而失败,那不是 AI 的错。论文认为,我们需要使用“冻结”的世界快照,以确保环境在测试期间不会发生变化。
该框架“不是”什么
作者非常谨慎地说明了该框架不适用于以下情况:
- 它不旨在阻止现实世界 AI 产品的创新。像 Anthropic 或 OpenAI 这样的公司仍然应该自由地为他们的产品构建最精彩、最复杂、最具创新的“厨房”。
- 它不旨在让所有 AI 看起来都一样。
- 它仅适用于科学测试(即“考试”)。
这就好比一级方程式赛车(F1):
- 引擎(AI 模型): 这是制造商想要改进的部分。
- 法规(统一框架): 国际汽联(FIA,赛车管理机构)对轮胎尺寸、燃油和底盘尺寸制定了严格规则。
- 为什么? 这样当一辆车比另一辆快时,我们知道是因为引擎更好,而不是因为某支车队使用了更好的轮胎或不同的燃油。
拟议计划
论文建议建立一个三部分系统来解决这个问题:
- 受控基础层: 一个标准的“载体”,在每次测试中保持提示词、记忆和工具恒定不变。
- 标准化评分方法: 不仅仅是说“通过/失败”,我们需要衡量 AI 的表现方式(它是否走了太多步骤?是否使用了过多内存?)。
- 版本控制: 由于技术发展迅速,这本“规则手册”需要有版本号(如 v1.0、v2.0)。如果规则发生变化,我们不应将旧版本的分数与新版本进行比较,就像我们不会在不考虑新规则的情况下,将 2020 年的赛车圈速与 2024 年的进行对比一样。
总结
该论文声称,目前我们是在拿苹果和橙子做比较,因为每个 AI 测试都使用了不同的设置。为了真正知道哪个 AI 最“聪明”,我们需要将它们全部置于完全相同的房间,给予它们完全相同的工具,并观察它们解决相同的问题。只有这样,我们才能说“这个 AI 更好”,而不是“这个 AI 拥有了更好的设置”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。