Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
Harness-Bench 是一个诊断性基准,包含 106 个现实且沙箱化的任务,用于评估不同系统层配置(即 harness)如何影响大语言模型(LLM)代理的性能,其结果表明执行结果在不同模型与 harness 的组合间存在显著差异,并凸显了应在配置层面报告代理能力,而非将其完全归因于基础模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位才华横溢、世界级的厨师(即AI 模型)。只要给予正确的指令,这位厨师就能烹制任何菜肴。但在现实世界中,厨师并非置身于真空之中;他们在一个拥有特定工具、一套规则、一位检查订单的经理以及一套处理错误机制的厨房中工作。
这篇论文Harness-Bench,旨在测试那个厨房系统(称为“Harness”),而不仅仅是测试厨师。
问题所在:我们一直忽视了厨房
迄今为止,当人们测试 AI 智能体时,他们主要问的是:“这位厨师有多好?”他们关注的是最终的菜肴(AI 是否完成了任务),却忽视了厨房是如何布置的。
- 厨师是否拥有合适的刀具(工具)?
- 厨师是否知道如何处理烧焦的平底锅(恢复能力)?
- 厨房经理(系统)是否阻止了厨师使用错误的食材(权限控制)?
作者认为,仅通过观察模型来判断 AI 的能力是不够的。你必须将模型与厨房系统结合起来看待。一位伟大的厨师在混乱、破败的厨房中会失败,而一位普通的厨师在完美、井然有序的厨房中却可能成功。
解决方案:为 AI 打造“厨房模拟器”
研究人员构建了Harness-Bench,这是一个拥有106 种不同烹饪挑战(任务)的大型测试场。这些不仅仅是简单的问题,而是复杂的任务,如修复代码、分析财务数据或管理项目。
他们的测试方式如下:
- 相同的食材,不同的厨房:他们将相同的 106 项任务交给不同的 AI 模型。
- 变量:他们保持任务完全不变,但在每次运行时更换“厨房系统”(Harness)。有些厨房技术先进且严格,有些则宽松简单。
- 结果:他们进行了超过5,000 次实验。
他们的发现
结果令人惊讶且清晰:厨房的重要性与厨师同等重要。
- 巨大差异:当他们使用相同的 AI 模型但将其置于不同的“厨房”中时,成功率差异巨大。其中一个厨房系统的成功率为 76%,而另一个使用完全相同模型的厨房系统成功率仅为 52%。
- “聪明”的厨房胜出:表现最好的系统并非仅仅拥有最聪明的 AI 模型。那些系统之所以出色,是因为它们帮助 AI 保持正轨、从错误中恢复并正确使用工具。
- “漂移”问题:研究人员发现,AI 往往起初有一个良好的计划,但随后会“偏离轨道”。它可能在逻辑上推理正确,却忘记了实际保存文件,或者它可能忽略工具错误并继续重复同样的尝试。最好的“厨房系统”能够捕捉到这些漂移并加以修正。
核心启示
该论文得出结论:我们需要停止说“这个 AI 模型有 90% 的好”。相反,我们应该说“这个 AI 模型在与这个特定系统配对时有 90% 的好”。
如果你想构建一个可靠的 AI 智能体,你不能只挑选最聪明的大脑;你还必须为其打造最好的身体和神经系统(即 Harness)。Harness-Bench 就是他们创造的工具,用于帮助工程师测量并改进这一身体。
简而言之
这就好比测试一辆赛车。你不能只看引擎(AI 模型)就说它很快。你必须让引擎在不同的赛道上,配合不同的轮胎和车手(Harness)进行测试。Harness-Bench 就是那条新赛道,它证明了赛车的速度在很大程度上取决于赛道和轮胎,而不仅仅是引擎。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。