A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks
为了解决现有智能体基准测试在覆盖率和工具使用范围上的饱和与局限,本文提出了 TASTE,这是一种通过演化工具序列来逆向任务构建过程的自动化方法,用于生成具有高挑战性且高覆盖率的 -Bench,该基准测试揭示了当前最先进模型在面对这些更复杂、更多样化的任务时会出现显著的性能下降。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在测试一位新机器人厨师的烹饪水平。
问题:“简易菜单”已耗尽
目前,我们有一个标准测试菜单(称为 -Bench),机器人需要遵循诸如“制作三明治”或“订购披萨”之类的指令。问题是,最聪明的机器人厨师已经背熟了这份菜单。它们获得了满分,但这并非因为它们是天才,而是因为测试过于简单且重复。这就像一名学生在数学考试中得了 A+,仅仅因为老师只要求他们做一位数加法。
此外,制作新的、更难的测试题简直是一场噩梦。这需要人类坐下来编写复杂的故事,理清机器人需要采取的确切步骤,并检查故事是否合乎逻辑。这个过程既缓慢又昂贵,而且将我们的测试范围限制在人类恰好能想到的故事类型内。
解决方案:TASTE(“反向食谱”机器)
作者们创建了一个名为 TASTE(基于工具序列演化的任务合成)的新系统。TASTE 没有从故事出发去推导步骤,而是将整个过程颠倒了过来。
可以这样理解:
- “工具序列”(步骤): 首先,系统生成数千个随机的动作列表,例如“打开冰箱、取出牛奶、倒入杯中、关上冰箱”。
- “合理性过滤器”(口味测试): 它利用一个超级智能的 AI 裁判来审查这些列表,并判断:“不行,这不可能。你不能在打开冰箱之前就倒牛奶,”或者“是的,这是一系列有效的事件。”它会从错误中学习,从而更擅长辨别有效与无效的步骤。
- “聚类”(按风味分组): 它将这些有效序列分组。如果一组全是关于“做早餐”的,而另一组是“做三明治”的,它会从每组中挑选最具代表性的例子,以确保测试涵盖各种各样的场景。
- “演化”(增添风味): 这是秘诀所在。一旦它有了一个基本任务(例如“订购披萨”),它就会故意增加难度。它可能会:
- 让顾客(模拟用户)忘记订单详情。
- 在菜单中添加“诱饵”选项,这些选项看起来正确但实际上是错误的(例如已售罄的披萨)。
- 让顾客变得不配合或令人困惑。
结果:-Bench
利用这种方法,他们构建了一个全新的、难度高得多的测试,称为 -Bench。
当他们在这一新菜单上测试“冠军”机器人厨师(如 Gemini-3-Flash)时,结果令人震惊。
- 在旧版简易菜单上,这些机器人的得分为 0.90(几乎完美)。
- 在由 TASTE 生成的新菜单上,它们的得分降至 0.30 或更低。
为何这很重要
该论文认为,旧测试中的高分是一个“误报”。机器人实际上并不擅长解决复杂、混乱的现实世界问题;它们只是把旧测试题背下来了。
新方法证明了以下几点:
- 覆盖范围: 新测试迫使机器人使用更广泛的各种工具和组合,而不仅仅是那几招老把戏。
- 难度: 测试真正更难了,因为它们包含了困惑、信息缺失和棘手的情景。
- 自动化: 我们不再需要人类来编写这些高难度测试。该系统可以生成源源不断的具有挑战性、有效且多样化的任务,以在机器人变得更聪明时持续对其进行测试。
简而言之,TASTE 是一台为 AI 智能体自动发明“Boss 战”的机器,确保我们能区分出是背熟了脚本的机器人,还是真正具备思考能力的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。