← 最新论文
🤖 AI

ACE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments

本文提出了 ACE-Bench,一种基于统一网格规划任务的轻量级智能体评估基准,通过可扩展的时间跨度与可控的干扰难度两个正交维度,在消除环境交互开销的同时实现了对智能体推理能力的可靠、可解释且可复现的评估。

原作者: Wang Yang, Chaoda Song, Xinpeng Li, Debargha Ganguly, Chuang Ma, Shouren Wang, Zhihao Dou, Yuli Zhou, Vipin Chaudhary, Xiaotian Han

发布于 2026-04-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Wang Yang, Chaoda Song, Xinpeng Li, Debargha Ganguly, Chuang Ma, Shouren Wang, Zhihao Dou, Yuli Zhou, Vipin Chaudhary, Xiaotian Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ACE-Bench 的新工具,用来测试人工智能(AI)代理(Agent)的“办事能力”。

为了让你更容易理解,我们可以把现在的 AI 测试比作**“考驾照”,而 ACE-Bench 就是他们设计的一套“全新、高效且公平的驾驶模拟器”**。

1. 现在的“考驾照”有什么毛病?

在 ACE-Bench 出现之前,测试 AI 就像在真实的复杂路况里考驾照,有两个大缺点:

  • 太慢、太贵(环境开销大):
    • 比喻: 想象你要测试一辆车的刹车性能,结果每次测试前,都要先花 40% 的时间去修路、建红绿灯、甚至还要请一群演员来扮演路人。
    • 现实: 以前的测试(如 WebArena)需要模拟真实的网页、操作系统等复杂环境。AI 每做一个动作,系统都要花大量时间去“加载”和“反应”。这导致40% 的时间都浪费在等待环境反应上,而不是在测试 AI 的智商。
  • 题目难易不均(分布不平衡):
    • 比喻: 考试里有 10 道题,9 道是“在平地上倒车”,只有 1 道是“在悬崖边停车”。如果 AI 把 9 道简单的做对了,平均分很高,但你根本不知道它能不能应付那 1 道难的。
    • 现实: 以前的测试任务,有的只需要 AI 动 10 步,有的要动 100 步;有的领域(如购物)很简单,有的(如电信业务)很难。简单的平均分会掩盖 AI 的真实短板。

2. ACE-Bench 是怎么解决的?

ACE-Bench 把测试变成了一个**“填格子游戏”,就像玩“数独”或者“排课表”**。

  • 核心玩法:
    • 给 AI 一张半填好的课程表(或购物清单、旅行计划)
    • 表里有一些**“隐藏的空格”**(Hidden Slots),AI 的任务就是把这些空格填满。
    • 规则: 填的时候既要符合**“局部规则”(比如:这门课不能和另一门课时间冲突),又要符合“全局规则”**(比如:总学分不能少于 85 分,总花费不能超过预算)。

3. 这个新工具的两个“魔法旋钮”

ACE-Bench 最厉害的地方在于,它有两个可以随意调节的“旋钮”,让出题人能精准控制难度:

  • 旋钮一:任务长度(Scalable Horizons)—— 叫“隐藏空格数 (H)"
    • 比喻: 就像让 AI 填 1 个空,还是填 17 个空。
    • 作用: 填得越多,AI 需要记住的规则就越多,考验它的**“记忆力”和“长远规划能力”**。
  • 旋钮二:题目难度(Controllable Difficulty)—— 叫“诱饵预算 (B)"
    • 比喻: 就像在考试选项里放**“陷阱”**。
    • 作用: 出题人故意放一些**“看起来是对的,但其实是错的”**选项(诱饵)。
      • 这些选项符合局部规则(比如时间不冲突),但一旦选了,就会导致全局规则崩塌(比如总学分不够了)。
      • B 越大,陷阱越多,AI 越容易掉进去,考验它的**“全局推理”和“抗干扰能力”**。

4. 为什么它很“轻”?(Lightweight)

  • 比喻: 以前的测试像是在真实的 4S 店里修车测试,需要通电、联网、启动引擎。ACE-Bench 像是在一张纸上做数学题。
  • 现实: 所有的“题目”和“答案”都预先写死在静态的 JSON 文件(一种简单的文本格式)里。AI 不需要联网,不需要启动复杂的软件,只需要像查字典一样读取文件。
  • 好处: 速度极快,没有等待时间,而且完全公平(不会因为网络卡顿导致 AI 测试失败)。这使得它甚至可以在 AI 模型训练的过程中随时用来检查进步情况。

5. 实验结果说明了什么?

作者用这个新工具测试了 13 种不同大小的 AI 模型,发现:

  1. 大小决定能力: 模型越大(参数越多),填对格子的概率越高。
  2. 难度控制精准: 随着“隐藏空格”变多、“诱饵陷阱”变多,AI 的得分会稳步下降。这证明测试是有效的,能区分出谁强谁弱。
  3. 抗干扰测试: 即使模拟“工具故障”(比如网络断了,AI 查不到数据),ACE-Bench 也能测出 AI 的**“抗压能力”**。

总结

ACE-Bench 就像是一个**“可定制的 AI 智力健身房”**。

  • 以前的健身房(旧基准):设备太重,练一次要等半天,而且有的器械太轻,有的太重,练完不知道到底练得怎么样。
  • ACE-Bench:设备轻便(纯文件运行),你可以自己调节**“负重”(隐藏空格数)和“干扰项”(诱饵陷阱)。它能精准地告诉你,这个 AI 是只能做简单的事,还是真的具备在复杂、混乱的环境中,一步步解决难题**的聪明才智。

这对于开发者来说,意味着可以更快地训练出更聪明的 AI,而不需要浪费时间在等待和调试环境上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →