← 最新论文
🤖 AI

Anchor: Mitigating Artifact Drift in Agent Benchmark Generation

本文介绍了 Anchor,这是一种任务生成流程,通过将业务流程形式化为约束优化程序来减轻人工制品漂移,从而生成可审计、可验证且可扩展的评估环境,并通过发布 ERP-Bench 加以验证,该基准包含生产级 ERP 系统中的 300 个长周期任务。

原作者: Maksim Ivanov, Abhijay Rana

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Maksim Ivanov, Abhijay Rana

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何运营一家工厂。你需要给它一个测试,看看它是否足够聪明,能够处理真实的商业任务,比如订购物资、制造产品和开具发票。

根据这篇论文,问题在于大多数此类测试都存在缺陷。它们遭受了作者所称的“ artifacts 漂移”(Artifact Drift)的影响。

问题所在:“破碎的食谱”

将创建 AI 智能体测试想象成编写蛋糕食谱。为了进行公平的测试,你需要确保以下四件事完美匹配:

  1. 指令:“制作一个巧克力蛋糕。”
  2. 厨房(环境):你提供给机器人的烤箱、碗和食材。
  3. 答案密钥(Oracle):你期望在最终看到的完美蛋糕。
  4. 裁判(Verifier):品尝蛋糕并判断其是否合格的人。

在大多数当前的 AI 测试中,这四件事由不同的人编写,或由彼此不沟通的不同工具生成。

  • 指令可能写着:“使用 2 杯糖。”
  • 厨房里只有 1 杯糖。
  • 答案密钥假设机器人使用了 3 杯糖。
  • 裁判甚至可能在蛋糕烤焦的情况下仍给予及格分,仅仅因为它看起来像个蛋糕。

当这四个部分不一致时,测试就不公平。机器人可能会因为测试本身不可能完成而失败,或者它可能会“作弊”(利用奖励漏洞),找到测试创建者未曾意图的漏洞。作者将这种混乱称为“ artifacts 漂移”。

解决方案:"Anchor"

作者构建了一个名为Anchor的新系统来解决这个问题。

想象一下,与其编写四份独立的文档,不如编写一份完美的单一数学蓝图(即“约束程序”)。这份蓝图就像一份主食谱,精确定义了蛋糕应如何制作、有哪些可用食材以及规则是什么。

当你想要创建一个测试时:

  1. 你稍微调整蓝图(例如,“通过增加更多客户使其更难”或“通过提供更多库存使其更容易”)。
  2. 计算机求解器读取这份蓝图,并说:“好的,这是解决此特定版本的确切完美方法。”
  3. Anchor随后自动将那个单一完美解决方案转化为测试的所有四个部分:
    • 它用通俗英语编写指令
    • 它用正确的食材搭建厨房
    • 它基于求解器的数学计算创建答案密钥
    • 它编程裁判,使其根据完全相同的规则进行检查。

由于所有内容都源自同一份蓝图,它们永远不会产生分歧。指令、环境、答案和裁判都完美对齐。

结果:ERP-Bench

利用该系统,作者创建了一个名为ERP-Bench的新测试套件。

  • 它是什么? 这是一组包含 300 个真实商业任务的集合,涉及购买零件、制造产品和库存管理,所有这些都运行在一个名为 Odoo 的真实商业软件系统中。
  • 它有何特别之处? 它是“可验证的”。系统知道每个任务的数学上完美答案。它能确切告诉你 AI 离完美解决方案有多近,而不仅仅是它看起来是否“正确”。

他们的发现

他们在这些 300 个任务上测试了当今最聪明的五个 AI 模型。以下是发生的情况:

  1. 难度标尺有效:他们只需更改蓝图中的数字,就能将任务设定为“简单”、“中等”或“困难”。随着任务变难,AI 模型的表现确实如预测那样变差。
  2. “足够好”与“完美”之间的差距:AI 模型在遵循基本规则(如“不要耗尽库存”)方面表现尚可。它们正确遵守基本约束的时间约为26%。然而,它们在寻找最佳可能解决方案(例如花费最少的钱)方面表现极差。它们仅**17%**的时间找到了完美、最优的解决方案。
  3. 接口很重要:当 AI 模型能够像程序员使用代码那样直接与软件“对话”时,它们的表现要好得多;相比之下,当它们需要像人类一样在屏幕上“点击”按钮(使用鼠标或浏览器)时,表现则较差。“点击”方法速度慢得多,且错误更多。

结论

该论文认为,要构建能够真正处理实际商业工作的 AI,我们必须停止构建由不匹配部分组成的测试。通过使用“单一事实来源”(即 Anchor 系统),我们可以创建公平、可审计且逼真的测试,从而确切地告诉我们 AI 智能体在解决复杂商业问题方面究竟有多出色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →