Mutation Testing of Task-Scoped State Oracles in Software-Agent Benchmarks: A Cross-Benchmark Empirical Study
本文提出了一种确定性的变异测试协议,该协议揭示了状态作用域预言(state-scoped oracles)在软件智能体基准测试中能有效拒绝有害的状态故障和良性的模式变化,同时识别出 ToolSandbox 中评估器在分数未改变的情况下未能检测到非预期持久副作用的具体假阴性案例。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字领域,软件智能体正日益成为能够超越单纯回答问题、进而通过与世界交互来改变事物的自主助手。这些智能体可以下单、更新联系人列表、修改设置以及编辑文件,从而留下持久性的变化痕迹。为了判断这些智能体是否正确完成了工作,研究人员构建了“基准测试”(benchmarks),即旨在衡量性能的标准测试。然而,在评判这些智能体时出现了一个关键问题:我们如何知道测试本身是否公平?如果一个智能体成功完成了主要任务,但也意外删除了用户的日历或重复了银行记录,测试仍可能给它满分。反之,如果测试过于严苛,可能会因为智能体做了一些无伤大雅的改动(例如重新排列一个并不重要的项目列表)而惩罚它。这就产生了一种对可靠“裁判”的需求,能够区分出什么是做得出色,以及什么是带来了危险的副作用。
这是上海交通大学研究人员的一项新研究所解决的核心挑战。该团队将研究重点放在了充当这些基准测试中“裁判” 역할을 的软件上,将裁判本身视为受测软件。他们没有询问人工智能在某项任务中表现如何,而是提出了一个不同的问题:如果我们故意在已知的成功结果中引入特定的错误或无害的变化,裁判能否察觉?为了找到答案,他们使用了一种称为“变异测试”(mutation testing)的方法。想象这样一个场景:一个测试已经确认某次航班预订成功。随后,研究人员将这个已确认的成功案例进行了特定的、细微的篡改:他们可能在预订中增加了一笔额外的、不应有的费用;更改了一个不该被触动的联系人电话号码;或者仅仅是重新排列了数据的字段顺序而不改变其含义。然后,他们将这些经过修改的版本反馈给官方的评判软件,以观察它是会依然给出满分,还是会发现其中的错误。
研究人员将这一严格的方案应用于三个用于评估软件智能体的主要基准测试:-Bench、ToolSandbox 和 AppWorld。他们从每个系统中选择了固定的二十个任务模板,总共创建了六十个不同的场景来进行调查。对于每个场景,他们对系统的最终状态进行了特定的、受控的修改。其中一些变化是有害的,旨在模拟现实世界中的错误,如修改错误的记录或创建重复条目。另一些则是良性的,旨在测试裁判是否会对外观上的差异过度敏感,例如数据的呈现顺序。该研究关注的是官方评估器能否正确拒绝有害的变化,同时接受无害的变化。
结果呈现出一幅可靠性参差不齐的图景。在所有基准测试中,官方裁判在识别最明显的错误方面表现得相当出色。当研究人员移除一项必要的改动或将正确的值替换为错误的值时,裁判几乎每次都能正确地拒绝结果。在面对无害的变化时,它们也表现得非常公正;它们正确地接受了所有仅涉及数据重新排列或格式化差异的良性变化,表明它们并不会因为琐碎的差异而惩罚智能体。然而,这项研究揭示了一个显著的盲点。在十个特定案例中(全部发生在 ToolSandbox 基准测试内),裁判未能察觉到有害的副作用。在这些情况下,智能体进行了未经授权的修改,例如修改了不属于主任务的记录字段,或修改了另一个应用程序中的记录。尽管存在这些额外且不想要的改动,官方裁判仍然授予了智能体满分。
为了确保这些失败是真实的而非仅仅是测试过程中的故障,研究人员进行了详细的后续调查。他们使用系统中公开的工具手动重现了完全相同的异常改动,证实了这些改动在最终状态中确实是可见的。然而,当他们再次运行官方裁判时,它仍然给出了满分。这表明评判软件并非在检查最终状态的完整性,而仅仅是在寻找是否达到了特定的里程碑,却忽略了过程中发生的其他任何事情。研究发现,这个问题集中在 ToolSandbox 中的六个特定任务模板中,这表明问题在于这些特定测试的设计方式,而非整个基准测试系列的缺陷。
研究人员得出结论,虽然目前的基准测试在检查智能体是否实现了其主要目标方面是有效的,但它们往往缺乏检测附带损害的敏感度。研究发现,在所测试的系统中,官方裁判漏掉了大约 9% 的有害副作用,同时成功忽略了所有测试中的良性变化。这表明当前一代的评估工具需要更新,以包含对意外变化的检查,从而确保高分真正反映了干净且安全的执行过程。这项研究并非声称所有的基准测试都失效了,也并非认为智能体一直在造成伤害,而是提供了一种清晰、可量化的方法来识别裁判在何处未能洞察全貌。通过精准定位这些具体的差距,这项工作为开发者提供了一条路径,使他们能够构建更强大的测试,从而不仅验证智能体“做了什么”,还能验证它“没做什么”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。