When Is an Agent Evaluation Over? Outcome Finality and Cross-Unit Separation
本文认为,当前的智能体评估往往由于未经验证的结果终结性和跨单元分离性而缺乏有效性,并据此提出了一种完成性论证和开放效应记录,以确保评分结果在各次试验中确实是最终且独立的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:智能体评估何时结束?
问题陈述
目前的智能体评估框架通常根据模型在停止运行(即“端点”)时所处的可见状态进行评分。这种方法假设端点同时确立了两个关键条件:结果终局性(结果已定且无法改变)和单元间隔离性(当前运行独立于之前的或之后的运行)。
本文认为,这两个条件是相互独立的,并且在端点处往往无法得到满足。
- 结果终局性: 运行可能会在异步操作(例如延迟写入、后台进程)仍在挂起时停止。对这些操作完成前的状态进行评分可能导致错误的标签(例如,将一个任务标记为失败,而实际上延迟写入本可以成功;反之亦然)。
- 单元间隔离性: 如果环境在运行之间保留状态(例如共享数据库、持久化账户或未清理的产物),则前一次运行可能会改变后续运行的初始条件或结果。这违反了试验是独立同分布(i.i.d.)的假设,使得聚合指标(如 $pass@k$)失效。
现有的审计通常检查基准测试是否存在缺陷或重置机制,但未能区分一个被评分的结果仅仅是“未完成”,还是其中的运行间连接未被核算。
研究方法
作者采用三管齐下的方法来调查这些问题:
理论框架(完成论证):
本文开发了一个逻辑框架,用于区分端点(交互停止时)与完成(结果已定且边界安全时)。它定义了证明最终标签的正当性或将运行视为独立试验所需的证据。受控重放实验:
作者使用 AgentDojo 0.1.35 构建了一个隔离边界选择的系统。- 设置: 一个独立的运行器重放固定的工具调用和操作调度。一个本地 HTTP 服务模拟了异步延迟(0, 25, 100, 250 ms)和状态持久化。
- 变量: 研究改变了评分时机(快照是在端点处还是等待终止状态)和状态管理(共享状态 vs 命名空间状态 vs 已验证重置)。
- 指标: 实验测量了端点标签与终止标签之间的不一致性(终局性)以及跨运行暴露的频率(隔离性)。
文档审查:
作者审查了十个知名智能体基准测试的公开文档和论文:WebArena, WorkArena, OSWorld, SWE-bench, tau-bench, ToolSandbox, TheAgentCompany, RE-Bench, Cybench, 以及 AgentCanary。- 标准: 他们针对运行定义、停止规则、状态持久化、重置机制以及将运行视为独立试验的证据进行了编码。
- 局限性: 审查侧重于明确报告的内容,而非推断未说明的属性。
核心贡献
1. 概念区分:结果终局性 vs. 单元间隔离性
本文确立了两者是需要不同证据的截然不同的要求:
- 结果终局性: 要求所有可能改变结果的相关操作或事件都已解决、受限或被确认取消。
- 单元间隔离性: 要求没有任何相关路径(共享状态、凭据、产物)允许一次运行影响另一次运行的条件或结果。
- 启示: 人们可以在没有隔离性的情况下实现终局性(例如,等待写入完成,但留下文件供下次运行使用),也可以在没有终局性的情况下实现隔离性(例如,隔离了运行,但在延迟操作完成前就进行了评分)。
2. 完成论证
作者为评估者提出了一个决策框架:
- 对于最终标签: 只有当所有可能改变结果的路径都被阻断、被追踪至完成或被严格限制时,成功/失败的标签才是正当的。否则,结果必须报告为未解决。
- 对于独立试验: 只有当所有运行间的路径都被阻断或被证明无法影响结果时,运行才能被视为独立的分析单元。如果存在连接,则必须将这些运行建模为一个连接的整体或进行分组。
3. 开放效应记录 (Open-Effects Record)
本文提出了一种新的报告标准:开放效应记录。该记录应列出在端点之后仍然相关的操作或资源、其当前状态,以及它们是否可能改变评分结果或影响另一次运行。
实验结果
受控重放发现
- 终局性: 在非零延迟的情况下,端点标签在 100% 的案例中(150/150 次试验)与终止标签不一致。快照评分记录了 50 次成功,而协调过程(等待完成)记录了 200 次成功。经过验证的取消操作正确地将挂起的写入识别为失败。
- 隔离性: 在共享状态下,75% 的配对(150/200)显示出暴露现象,即运行 A 改变了运行 B 的结果。在命名空间状态、已验证重置或运行 B 在运行 A 之前执行的情况下,这种暴露被消除(0/200)。
- 结论: 端点本身不能证明最终标签或分析单元的正当性。评分时间和状态管理策略直接决定了结果的有效性。
文档审查发现
- 重置/保留: 在 8/10 个协议中被明确记录;在 2/10 个中仅为部分记录。
- 未完成的操作: 报告得极不一致。6/10 个协议暴露了 shell、浏览器或服务,但并未说明子进程或延迟效应在评分前是否已完成、取消或经过检查。
- 隔离证据: 仅 3/10 个协议提供了将运行视为独立观察值的明确证据。其余七个协议描述了重置程序,但未能充分说明所涵盖的资源范围或如何验证恢复的成功。
- 差距: 没有协议能一致地记录相关效应可能改变结果的时间段。
重要性与主张
本文声称,目前的评估实践经常将交互的结束与任务因果链的结束混为一谈。其重要性在于:
- 纠正指标有效性: 它证明了如果不验证终局性和隔离性,聚合指标(如通过率)测量的可能是一种任务性能与环境人工产物的混合物。
- 细化评估边界: 它认为“评估边界”不是一个单一的时刻,而是一系列关于何时停止、何时评分以及如何分离运行的决策。
- 提出报告标准: 通过引入“开放效应记录”,本文为评估者提供了一种透明报告未解决状态和持久化资源的具体机制,使读者能够评估所声称结果的有效性。
作者保持了审慎的态度,指出其文档审查仅限于十个协议,且其实验计数反映的是构建的条件,而非这些问题在已发表的更广泛基准测试中的发生频率。其核心论点是:只有当任何可能改变所声称结果的事物都已解决、受限或保留为不确定性时,最终标签才是正当的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。