← 最新の論文
🤖 AI

When Is an Agent Evaluation Over? Outcome Finality and Cross-Unit Separation

本論文は、現在のエージェント評価は、結果の最終性の未検証およびユニット間の分離の欠如により妥当性に欠けることが多いと論じ、スコア化された結果が各試行において真に最終的かつ独立したものであることを保証するために、完了論証とオープンエフェクト記録を提案するものである。

原著者: Avyay M. Casheekar

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Avyay M. Casheekar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

技術要約:エージェント評価はいつ終了するのか?

問題提起

現在のエージェント評価フレームワークは、通常、実行が停止した時点(「エンドポイント」)で可視化されている状態に基づいてモデルをスコアリングします。このアプローチは、エンドポイントが以下の2つの重要な条件を同時に確立していることを前提としています:結果の確定性(outcome finality)(結果が確定し、変化しない状態であること)およびユニット間の分離(cross-unit separation)(現在の実行が以前または将来の実行から独立していること)。

本論文は、これら2つの条件は独立しており、エンドポイントにおいて満たされないことが多いと主張しています。

  1. 結果の確定性: 非同期操作(例:遅延書き込み、バックグラウンドプロセス)がまだ保留されている状態で実行が停止することがあります。これらの操作が完了する前に状態をスコアリングすると、誤ったラベル(例:遅延書き込みによって成功するはずだったものを失敗と判定するなど)につながる可能性があります。
  2. ユニット間の分離: 環境が実行間で状態を保持する場合(例:共有データベース、永続的なアカウント、またはクリーンアップされていないアーティファクト)、以前の実行が後続の実行の開始条件や結果を変化させることがあります。これは、試行が独立同一分布(i.i.d.)であるという仮定を損ない、集計された指標($pass@k$ など)を無効にします。

既存の監査は、ベンチマークの欠陥やリセットメカニズムをチェックしていますが、「単に未完了である」状態と、「実行間の接続性が考慮されていない」状態を区別できていません。

メソドロジー

著者は、これらの問題を調査するために3つのアプローチを採用しています。

  1. 理論的枠組み(完了の議論):
    本論文は、エンドポイント(相互作用が停止する時点)と完了(結果が確定し、境界が確保された状態)を区別する論理的枠組みを構築しています。最終的なラベルを正当化するための証拠と、実行を個別の試行として扱うための証拠を定義しています。

  2. 制御されたリプレイ実験:
    AgentDojo 0.1.35 を使用して、境界の選択を隔離するシステムを構築しました。

    • セットアップ: スタンドアロンのランナーを用いて、固定されたツール呼び出しと操作スケジュールをリプレイしました。ローカルHTTPサービスを使用して、非同期の遅延(0, 25, 100, 250 ms)と状態の永続性をシミュレートしました。
    • 変数: スコアリングのタイミング(エンドポイントでのスナップショット vs 終端状態を待機)と、状態管理(共有状態 vs 名前空間化された状態 vs 検証されたリセット)を変化させました。
    • 指標: エンドポイントのラベルと終端ラベルの不一致(確定性)、およびクロスランの露出頻度(分離性)を測定しました。
  3. ドキュメントレビュー:
    著者は、10件の著名なエージェントベンチマーク(WebArena, WorkArena, OSWorld, SWE-bench, tau-bench, ToolSandbox, TheAgentCompany, RE-Bench, Cybench, AgentCanary)の公開ドキュメントおよび論文をレビューしました。

    • 基準: 実行の定義、停止ルール、状態の永続性、リセットメカニズム、および実行を個別の試行として扱うための証拠に関する明示的な記述をコーディングしました。
    • 制限事項: レビューは、明示的に報告された内容に焦点を当てており、記載されていない特性を推論するものではありません。

主要な貢献

1. 概念的区別:結果の確定性 vs ユニット間の分離

本論文は、これらが異なる証拠を必要とする別個の要件であることを確立しています:

  • 結果の確定性: 結果を変更する可能性のあるすべての関連操作またはイベントが解決されているか、境界付けられているか、あるいはキャンセルされたことが確認されている必要があります。
  • ユニット間の分離: 1つの実行が他の実行の条件や結果に影響を与えるような関連ルート(共有状態、認証情報、アーティファクト)が存在しないことが必要です。
  • 含意: 確定性と分離の両立は可能ですが(例:書き込みが完了するのを待つが、ファイルは次の実行でもアクセス可能なままにする)、一方は達成できても他方は達成できない場合があります(例:分離は実現しているが、遅延操作が完了する前にスコアリングを行う)。

2. 完了の議論(The Completion Argument)

著者は、評価者向けの意思決定フレームワークを提案しています:

  • 最終ラベルに対して: 結果を変更する可能性のあるすべてのルートが遮断されているか、完了まで追跡されているか、あるいは厳密に境界付けられている場合にのみ、成功/失敗のラベルが正当化されます。そうでなければ、その結果は**未解決(unresolved)**として報告されるべきです。
  • 個別の試行に対して: 実行間のすべてのルートが遮断されているか、あるいは結果に影響を与えないことが証明されている場合にのみ、実行を個別の分析ユニットとしてカウントできます。接続が残っている場合、それらの実行は結合されたユニットとして、あるいはグループとしてモデル化する必要があります。

3. オープン・エフェクト・レコード(The Open-Effects Record)

本論文は、新しい報告基準であるオープン・エフェクト・レコードを提案しています。このレコードには、エンドポイント後に依然として関連性を持つ操作やリソース、その現在のステータス、およびそれらがスコアリングされた結果を変更したり、別の実行に影響を与えたりする可能性があるかどうかを記載すべきです。

実験結果

制御されたリプレイの結果

  • 確定性: 遅延がゼロでない場合、エンドポイントのラベルは終端ラベルと100%不一致を示しました(150/150試行)。スナップショットによるスコアリングでは50件の成功が記録されましたが、照合(完了を待機)では200件の成功が記録されました。検証されたキャンセルは、保留中の書き込みを失敗として正しく識別しました。
  • 分離性: 共有状態の下では、75%のペア(150/200)において、実行Aが実行Bの結果を変更するという露出が見られました。この露出は、名前空間化された状態、検証されたリセット、または実行Bが実行Aの前に実行された場合には排除されました(0/200)。
  • 結論: エンドポイント単体では、最終的なラベルや分析ユニットを正当化することはできません。スコアリングのタイミングと状態管理のポリシーが、結果の妥当性を直接決定します。

ドキュメントレビューの結果

  • リセット/保持: 10件のプロトコルのうち8件で明示的に文書化されていました。2件は部分的でした。
  • 未完了の操作: 報告の一貫性が非常に低い結果となりました。10件中6件のプロトコルにおいて、シェル、ブラウザ、またはサービスが露出しているにもかかわらず、子プロセスや遅延効果が終了しているか、キャンセルされているか、あるいはスコアリング前に確認されているかについての記述がありませんでした。
  • 分離の証拠: 実行を個別の観察対象として扱うための明示的な証拠を提供していたのは、10件中3件のみでした。残りの7件はリセット手順を記述していましたが、カバーされるリソースの範囲や、復元の成功がどのように検証されたかを完全には述べていませんでした。
  • ギャップ: 関連する効果が結果を変更し得る期間について、一貫して文書化しているプロトコルは存在しませんでした。

重要性と主張

本論文は、現在の評価手法が「相互作用の終了」と「タスクの因果関係の終了」を混同していることが多いと主張しています。その重要性は以下の点にあります:

  1. 指標の妥当性の修正: 確定性と分離を検証しなければ、集計された指標(合格率など)が、タスクのパフォーマンスと環境のアーティファクトの混合物を測定してしまう可能性があることを示しています。
  2. 評価境界の精緻化: 「評価境界」とは単一の瞬間ではなく、いつ停止するか、いつスコアリングするか、そしてどのように分離するかに関する一連の決定事項であることを主張しています。
  3. 報告基準の提案: 「オープン・エフェクト・レコード」を導入することで、未解決の状態や持続的なリソースを透明に報告する具体的なメカニズムを提示し、読者が主張された結果の妥当性を判断できるようにしています。

著者は控えめな立場を維持しており、ドキュメントレビューが10件のプロトコルに限定されていること、および実験のカウントは構築された条件下での結果であり、出版された広範なベンチマークにおけるこれらの問題の発生頻度を示すものではないことを注記しています。核心となる議論は、最終的なラベルは、結果を変更し得るあらゆる事象が解決されているか、境界付けられているか、あるいは不確実性として保持されている場合にのみ正当化される、ということです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →