← 最新の論文
💬 NLP

Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation

本論文は、コード実行と環境状態の変化(ステート差分)に基づく評価契約を活用し、サンドボックス内でリアルな企業 API との対話を可能にすることで、LLM エージェントのタスク遂行能力を厳密かつ実用的にベンチマークする新しいフレームワーク「Agent-Diff」を提案しています。

原著者: Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson

公開日 2026-03-26
📖 1 分で読めます☕ さくっと読める

原著者: Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

Agent-Diff の論文を、まるで「料理の味見」のように解説します

この論文は、「AI エージェント(自律的に動く AI)」が、実際のビジネスソフト(Slack や Google カレンダーなど)を操作する任務を、どれくらい上手にこなせるかを測る新しいテスト方法を紹介しています。

タイトルにある「Agent-Diff」は、「エージェント(AI)」と「Diff(違い)」を組み合わせた造語です。

以下に、専門用語を排し、身近な例え話を使って分かりやすく解説します。


1. 従来のテストの「ジレンマ」

AI の能力を測る際、これまで 2 つの大きな問題がありました。

  • シミュレーション(おままごと): 本物そっくりの「偽物」のシステムでテストする。
    • メリット: 安全で再現性が高い。
    • デメリット: 「本物のシステムと全然違うから、実戦では使えない」というリスクがある。
  • 実機(ライブ): 本物の Slack や Google カレンダーに直接接続してテストする。
    • メリット: 本物そのものなのでリアル。
    • デメリット: 本物は「昨日と今日のデータが違う」し、テスト中に誰かが誤ってデータを消したりすると、次のテストができなくなる(再現性が低い)。

Agent-Diff は、この「安全なシミュレーション」と「リアルな本物」のいいとこ取りをした新しい方法です。

2. Agent-Diff の核心:「状態の差分(State-Diff)」という魔法の鏡

このテストの最大の特徴は、**「AI が何を言ったか(プロセス)」ではなく、「AI が何を変えたか(結果)」**で評価する点です。

例え話:料理の味見

  • 従来の評価(プロセス重視):
    料理人が「まず卵を割って、次にフライパンを熱して…」と手順を言っているのをチェックする。「手順が完璧なら合格!」とする。
    • 問題: 手順は完璧でも、卵が焦げていたり、塩を入れ忘れていたりしても気づかない。
  • Agent-Diff の評価(結果重視):
    料理人が調理する**「前の状態」「後の状態」を写真に撮り、その「違い(Diff)」**だけをチェックする。
    • 「卵が焼けて、塩が加わって、盛り付けが完了していたら合格!」
    • もし「余計な野菜を捨ててしまった」などの**「余計な変化(副作用)」**があれば、それは不合格。

この「状態の差分」を自動で計算する仕組みが、この論文の最大の革新です。

3. 実験室の仕組み:「箱庭(サンドボックス)」

どうやって本物そっくりのテスト環境を作るのでしょうか?

  • 本物の「影」を作る:
    研究者たちは、Slack や Box などの企業向けソフトの API(仕組み)を、コンテナ(箱)の中に完全にコピーして作りました。
  • 完全な隔離:
    各 AI は、自分専用の「箱庭」に入ります。AI A が「メッセージを送った」としても、AI B の箱庭には影響しません。
  • 本物と同じ反応:
    この箱庭は、本物のソフトと全く同じ反応をします。AI は自分が本物のソフトを使っていると思い込み、コードを書き、命令を出します。

これにより、「本物と同じ難易度」で、「誰がやっても同じ結果が出る」テストが可能になりました。

4. 何を見つけたのか?(実験結果のハイライト)

9 つの AI モデルに、224 種類のタスク(「Slack で特定のチャンネルにメッセージを送り、そのファイルを整理して、カレンダーに予定を入れる」など)をやらせました。

  • トップとボトムの差は激しい:
    最も得意な AI(DeepSeek-v3.2 など)は 88 点台、最も苦手な AI は 38 点台でした。AI によって「仕事ができるか」が全く違うことが分かりました。
  • 「マニュアル(ドキュメント)」の効き目:
    • 新しい機能の場合: AI が知らない新しい機能(例:Box の「Hub」という新しい機能)を教えるマニュアルを与えると、AI の成績は劇的に向上しました。
    • 古い機能の場合: すでに知っている機能の場合、マニュアルを与えても成績はあまり上がりませんでした。
    • 結論: AI は「知らないこと」を教えるのが得意ですが、「知っていること」を教えるのは無駄な場合が多いようです。
  • 失敗からの回復力:
    上手な AI は、失敗したら「同じことを繰り返す」のではなく、「別の方法を探す」や「手順を細かく分解する」という賢い戦略を使います。下手な AI は、失敗しても同じミスを繰り返してしまいます。

5. まとめ:なぜこれが重要なのか?

この「Agent-Diff」は、AI がオフィスで実際に働くための**「実力試験」**として機能します。

  • 企業にとって: 「この AI を使えば、本当に Slack やカレンダーを勝手に操作して仕事を片付けてくれるのか?」を、安全に、正確に判断できます。
  • 研究者にとって: AI が「手順を覚えること」ではなく「目的を達成すること」に焦点を当てているかを見極める基準になります。

つまり、「AI が魔法のように何でもできる時代」が来る前に、その実力を「本物そっくりの箱庭」で厳しく、公平にチェックするための新しいものさしが完成した、というのがこの論文の物語です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →