← 最新の論文
🤖 machine learning

Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents

本論文は、大規模な実行トレースコーパスを体系的に分析して証拠に基づく自然言語の洞察を生成し、それによりエージェントのパフォーマンスを大幅に向上させ、かつ手動による診断手法よりも深さと網羅性において優れていることが示されているLLMエージェントの失敗診断を自動化するマルチエージェントシステムであるInsights Generator (IG) を紹介する。

原著者: Akshay Manglik (Emily), Apaar Shanker (Emily), Kaustubh Deshpande (Emily), Jason Qin (Emily), Yash Maurya (Emily), Veronica Chatrath (Emily), Vijay S. Kalmath (Emily), Levi Lentz (Emily), Yuan (Emily
公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Akshay Manglik (Emily), Apaar Shanker (Emily), Kaustubh Deshpande (Emily), Jason Qin (Emily), Yash Maurya (Emily), Veronica Chatrath (Emily), Vijay S. Kalmath (Emily), Levi Lentz (Emily), Yuan (Emily), Xue

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが、非常に賢いものの、ときどき混乱するロボットアシスタントのチームを管理していると想像してください。これらのロボットは、スプレッドシートの整理や難しい科学問題の解答など、複雑なパズルを解こうとしています。時には正解を出しますが、他の時には失敗します。

問題:「干し草の山の中の針」のようなデバッグ
現在、ロボットが失敗した際、人間の管理者は、そのロボットの作業のいくつかの具体的な例を見て、なぜ失敗したのかを突き止めようとします。これは、一台の車が通り過ぎる音だけを聞いて、なぜその車のエンジンから奇妙な音がするのかを理解しようとするようなものです。あなたは「プツプツ」という音を聞くかもしれませんが、すべての車が雨の日に左折するときにプツプツという音がするというパターンを見逃してしまいます。

ロボットは、各タスクごとに「思考」や行動の何千ページもの膨大なデータを生成するため、人間はそれをすべて読むことができません。その結果、彼らはごくわずかなサンプルに基づいて推測する羽目になります。つまり、ロボットがクラッシュすることなくタスクを完了するものの、間違った方法で実行してしまう「サイレントな失敗」を見逃してしまうのです。

解決策:「インサイトジェネレーター(IG)」
著者たちは、インサイトジェネレーター(IG)と呼ばれる新しいシステムを構築しました。IG を単独の探偵ではなく、「干し草の山の中の針」という問題を解決するための特定のワークフローを持つ専門の探偵事務所と考えるとわかりやすいでしょう。

以下に、簡単な比喩を用いてこの事務所がどのように機能するかを示します。

  1. オーケストレーター(事務所の管理者): これがボスです。自ら掘り起こしを行うわけではありません。代わりに、全体像を見て、どのような調査が必要かを決定します。
  2. スカウト(探検家): これらのエージェントは、ロボットの作業の小さなランダムなサンプルを調査するために派遣されます。彼らの役割は、広く、好奇心を持って動くことです。奇妙なパターンを探し出し、仮説を立てます。
    • 仮説の例:「ねえ、ロボットが数学で失敗する時間の 80% は、数式を間違えているのにクラッシュしていないことに気づいたよ。これは『サイレントな失敗』だ。」
  3. 調査員(法廷鑑定人): スカウトが仮説を立てると、調査員が引き継ぎます。彼らは数例を見るだけでなく、ロボットの作業のすべてを含む巨大なデータベース(「コーパス」)を精査します。強力なツールを使って数え上げ、比較し、その仮説が少数の例だけでなく、集団全体に当てはまるかどうかを実証します。
    • 結果: 推測ではなく、「1,000 件の失敗した試行を確認した。その 84% にこの特定のサイレントな数学エラーが含まれていた。発生した正確なページはここだ」という報告書を作成します。

なぜこれが違うのか?
他のほとんどのシステムは、一度に一つのロボットを修正しようとしたり、エラーを「ツールエラー」や「論理エラー」のような事前に作られたリストに分類したりします。IG が異なるのは、誰も知らなかった新しいパターンを発見する点です。また、「推測」(スカウト)と「証明」(調査員)を分離することで、データの膨大な規模に圧倒されることを防いでいます。

テストの結果は?
研究者たちはこのシステムを二つの方法でテストしました。

  1. 「審判」テスト: 超高性能な AI 審判に、IG が作成した報告書と他のシステムが作成した報告書を比較させました。IG の報告書は、より優れた証拠と深い説明を持っていたため、高い評価を得ました。これは、「車が壊れている」という報告(他のシステム)と、「車は雨の日に左折する際に特定の緩んだ配線が原因で壊れる。これがその動画証拠だ」という報告(IG)を比較するようなものです。
  2. 「人間の修理担当者」テスト: これが最も重要な部分でした。彼らは、これらのロボットを構築する専門家である実際の人間のエンジニアに、IG と他のシステムからの報告書を与えました。その後、エンジニアたちはロボットを修理しようとしました。
    • 結果: IG の報告書を使用したエンジニアは、次に良いシステムを使用したエンジニアに比べて、30% 高くロボットを修理できました。IG の報告書は、単なる漠然としたヒントではなく、正しい変更を行うために必要な正確な「どこで」「なぜか」を提供したのです。

結論
この論文は、「スカウトと調査員」というチームアプローチを使用することで、AI エージェントが失敗する際の隠れたパターンを最終的に発見できるようになると主張しています。これにより、人間の専門家は根本的な問題をより効果的に修正できるようになり、混沌としたエラーログの山を、改善のための明確で証拠に基づくロードマップへと変えることができます。

この論文が主張していないこと:

  • このシステムが人間の助けなしにロボットを自動的に修正するわけではない(彼らは自動化された「パッチャー」ループをテストしたが、主な成功は人間の専門家によるものだった)。
  • このシステムが世界中のあらゆる種類の AI 問題に機能するわけではない。AI エージェントの「トレース」(ログ)を分析する場合に限られる。
  • すべてのエラーを排除することを約束するものではなく、それらを見つけ、修正するプロセスをより効率的かつ正確にするものである。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →