← 最新の論文
💬 NLP

PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows

PROTEA は、グラフベースのスコアリングと後方評価を通じてボトルネックを特定する、マルチエージェント LLM ワークフローのオフライン・テスト駆動型改善のための統合インターフェースであり、開発者がプロンプトの改訂を反復的に編集・検証してシステム性能を大幅に向上させることを可能にする。

原著者: Kazuki Kawamura, Satoshi Waki, Kei Tateno

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Kazuki Kawamura, Satoshi Waki, Kei Tateno

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、キャストがすべて AI ロボットで構成された劇の演出家だと想像してください。各ロボットには特定の役割があります。一人は台本を読み、もう一人は事実確認をし、三人目はセリフを書き、四人目は最終的な演技を行います。開発者はこれを「マルチエージェント LLM ワークフロー」と呼んでいます。

通常、これらのロボットチームは、すべてを一度にやろうとする単一のロボットよりもうまく機能します。しかし、問題があります。最終的な演技が悪ければ、どのロボットが失敗したのかを特定するのは悪夢のようです。事実確認担当が間違った情報を入手したのでしょうか?脚本家がトーンを誤解したのでしょうか?それとも、最後の俳優が単に躓いたのでしょうか?

現在、開発者は劇全体の数時間の映像(「トレース」)を見て、エラーがどこで始まったのかを推測しなければなりません。これは、500 ページの本のすべての単語を再度読み直して、たった一つのタイプミスを見つけようとするようなものです。

ここで PROTEA が登場します。

PROTEA は、**魔法のスポットライトを備えた、賢くインタラクティブな「リハーサル室」**のようなものです。これにより、開発者は何度も何度も映画全体を視聴することなく、これらのロボットチームのデバッグと改善を支援できます。

以下に、簡単な比喩を用いてその仕組みを説明します。

1. 魔法のスポットライト(ノードレベルの診断)

劇全体を見る代わりに、PROTEA は各ロボットの作業場に信号機を置きます。

  • 🟢 緑: このロボットは完璧に役割を果たしました。
  • 🟡 黄: このロボットはまあまあでしたが、少し雑だったかもしれません。
  • 🔴 赤: このロボットは失敗しました。

最終的な答えが間違っている場合、PROTEA は単に「劇は失敗した」と言うだけではありません。瞬時に赤いロボットをハイライトし、「ねえ、ここを見て!このロボットは次のロボットに間違った情報を渡しました」と言います。これにより、開発者は台本全体を検索する必要から解放されます。

2. 「リバースエンジニアリング」(後方推論)

時には、開発者は最終的な答えが何であるか(例えば、「劇は幸せな笑い声で終わらなければならない」)しか知らず、中間のロボットが何を言うべきかという具体的な台本を持っていないことがあります。

PROTEA は後方推論と呼ばれるトリックを使用します。目的地は知っているが、途中の曲がり角はわからないドライブを想像してください。PROTEA は「幸せな笑い声」から逆算して、「最終的なロボットが笑うためには、脚本担当ロボットは何と言わなければならなかったのか?そして、脚本担当がそれを言うためには、事実確認担当は何を提供しなければならなかったのか?」と問いかけます。

これにより、最終目標に基づいて中間ステップの「ゴースト台本」が生成されます。その後、ロボットが実際に言ったこととこの「ゴースト台本」を比較し、弱いリンクを見つけ出します。

3. 「編集ボタン」(プロンプトの改善)

PROTEA が赤いロボットを見つけると、単に指差すだけでなく、推奨される修正を提示します。

  • ロボットの現在の指示(「プロンプト」)を表示します。
  • その指示の新しい、改善されたバージョンを提案します。
  • 写真編集ツールが元画像と編集済み画像を並べて表示するように、「Before vs. After」の比較を示します。

開発者はその提案を受け入れるか、微調整するか、無視するかを選択できます。

4. 「即時リプレイ」(自動再実行)

最も素晴らしい点は、開発者が「保存」を押すと、PROTEA が新しい指示で劇全体を即座に再実行することです。その後、スコアのグラフを表示します。「見て!以前はスコアが 64% でしたが、あなたの編集後は 84% になりました!」と。

これにより、問題の発見 → 修正の提案 → テスト → 結果の確認という高速なループが生まれます。変更が機能したかどうかを数日待つ必要はもうありません。

彼らは実際に何を達成したのでしょうか?

このシステムは、2 つの現実世界のシナリオでテストされました(特定の会社名は秘匿されています)。

  1. 文書検査: 厳格なルールで文書をチェックするシステム。PROTEA により、その精度が**64.3% から 83.9%**に向上しました。
  2. 推薦システム: 映画や製品などのアイテムを提案するチャットボット。PROTEA により、正しい推薦がトップ 5 リストに入る頻度が増え、スコアが0.30 から 0.38に向上しました。

また、6 人の経験豊富な AI 開発者のグループでもテストされました。これらの開発者は、このシステムを気に入りました。なぜなら、無限のログを凝視することを防ぎ、問題を引き起こしている特定のロボットを修正することに集中させてくれるからです。

結論

PROTEA は、AI ロボットチームのデバッグという混乱し、厄介な作業を、クリーンで視覚的なプロセスに変えるツールです。それはハイライト映像を持つコーチのように機能し、どの選手がボールを落としたかを正確に示し、それを修正するためのプレイブックを提供します。すべてが一つの場所で完結します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →