← 最新の論文
💬 NLP

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

MASPO は、局所的なエージェントの目的とグローバルなシステム目標を整合させるために共同評価メカニズムと進化ビームサーチを採用することで、LLM ベースのマルチエージェントシステムのプロンプトを自動的に最適化する新しいフレームワークであり、これにより多様な協業タスクにおいて既存の手法を上回る性能を発揮する。

原著者: Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

公開日 2026-05-08
📖 1 分で読めます☕ さくっと読める

原著者: Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してください。非常に難しいパズルを解くために、専門家ロボットチームが協力して働いていると。各ロボットには特定の役割があります:一人は手がかりを読み、もう一人は数学計算を行い、三人目は誤りをチェックし、四人目は最終的な答えを書き出します。

過去には、チームが失敗した場合、誰の責任かを特定するのが困難でした。数学ロボットが計算が苦手だったのでしょうか?それとも、読み取りロボットが誤った手がかりを与えたのでしょうか?これが、論文「MASPO」が解決する問題です。

以下に、簡単なアナロジーを用いて MASPO の仕組みを説明します。

1. 問題:チームにおける「責任のなすり合い」

通常、こうしたロボットチームを訓練する際、私たちは最終的な答えだけを見ています。答えが間違っていれば、どのロボットが失敗したのかは分かりません。

  • アナロジー: リレーを想像してください。チームが負けた場合、最後の走者にだけ怒鳴りつけることはできません。もしかすると、最初の走者がバトンを落としたか、二人目の走者が間違ったコースを走ったのかもしれません。最後の走者だけを「もっと速く走れ」と訓練しても、バトンタッチが破綻している限り、チームは依然として負けます。
  • 論文の洞察: 著者らは、マルチエージェントシステムにおいて、ロボットが自身の役割を完璧に遂行しても(局所的成功)、次のロボットに失敗を招く情報を与えてしまい、結果として全体の失敗(全球的失敗)を招く可能性があることに気づきました。これを**「局所 - 全球的ミスマッチ」**と呼びます。

2. 解決策:MASPO(チームコーチ)

MASPO は、単にゴールラインを見るだけでなく、リレーのすべてのバトンタッチを見守る賢いコーチのような新しいフレームワークです。これは、各ロボットの「指示書」(プロンプト)を自動的に書き換え、チーム全体がより良く協力して動くようにします。

これを実現するために、MASPO は以下の 3 つの主要な手法を用います。

A. 「未来に耐える」スコアカード(共同評価)

MASPO は単に「このロボットは自分の役割を果たしたか?」と問うのではなく、「このロボットの作業は、次の ロボットの成功に役立ったか?」と問います。

  • アナロジー: 料理人が食事を用意している状況を想像してください。通常の審査員はスープを味わって「塩味が強い」と言うかもしれません。しかし、MASPO は、次の 料理人が焼いているパンと相性が良いように、このスープは塩味が適切かどうかまで尋ねる審査員のようなものです。
  • 仕組み: MASPO は、以下の 3 つの要素に基づいて各ロボットにスコアを与えます。
    1. 自分のルールに従ったか?(局所的妥当性)
    2. 出力は次の ロボットの作業を容易にしたか?(先読み可能性)
    3. チームの最終勝利に貢献したか?(全球的整合性)

B. 「ほぼ」災害からの学習(ミスマッチ採掘)

ほとんどのシステムは、最終答えが間違っていた場合の失敗からのみ学習します。MASPO は、ロボットが完璧に役割を果たしたにもかかわらず、チームが失敗したという、特定の厄介なタイプの失敗を探します。

  • アナロジー: 交通法規を完璧に守っているドライバー(局所的成功)が、地図が混乱しているために誤って行き止まりの街へ入ってしまった(全球的失敗)状況を想像してください。通常のコーチなら「ドライバー、よくやった!」と言うでしょう。しかし MASPO は、「待てよ、ルールは守ったが、結局道に迷った。次は行き止まりに入らないように指示を修正しよう」と言います。
  • 仕組み: システムはこれらの「局所的成功、全球的失敗」の事例を保存し、ロボットに学習させることで、同じ調整エラーを繰り返さないようにします。

C. 「再整合」ドリル(ビームリフレッシュ)

ロボットが学習し、行動を変えると、次の ロボットの指示が突然時代遅れになる可能性があります。

  • アナロジー: ダンスチームを想像してください。最初のダンサーがスピードを上げると、二人目のダンサーのタイミングが合わなくなります。古い振り付けのまま練習し続ければ、互いの足を踏んでしまうことになります。
  • 仕組み: MASPO はチームを常時監視します。もし最初のロボットがスタイルを変えた場合、MASPO は即座に二人目のロボットの指示に対する「スコア」を更新し、彼らが古いバージョンのチームではなく、現在の 現実に対して練習できるようにします。

3. 結果:より優れたチーム

著者らは、この手法を複雑な数学、論理パズル、コンピュータコードの作成など、6 種類の異なる難易度の高いタスクでテストしました。

  • 結果: MASPO で訓練されたチームは、他の手法を一貫して凌駕しました。既存の最良の手法と比較して、精度が平均**2.9%**向上しました。
  • 重要性: これは、ロボットに自身のタスクだけでなく、自身の作業がチームメイトにどう影響するかを考慮させることで、システム全体がはるかに賢くなることを証明しています。

まとめ

MASPO を、リアルタイムでプレイブックを書き換えるチームコーチと考えてください。単に選手に「ベストを尽くせ」と言うのではなく、選手 A のパスが選手 B のキャッチにどう影響するかを分析し、個々の選手だけでなくチーム全体が勝つよう、両者の指示を書き換えます。「私は自分の役割を果たしたが、それでも負けた」という問題を、チーム全員の仕事がチームの勝利に貢献するように設計することで解決します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →