What Should Agents Say? Action-state Communication for Efficient Multi-Agent Systems
本論文は、マルチエージェントシステムにおける自由形式の自然言語によるやり取りをコンパクトな記録へと圧縮するプロトコル化されたアクション・ステート通信フレームワークであるPACTを紹介し、様々なシステムトポロジーにおいてタスク性能を維持または向上させつつ、トークン使用量と推論コストを大幅に削減する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、論文の内容を平易な言葉と日常的な例えを用いて説明したものです。
問題点:情報の「共有しすぎ」による会議
探偵チーム(エージェント)が謎を解こうとしている場面を想像してみてください。現在のシステムでは、ある探偵が仕事を終えるたびに、膨大な報告書を作成し、次の探偵が読めるように共有ノートに貼り付けています。
この報告書には以下が含まれます:
- 最終的な答え。
- 見つけた手がかり。
- しかし、それだけでなく: 彼らが抱いたあらゆるランダムな思考、行き詰まった過程、手がかりを読み返した回数、そして「どのように考えたか」についての長々としたとりとめもない説明まで含まれています。
問題点:
調査が進むにつれて、この共有ノートは巨大化していきます。
- コストがかかる: 100ページのノートを読むには、多額の費用(この場合は「トークン」や計算リソース)がかかります。
- 時間がかかる: 次の探偵は、新しい手がかりに辿り着く前に、その膨大なノイズをすべて読まなければなりません。
- 混乱を招く: 重要な事実が、「こう考えた、次にこう考えた」といった何ページにもわたる記述の中に埋もれてしまいます。
この論文は、現在のシステムでは、エージェントが自身の「思考プロセス」というプライベートな情報を共有しすぎており、それがシステムを停滞させていると主張しています。
解決策:PACT(「エグゼクティブ・サマリー」のルール)
著者らは、PACT(Protocolized Action-state Communication and Transmission)と呼ばれる新しいルールを提案しています。
PACTを、チームの共有ノートに対する厳格なルールだと考えてください。それは、**「無駄な話は禁止」**というルールです。
乱雑な下書きをそのまま貼り付けるのではなく、エージェントは次の者に渡す前に、自身の仕事をコンパクトな3部構成の「アクション・ステート記録」へと翻訳しなければなりません。
- ACTION(行動): 何をしたのか?(例:「データベースを検索した」)
- STATE(状態): どのような証拠を見つけたのか?(例:「1995年のレシートを見つけた」)
- RESULT(結果): 有用な出力は何か?(例:「これがレシートの画像である」)
例え話:
- 従来の方法: 探偵Aが探偵Bに対し、朝食に何を食べたかや、店に行くまでの間に何を考えたかといった、一日の全記録が書かれた50ページの日記を手渡している状態。
- PACTによる方法: 探偵Aが探偵Bに対し、「店に行き(Action)、青い車のレシートを見つけ(State)、これがその写真です(Result)。次は車の登録簿を確認してください」と書かれた付箋を手渡している状態。
研究結果
研究者らは、このアイデアを2つの異なる方法でテストしました。
- 証拠の分割: 2人のエージェントがパズルを解くために手がかりを共有する。
- 組み立てライン: 4人のエージェントがライン(プランナー → クリティック → リファイナー → ソルバー)に沿って作業する。
彼らは、PACTを他の5つの通信方法(全文を送る、結論だけを送る、短い要約を送るなど)と比較しました。
結果:
- 「万能な手法」は存在しない: 結論だけを送るのが最適な場合もあれば、全文を送るのが適切な場合もあるなど、あらゆる状況に最適な方法は一つではないことが分かりました。
- PACTの勝利: しかし、PACTが最も一貫して優れた結果を出しました。チームの賢さを維持、あるいは向上させつつ、膨大な「コスト(トークン)」を節約できたのです。
- テストにおいて、PACTはデータ送信量を平均で約**39%**削減しました。
- 実際のコーディングツール(OpenHandsやSWE-agentなど)では、コードを壊すことなく、データ使用量をほぼ**50%**削減しました。
なぜ機能するのか
論文によれば、連鎖の次に来るエージェントは、前のエージェントが「どのように考えたか」を知る必要はありません。彼らに必要なのは以下の点だけです。
- どのようなアクションが行われたか。
- 現在の状況(ステート)はどうなっているか。
- その結果はどうなったか。
「内部的な独り言(プライベートな思考)」を排除し、「公開すべき事実」のみを共有することで、システムはより速く、より安価になり、メモリ不足のリスクも軽減されます。
結論
この論文は、AIエージェントに自由形式の非構造化された文章で会話させるべきではないと結論付けています。代わりに、エージェントが「不可欠な更新情報(アクション、ステート、結果)」のみを共有するという厳格な「プロトコル」に従わせるべきです。これにより、混沌とした高コストな会話を、効率的で高速なリレーレースへと変えることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。