SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs
本論文は、単一の状態遷移において消費される出力の最小セットを一つの統一されたアクションとして扱うことにより、多様なワークフローやモデルスケールにわたる安定的かつ効果的な学習を可能にし、分業と共同進化を統合するマルチエージェントLLMのための新しい強化学習フレームワークであるSRPO(Setwise Relative Policy Optimization)を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
急速に進化する人工知能の世界において、大規模言語モデルは、推論し、情報を検索し、ツールを使用して複雑な問題を解決できるエージェントとして振る舞うことを学習しています。これらのモデルが単独で動作する場合、彼らは単一の思考経路を辿ります。しかし、より困難な課題に取り組むために、研究者はしばしば、専門家のチームのように協力し合う複数のエージェントを配備します。時には、各メンバーが特定の役割を担うようにタスクを分割することもあり、また別の時には、解決策を共に洗練させるために、複数の異なるアイデアを同時に生成することもあります。このようなチームを訓練する上での中心的な困難は、彼らにどのように報酬を与えるかを決定することでした。従来の方法では、複数のエージェントが単一の結果を生み出すために協力している場合であっても、各エージェントの出力を個別のイベントとして扱うことがよくありました。これは、システムが、それらが共に形成する完全な絵(全体像)ではなく、パズルの個々の断片から学習してしまうというミスマッチを生じさせ、単独で働くモードと共同で働くモードを切り替えるチームの訓練を困難にしていました。
ある研究チームは、SRPO(Setwise Relative Policy Optimization)と呼ばれる新しい訓練手法を提案することで、このミスマッチに対処しました。個々のレスポンスを見る代わりに、このアプローチは、環境に変化をもたらす出力のグループ全体を、単一のアクションの単位として扱います。探検家の一団が道の分岐点に到達した場面を想像してください。一人が経路を選択するのか、あるいはグループ全体が議論した後にルートを決定するのかに関わらず、彼らを前進させる決定は、集団的な結果なのです。研究者たちは、これらの出力を「アクティブ・セット」と呼ぶものにグループ化することで、チームの共同の努力こそが真のアクションであることをシステムに理解させる訓練ができることを見出しました。この手法により、一人が一つのことを行う厳格な分業体制であっても、あるいは複数の人々が同時に共有のアイデアに貢献する共同進化モードであっても、同じ訓練ルールを適用することが可能になります。
研究者たちは、このアイデアを、非常に異なる2種類のタスク、すなわち難解な数学的問題の解決と、特定の事実を見つけるためのマルチターン検索を用いてテストしました。数学の実験では、システムは候補となる解を生成し、その後それらを検証する必要がありました。このプロセスでは、ある時には一人のエージェントが解き、別のエージェントがチェックを行う必要があり、またある時には複数のエージェントが同時に異なる導出を提案する必要がありました。検索の実験では、システムは追加の情報を求めるタイミングを決定する必要があり、複数のエージェントが、アグリゲーター(集約器)が結果を統合する前に、同時に検索クエリを発行する可能性がありました。4つの異なるサイズの言語モデルを用いて、この新手法は既存のアプローチを一貫して上回る性能を示しました。数学のベンチマークにおいて、システムは平均して生成された解の約61〜62パーセントが正解となる精度を達成し、問題の約78パーセントに対して少なくとも一つの正解を見つけ出しました。検索タスクにおいては、改善はさらに顕著であり、新手法は平均して60パーセント以上のクエリに対して正解を見つけ出し、これは従来の手法からの大幅な飛躍となりました。
この発見の鍵は、複数のエージェントの貢献をどのようにバランスさせるかを理解することにありました。もしシステムが各エージェントによる変化を単純に足し合わせてしまうと、より多くの声があるという理由だけで、大きなチームは小さなチームよりもはるかに大きな影響を与えているように見えてしまいます。研究者たちは、グループの貢献を正規化することでこの問題を解決し、5人のエージェントのチームが、単にそのサイズゆえに単一のエージェントに対して不当に重く扱われないようにしました。彼らはまた、システムがこれらのモードを動的に切り替える方法を学習できることも実証しました。ある事例では、システムは単一の特化したエージェントが最善の選択であることを学習し、また別の事例では、少人数のエージェントを起動して協力させることを学習しました。この柔軟性により、訓練プロセスを異なるチーム構造に合わせて書き直す必要はなくなり、同じ基礎的なロジックが両方のシナリオをシームレスに処理できました。
この研究は、これらの改善のコストについても詳細に調査しました。研究者たちは、優れた結果が単に新しい手法がより多くのテキストを生成したり、より多くの計算資源を使用したりしているためではないことを確認するために細心の注意を払いました。彼らは生成されたトークン数とツール呼び出しの数を測定し、改善がブルートフォース(総当たり的な力)ではなく、より良いコーディネーション(調整)から来ていることを明らかにしました。実際、訓練プロセスは、時間の経過とともに、より短く効率的なレスポンスへと導くことがよくありました。研究者たちは、結果は強力であるものの、これらは特定のベンチマークと公開されている他の手法との比較に基づいたものであり、将来の研究では、これらの利点が現実世界の長期的な展開においてどのように維持されるかを探求する必要があると述べています。それにもかかわらず、核心となる発見は揺らぎません。チームの集団的な出力を基本となるアクションの単位として定義することで、単独で働いているか、あるいは共に働いているかにかかわらず、より安定し、効率的で、複雑な問題を解決するのに効果的なマルチエージェント・システムを訓練することが可能になるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。