In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
本論文は、多様な推論およびツール利用のベンチマークにおいて、既存のベースラインやより大規模な商用モデルを大幅に上回る性能を達成する、マルチターン・ループ内で特化したプランナーを最適化するための新規なFlow-GRPOアルゴリズムを採用した、学習可能なイン・ザ・フロー型エージェント・フレームワークであるAgentFlowを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、超高性能なロボットにミステリーの解き方を教えようとしているところだと想像してください。ただ推測させるのではなく、地図、虫眼鏡、そして計算機を使って真実を見つけ出させたいのです。これが大規模言語モデル(LLM)の世界です。LLMは、会話ができ、推論もできる、膨大な知識を持つ巨大な脳のようなものです。最近、科学者たちは、これらの脳をさらに鋭くする方法を発見しました。それは、問題を解こうとし、最後に「よくできました」または「もう一度やってみて」という信号を受け取り、その結果から学ぶという練習をさせることです。これは強化学習と呼ばれます。
しかし、問題があります。問題が非常に長く複雑になった場合――例えば、20個の手がかりと5つの異なる道具(検索エンジン、コード作成者、事実確認者など)を駆使する探偵小説のような場合――これらを一度に教えるのは、非常にややこしくなります。それは、目隠しをしたまま、車の運転、飛行機の操縦、そして船の航海を同時に学ぶようなものです。ロボットは混乱し、早い段階でミスを犯し、どの特定のステップが失敗の原因だったのかを特定できなくなります。現在のシステムの多くは、すべてを一つの巨大な脳で行おうとする(そのため長いタスクに苦戦する)か、あるいは、互いに学習しないロボットのチームを使用しています(そのため、元の変更不可能な習慣に縛られてしまいます)。
この論文は、AIチームを訓練するための新しい方法であるAGENTFLOWを紹介しています。これは、専門化されたロボットのチームがリアルタイムで協力して働く、ダイナミックで生き生きとしたワークショップのようなものです。一つの巨大な脳がすべてをやろうとする代わりに、AGENTFLOWは仕事を分割します。**プランナー(計画者)**が次の動きを決定し、**エグゼキューター(実行者)**がアクション(ウェブ検索など)を行い、**ベリファイア(検証者)が結果が妥当かどうかを確認し、そしてジェネレーター(生成者)**が最終的な回答を書き上げます。彼らはすべて、ステップごとに更新される「メモリーボード」を共有しています。魔法は、プランナーが事後ではなく、チームが作業している「最中」に学習することによって起こります。
研究者たちは、Flow-GRPOと呼ばれる特別な訓練方法を開発しました。これは、「ホットポテト(熱いジャガイモ)」ゲームを想像してみてください。チームは、毎ターン、すべてのプレイヤーに単一の「成功」または「失敗」のトークンを戻していきます。もしチームが最後にミステリーを解決できれば、彼らが行ったすべてのステップに対して「よくできました!」という信号が送られます。もし失敗すれば、すべてのステップに「もう一度やってみて」という信号が送られます。このように訓練することで、プランナーは、早い段階で行われた小さな決断でさえも、最終的な結果に影響を与えることを理解できるようになります。このように訓練することで、システムは即座に適応し、自らのミスを修正し、仕事に対して適切な道具を選ぶ方法を学びます。
結果は素晴らしいものです。彼らはこのシステムを、 obscure(無名な)な事実の検索から、複雑な数学の問題や科学的な問いに至るまで、10種類の異なる難解なパズルでテストしました。比較的小さな「脳」(70億パラメータのモデル)を使用しているにもかかわらず、AGENTFLOWはGPT-4o(約2000億パラメータ)のような非常に大規模で有名なモデルや、他の特化したAIシステムを打ち負かしました。例えば、検索主体のタスクでは精度が15%近く向上し、数学の問題では14%以上向上しました。この研究は、AIチームが孤立してではなく、会話の流れの中で共に学ぶことで、計画、ツールの使用、そして多くのステップを必要とする問題の解決において、より優れた能力を発揮することを示しています。それは単に大きな脳を持つことではなく、チームがいかに効果的に協力して働くかを教えることなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。