SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL
SPO++は、アクション・トークン尺度正規化とイベント整合的エビデンス構成を通じて、軌跡レベルのアドバンテージ中心化とトークン重み付きアクター最適化との間の不一致を修正することにより、非同期的なエージェンティック強化学習のオンライン学習効率を向上させる。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能が急速に進化する中で、研究者たちは、プログラムに試行錯誤をさせ、その結果から学習させることで、複雑な問題を解決する方法をコンピュータに教えています。強化学習として知られるこのプロセスは、大規模言語モデルがツールを使用したり、仮想環境をナビゲートしたり、数学の問題を解いたりするエージェントとして機能するように訓練する上で、特に有用です。この研究における中心的な課題は、答えに至るまでの道のりが長く、予測不可能な場合に、どのように成功を測定するかという点です。従来の方法では、多くの場合、システムが同じ問題に対して多数の異なる試行を同時に生成し、それらすべてが完了するのを待ってから結果から学習する必要があります。これはボトルネックを生み出します。もし一つの試行が、多くのツールを試したりして時間がかかってしまった場合、学習プロセス全体が、その最も遅い試行が追いつくのを待つために一時停止してしまうのです。
この非効率性を解決するために、「シングルストリーム・ポリシー最適化(Single-stream Policy Optimization)」と呼ばれる新しいアプローチが開発されました。この手法は、一連の試行を待つ代わりに、過去の成功と失敗の持続的なメモリ(記憶)を使用して将来の決定を導くことで、一度に一つの試行から学習することを可能にします。しかし、カイ・ルアン(Kai Ruan)とジンハオ・リン(Jinghao Lin)率いる研究チームは、この手法が待ち時間を排除した一方で、コンピュータが自身の進捗を計算する方法において、微妙ながらも重大な不一致を導入したことを発見しました。彼らは、システムの報酬の平均化の方法が、実際にソリューションのステップを処理する方法と一致していないことを突き止めました。この整合性を修正することで、彼らは「SPO++」と名付けた改良版の手法を作り上げ、これにより人工知能が大幅に高速かつ効率的に学習することを可能にしました。
問題の核心は、コンピュータがレスポンスの長さをどのように扱うかにありました。元の方法では、システムは試行全体に対して単一のスコア(例えば、ロボットが部屋の掃除に成功したか、あるいは数学ソルバーが正しい答えを見つけたかなど)を計算していました。そして、その単一のスコアを、モデルがその試行中に生成したすべての単語(トークン)に分散させていました。これは論理的に見えるように思われましたが、歪みを生み出しました。もし一つの試行が非常に長く、別の試行が短かった場合、長い試行はそのスコアを多くの単語に希釈し、短い試行はそのスコアをより少ない単語に集中させます。システムがこれらのスコアから学習しようとする際、レスポンスの長さが、学習の中心点を密かに変化させてしまい、モデルが間違ったものを最適化するようにさせてしまったのです。それはまるで、天秤で重さを量ろうとしているのに、天秤の上の重りが、アイテム自体の価値ではなく、そこに置かれたアイテムの数に応じて動いてしまうようなものでした。
研究者たちは、この不整合が起こっている2つの特定の領域を特定しました。第一に、システムは試行が実際に生成された時ではなく、試行の結果を受け取った時に追跡を行っていました。タスクが送信され、異なる速度で完了する非同期システムでは、結果が到着する順序はしばしばランダムであり、ネットワーク速度やコンピュータの負荷に依存します。元の手法は、この到着順序を使用してメモリを更新していたため、学習信号はタスク自体の論理ではなく、コンピュータシステムのタイミングに影響を受けていました。第二に、より決定的なこととして、スコアの平均化の方法が、モデルが最終的な結果だけでなく、生成するすべての単語から学習するという事実を考慮していませんでした。研究者たちは、学習プロセスを修正するためには、モデルが実際に行っている作業の量と報酬信号を一致させるために、生成されたアクション単語の数に基づいてスコアを標準化する必要があることに気づきました。
これらの課題に対処するため、チームは学習プロセスに2つの主要な変更を加えたSPO++を導入しました。まず、メモリシステムを再編成し、結果が戻ってきた時ではなく、リクエストが送信された特定の瞬間である「ポリシーイベント(policy event)」を追跡するようにしました。これにより、システムの過去の成功の記憶は、タスクが完了するまでの時間に関わらず、タスクが作成された時点のモデルの状態に結び付けられ、学習信号が一貫したものになります。次に、スコアの平均化の方法を変更しました。すべての試行を単一のユニットとして扱うのではなく、新しい手法では、全試行を通じて生成された総アクション単語数に基づいて平均スコアを計算します。これにより、学習信号が、モデルが実際に知識を更新するプロセス、つまり単語単位での動きと完全に一致するようになります。
これらの変更による結果は、2つの異なる種類のタスクを用いてテストされました。一つは、エージェントが物体を特定の場所に移動させる128個のシミュレーションされた家事タスクであり、もう一つは、Pythonの計算機を使用する必要がある1,500個の数学問題のデータセットです。研究者たちは、0.8ビリオン(8億)パラメータを持つモデルと2ビリオン(20億)パラメータを持つモデルという、2つの異なるサイズの言語モデルを使用して実験を行いました。あらゆるテストにおいて、新しい手法であるSPO++は、元の手法よりも速く学習しました。家事タスクにおいては、改善は相当なものであり、新手法はトレーニングの過程で大幅に高い総報酬を達成しました。数学問題においては、改善幅はより小さいものの、依然として一貫しており、モデルがより迅速に高いパフォーマンスレベルに到達することを示しました。研究者たちは、新しい手法の最も強力な部分はスコアの平均化の方法の変更であり、それだけで改善の大部分を占めていることを発見しました。
これらの知見は、人工知能エージェントを訓練するという複雑な世界において、データの処理方法の詳細が、データそのものと同じくらい重要になり得ることを示唆しています。システムが進捗を測定する方法が、実際に学習する方法と一致していることを確認することで、研究者はより多くの計算資源やより大きなモデルを必要とすることなく、大幅な効率性の向上を実現できます。この研究は、学習プロセスにおける小さな不整合であっても、進歩を遅らせる可能性があること、そしてこれらの不整合を修正することで、システムが欠陥のある測定を補正することではなく、問題の解決にエネルギーを集中させられるようになることを証明しています。人工知能がより困難で多様な課題に取り組み続ける中で、SPO++のような手法は、より明確な道筋を提示しており、モデルが行うすべてのステップが正確に測定され、その成長に効果的に寄与することを保証しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。