← 最新の論文
🤖 AI

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

本論文は、コンテキストの不一致を排除し、因果的に一貫したクレジット割り当てを可能にし、かつ非同期的なポリシー・ドリフトを制御するために、ロールアウトを疎な逆ツリー(sparse reverse trees)として再構成することで、マルチターン・エージェントの強化学習訓練を安定化させる統一フレームワークであるReverse-Turn Policy Optimization (RTPO) を導入し、既存のベースラインを大幅に上回る性能を実現するものである。

原著者: Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能が急速に進化する世界において、研究者たちは大規模言語モデルに自律的なエージェントとして振る舞うよう教えています。これらは単に質問に答えるだけのチャットボットではありません。複雑な問題を解決するために、計画を立て、推論し、計算機やウェブ検索エンジンのような外部ツールを使用するように設計されたシステムです。これらのエージェントをより賢くするために、科学者たちはしばしば「強化学習」と呼ばれる手法を用います。新しいゲームの遊び方を学んでいる学生を想像してみてください。彼らはさまざまな手を試しますが、もし勝てば報酬が得られます。時間をかけて、彼らはどの手が成功につながるかを学習していきます。デジタル領域において、「手」とはモデルが生成する言葉であり、「報酬」とはタスクの最後に与えられるスコアです。このアプローチは、一度のステップで数学の問題を解くような、単一ステップのタスクに対しては非常に成功してきました。しかし、これらのエージェントが、トピックの調査、データの収集、そして数回の会話にわたるレポート作成といった、長くて多段階のワークフローを実行するよう求められると、学習プロセスは極めて不安定になります。モデルは短いタスクを解くことはできますが、タスクが長くなると無残にも失敗し、ステップ数が増えるにつれてパフォーマンスが崩壊してしまうのです。

オーストラリアとアメリカの大学の研究チームは、なぜこの崩壊が起こるのかを特定し、それを修正するための新しい方法を提案しました。彼らは、これらのエージェントを多くのターンにわたって訓練する際に、深く結びついた3つの問題が発生していることを発見しました。第一に、モデルが練習中に見ているものと、教えられている間に見ているものとの間にミスマッチが生じます。練習中、モデルはスペースを節約するために会話の要約のみを見ているかもしれませんが、訓練中には、コンピュータが会話の全履歴(フル履歴)を見るよう強制します。この違いがモデルを混乱させ、どのコンテキストを信頼すべきか確信を持てなくさせます。第二に、長い推論の連鎖の中で、具体的にどのステップが最終的な成功または失敗につながったのかを判断することにシステムが苦戦します。モデルが10ステップのプロセスの最後に報酬を得たとき、学習アルゴリズムは、たとえ5番目のステップが決定的なミスであったとしても、その功績(あるいは責任)を10個のステップすべてに均等に分配してしまうことがよくあります。これにより、エージェントが正しい行動を学ぶことが困難になります。第三に、訓練が進むにつれて、モデルは変化します。もしシステムが、モデルが「若く」スキルが低かった頃に始まった長い会話から学ぼうとし、モデルが「年をとり」スキルが高くなった後に訓練を終了しようとする場合、データに不整合が生じます。モデルは本質的に、自分自身の過去の姿から学ぼうとしており、それが学習プロセスを不安定にする「ドリフト」を引き起こします。

これらの問題を解決するために、研究者たちは「リバース・ターン・ポリシー最適化(Reverse-Turn Policy Optimization、RTPO)」と呼ばれる新しいフレームワークを開発しました。長い会話を一つの巨大で平坦なテキストブロックとして扱うのではなく、彼らは訓練プロセスを、一連の明確に接続された瞬間として再構築しました。核心となるアイデアは、タスクの最後のステップから始まり、最初に向かって逆方向に進むことで、モデルを訓練することです。システムが会話の特定のターンに到達すると、そこで一旦停止し、いくつかの「兄弟(シブリング)」となる未来のバージョンを作成します。そしてモデルにこう問いかけます。「もし今、この特定の決定を下したら、次に何が起こるか?」 次に、これらの未来のシナリオを前方に走らせ、それらが良い結果につながるかどうかを確認します。これらの兄弟となる未来を比較することで、システムは、以前に何が起こったかというノイズや、将来何が起こるかという不確実性に左右されることなく、現在のターンにおける最適な決定がどれであるかを正確に特定することができます。この手法により、モデルは常に一貫したコンテキストから学習し、成功した結果に対する功績が、それを引き起こした決定に対して正確に割り当てられるようになります。

この新しいアプローチの結果は驚くべきものでした。困難な数学的推論タスクや複雑なウェブ検索の課題でテストしたところ、この新手法は既存の技術を大幅に上回りました。難しい数学の問題のセットにおいて、この新手法は従来の標準的な手法と比較して、エージェントの精度を21パーセント以上向上させました。知識ベースのタスクにおいては、パフォーマンスが11パーセント近く向上しました。おそらくより重要なのは、訓練プロセス自体が非常に安定したことです。従来の手法では、タスクが長くなるにつれてモデルの性能が低下することがよくありましたが、この新しいアプローチでは、ステップ数が増えてもモデルは改善し続けました。また、研究者たちは、エージェントがツールをより効率的に使うことを発見しました。数学の問題において、エージェントはツールの呼び出し回数は減りましたが、正解の数は増えました。これは、エージェントが自身の推論に頼り、絶対に必要な場合にのみツールを使うことを学んだことを示唆しています。調査タスクにおいては、ツールの呼び出し回数は増えましたが、それらの呼び出しはより戦略的であり、より優れた情報収集につながりました。

研究者たちは、特定した3つの問題をそれぞれ分離することで、自分たちの解決策が機能することを検証しました。コンテキストのミスマッチを修正することで、モデルが何を注視すべきかについて混乱しなくなったことを示しました。クレジット割り当て(功績の配分)を修正することで、モデルは最終結果に基づいて推測するのではなく、各特定のステップにおいてより良い決定を下せるようになりました。そして、訓練データを現在のバージョンのモデルと一致させることで、長い訓練セッションを失敗させる原因となるドリフトを排除しました。この研究は、複雑な多段階タスクを迷うことなく処理できる、より信頼性の高いAIエージェントを構築するための明確な道筋を示しています。それは、長期間の推論をマスターするための鍵は、単にモデルにより多くのデータを与えることではなく、データの学習方法を再構築し、すべての決定が適切な未来の可能性に対して公平かつ正確に判断されるようにすることであると示唆しています。この成果は、一つひとつの思慮深いステップを通じて、現実世界の複雑さに真に対処できるAIアシスタントの創造に向けた、重要な一歩となります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →