← 最新の論文
🤖 AI

SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning

本論文は、LLMが完了した軌跡からエラーの「パッチ」を合成することで自己反省を内面化し、外部のクリティックや報酬モデルを必要とせずに、数学的推論および長期的なエージェントタスクにおいて最先端の性能を達成することを可能にする、データ効率の高いフレームワークであるSelf-Reflective Policy Optimization (SRPO)を導入する。

原著者: Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、複雑な問題を解決し、コードを書き、デジタル環境をナビゲートできる強力なツールですが、長い思考の連鎖を必要とするタスクではしばしば苦戦します。例えば、学生に難しい数学の問題を解かせたり、多段階の買い物プランを立てさせたりすることを想像してみてください。もしその学生が最終的な答えを間違えた場合、彼らには単純な「不正解」という信号が送られます。このフィードバックは結果が悪かったことを伝えてくれますが、思考の長い連鎖のどの特定のステップでエラーが発生したのかまでは説明してくれません。中間の計算ミスだったのか? 最初に立てた誤った仮定によるものだったのか? どこで崩壊が起きたのかを知らなければ、モデルは次回より良くする方法を簡単に学ぶことはできません。これは「クレジット割り当て問題(credit assignment problem)」として知られており、人工知能に長く複雑なタスクを扱う方法を教える上での大きな障壁となっています。

研究者たちは、人間がテストを見直して何が間違っていたのかを理解するのと同様に、モデル自身に自身のミスを振り返らせることで、この問題を解決しようと試みてきました。しかし、学習中にこの自己反省を利用しようとするこれまでの試みは、しばしば非効率的であったり不安定であったりしました。それらは、モデルが蓄積された自身の思考によって混乱したり、「間違えた」という漠然とした感覚を、生成されたすべての単語に対する具体的な教訓へと変換することに失敗したりすることがありました。「Self-Reflective Policy Optimization(SRPO)」と呼ばれる新しいアプローチは、異なる道筋を提示します。最終的な成績を待つのではなく、この手法は、モデルが完了した試行を分析し、どこで道から外れたのかを正確に特定し、その洞察を用いて次の試行を導くように、モデル自身が自身の教師として振る舞うよう教えます。

Jialong Liu氏らを中心とするSRPOの研究者たちは、言語モデルが自身の仕事を見返すことで学習するシステムを設計しました。プロセスは2つの明確なフェーズで行われます。まず、モデルは数学の問題を解いたり仮想の店をナビゲートしたりといったタスクに挑戦します。試行が完了すると、モデルは一旦停止して振り返ります。モデルは自身の行動の全シーケンスと最終的な結果をレビューし、何が間違っていたのか、あるいはどの重要な決定が正しかったのかを要約した、短く簡潔なメモを作成します。著者らが「リフレクション・パッチ(reflection patch)」と呼ぶこのメモは、長いエッセイではなく、通常は数個の箇条書き程度の、実行可能なヒントが凝縮されたものです。

第2フェーズでは、モデルは同じタスクに再び挑戦しますが、今度は元の質問に、先ほど作成したリフレクション・メモを加えた状態で開始します。この新しい組み合わせはガイドとして機能し、実質的に、後知恵という恩恵を伴ったセカンドチャンスをモデルに与えます。モデルは、この強化されたコンテキストに基づいて、より高品質な試行を生成します。極めて重要なのは、研究者たちがこの第2の、より優れた試行を最終的な回答として使用しないことです。代わりに、彼らはそれを「教示信号(teaching signal)」として使用します。彼らは、モデルの新しい改善された思考を、元のガイドなしの思考と比較します。両者の差異を分析することで、システムは高密度な学習信号のストリームを作り出します。モデルの元の試行におけるすべての単語が採点されます。もしある単語がリフレクションの知恵と一致していれば報酬を与え、もし逸脱していれば修正されます。これにより、タスクの最後にある単なる「正解」または「不正解」というグレードが、モデルが書いたすべての単語に対する何千もの微細で具体的なレッスンへと変換されるのです。

この手法は驚くほど効果的であることが証明されました。チームは、高度な数学競技会や、デジタル環境をナビゲートする必要のある複雑なエージェントタスクを含む、さまざまな困難なベンチマークでSRPOをテストしました。AIME'24と呼ばれる難解な数学テストにおいて、SRPOを使用したモデルは、平均73.3パーセント(5回の独立した実行において±1.4の標準偏差)のスコアを達成しました。これは他の主要な手法よりも大幅な改善であり、同様の学習に通常必要とされるトレーニングFLOPsのわずか8パーセントのみを使用して達成されました。システムはまた、WebShopのような長期間のタスク(long-horizon tasks)においても優れており、ショッピングミッションの64.7パーセントを成功させ、ALFWorldでは家庭内シミュレーションタスクの76.8パーセントを解決しました。これらの結果は、リフレクションの能力を内面化することで、モデルが外部のより大きな教師の導きを必要とせずに、自身の推論経路を修正する方法を学んだことを示唆しています。

研究者たちは、成功がリフレクションの内容によるものであり、単に追加されたテキストによるものではないことを検証するために注意深く確認を行いました。彼らは、全く別の問題のために生成されたリフレクションをシステムに投入することでテストを行いました。リフレクションがタスクと一致しない場合、モデルのパフォーマンスはベースラインレベルまで低下したため、特定の関連性のあるアドバイスこそが改善を駆動していたことが証明されました。また、リフレクションは簡潔である必要があることも分かりました。あまりに長すぎる、あるいは冗長なメモは、ノイズと混乱を導入するため、実際にパフォーマンスを低下させました。

結局のところ、SRPOは、言語モデルが自身を批判し、導くことを学ぶことで、より有能になれることを示しています。希薄な最終結果を、単語ごとの高密度なガイダンスへと変えることで、この手法は、以前考えられていたよりもはるかに少ない例と計算量で、複雑な推論パターンを学習することを可能にします。この研究は、人工知能システムが自身の推論プロセスを継続的に改善し、現実世界の課題を定義する長く複雑な問題を解決する上で、より信頼性が高く効率的なものになる未来を示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →