← 最新の論文
💻 computer science

GraphPO: Graph-based Policy Optimization for Reasoning Models

GraphPOは、推論のロールアウトを有向非巡回グラフとして表現することで、意味的に等価なパスを統合し、分岐間で情報を共有し、それによって冗長な探索とアドバンテージ推定の分散を低減する、新しいグラフベースの強化学習フレームワークを導入しており、既存の連鎖型および木構造ベースの手法を推論ベンチマークにおいて上回っています。

原著者: Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun

公開日 2026-06-19
📖 1 分で読めます☕ さくっと読める

原著者: Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いが少しばかり同じことを繰り返してしまう癖のある生徒に、複雑な数学の問題を解いたり、コードを書いたりする方法を教えているところだと想像してください。あなたは、ステップ・バイ・ステップの指示を与えるのではなく、彼らがさまざまなアプローチを試すのを自由にさせ、最後にだけ「正解!」または「不正解。」と伝えます。

これは、現在のAIモデル(大規模推論モデルと呼ばれます)が学習する方法です。彼らは、正解にたどり着くまで、推測し、推測し、そして推測し続けます。しかし、この方法には2つの大きな問題があり、この論文が解決を目指しているのが GraphPO です。

問題点:「孤独な探索者」と「分岐する木」

1. 無駄な努力(チェイン法)
100人の生徒を迷路に送り込む場面を想像してください。各生徒は完全に独立した経路を歩みます。

  • 問題点: 彼らはそれぞれ異なる道を歩んでいても、50人もの生徒が全く同じ行き止まりに突き当たったり、同じ紛らわしい廊下を歩いたりしているかもしれません。彼らは何度も同じことを繰り返しており、時間とエネルギーを無駄にしています。AIの用語では、これは「冗長な探索(redundant exploration)」と呼ばれます。

2. 「木」法(改善策だが、完璧ではない)
この無駄を減らすために、研究者たちは「木」法を試みました。生徒たちが一緒にスタートし、最初の分かれ道で分かれる様子を想像してください。もし2人の生徒が同じ最初の曲がり角を選んだなら、彼らはしばらくの間、一緒に歩きます。

  • 問題点: これは多少の助けにはなりますが、2番目の分かれ道で再び分かれたとき、彼らはまた自分自身の道を進むことになります。もし、木の異なる2つの枝が、最終的に(たとえ経由したルートが異なっていても)同じ紛らわしい廊下にたどり着いたとしても、生徒たちは自分たちが同じ場所にいることに気づきません。彼らはその廊下を別々に探索し続け、時間を無駄にします。また、もし一人の生徒がその廊下の出口を見つけたとしても、他の生徒はその「良いニュース」を共有できず、探索を続けてしまいます。

解決策:「スマート・マップ」(GraphPO)

著者らは、単なる「木」ではなく、生徒に生きている共有マップを与えるような手法である GraphPO を提案しています。

仕組み:

  1. マップ(グラフ): AIは単に線を引く(枝を作る)のではなく、すべての「部屋」(推論における一つのステップ)をノード(節点)とするマップを描きます。
  2. 双子を見つける(セマンティック・マージング): AIは探索を進める中で、異なる経路が到達した「部屋」をチェックします。もし2つの異なる経路が、たとえそこに至るまでの言葉遣いが少し違っていたとしても、感覚的に「同じ」と感じられる部屋に到着した場合、AIは「おい、君たち二人は同じ場所にいるぞ!」と言い、それらをマップ上の単一の地点へと統合(マージ)します。
  3. 良いニュースを共有する(サフィックス共有): 2つの経路がマージされると、それ以降のプロセスをすべて共有します。もし一方の経路がマージされた地点から正解を見つけた場合、もう一方の経路も、最後まで歩き直すことなく、即座にその成功の恩恵を受けることができます。
  4. 「効率性」ボーナス: AIはまた、特定の「部屋」に到達するための最短経路を好むように学習します。もし経路Aが特定の場所に到達するのに10ステップかかり、経路Bが同じ場所に到達するのに15ステップかかった場合、AIは経路Aを好むように学習します。これは、近道を見つけた生徒を褒めるようなものです。

結果:より賢く、より速く、より無駄なく

「スマート・マップ」のアプローチを用いることで、GraphPOは主に3つのことを達成しました。

  • 無駄なステップの撤廃: AIが同じ行き止まりを二度探索することを防ぎます。これにより、計算資源(コンピューティング・パワー)を、古い場所の繰り返しではなく、新しい領域を探索するために振り向けることができます。
  • 間違いからの学習能力の向上: 経路を統合することで、AIは最終的な答えが完璧になる前であっても、「この特定のステップは良かった」ということをより早く伝えることができます。これは、漠然とした「最後に正解した」という評価を、「この特定の動きが賢かった」という明確な評価へと変えるものです。
  • 回答の簡潔化: 解への最短経路を報酬として与えるため、AIはより簡潔で効率的な方法を学び、不必要なお喋りを削ぎ落とします。

まとめ

この論文では、数学の問題、コーディング、および探索タスクにおいて、3つの異なるAIモデルを用いてテストを行いました。その結果、GraphPOは一貫して従来のメソッド(孤独な探索者や分岐する木)よりも優れた性能を示したことが証明されました。同じ計算資源を使用しながら、より多くの問題を解き、より少ない言葉数で、より速く学習したのです。

要するに、GraphPOは、AIに「円を描いて歩くのをやめて、共有マップを使いなさい」と教えることで、学習プロセスをよりスマートで、より無駄のないものにするのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →