← 最新の論文
💬 NLP

LamPO: A Lambda Style Policy Optimization for Reasoning Language Models

LamPO は、スカラー群アドバンテージをペアワイズ分解アドバンテージに置き換えることで微細な関係情報を保持し、検証可能な報酬を用いた強化学習を強化する推論言語モデル向けの新しい方策最適化手法であり、これにより既存の GRPO などの手法と比較して数学および科学ベンチマークにおいてより安定した学習と優れた性能を実現する。

原著者: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

複雑な数学の問題を解く方法を学生に教える場面を想像してください。あなたは学生に質問を与え、学生は答えへの 8 つの異なる試行を持って戻ってきます。

従来の教え方(GRPOと呼ばれます)では、すべての 8 つの答えを見て「平均」スコアを計算し、学生に次のように伝えます。「平均より良い結果を出したから、よくやった!」あるいは「平均より悪い結果だったから、もう一度挑戦しなさい。」

このアプローチの問題点は、「平均」を単一の数値として扱うことです。それは詳細を忘れ去ってしまいます。学生がほぼ完璧な答えを 1 つ出し、完全に間違った答えをもう 1 つ出した場合、従来の方法はそれらを単に「平均以上」と「平均以下」としてしか捉えません。一方が他方よりもどの程度優れていたかというニュアンスを失ってしまいます。

LamPOは、これらの AI 学生を教えるための新しい、より賢明な方法です。その仕組みを、簡単な比喩を使って説明します。

1. 「一対一」トーナメント(ペアワイズ分解アドバンテージ)

すべての答えを退屈な平均と比較する代わりに、LamPO は答えをトーナメント形式に配置します。すべての可能な答えのペアを取り出し、それらを直接比較します。

  • 従来の方法: 「あなたはクラスの平均より 2 点上です。」
  • LamPO の方法: 「あなたの答えは答え B より 5 点上でしたが、答え C はあなたより 2 点上でした。」

LamPO は、すべての答えのペア間のギャップを調べます。学生の答えが間違った答えよりわずかに優れている場合、LamPO は小さな促しを与えます。もし大きく優れているなら、大きな後押しを与えます。これにより「関係性の情報」が保持されます。つまり、誰が誰に、どの程度勝ったかを正確に把握しているのです。

2. 「自信メーター」(重み付け)

時には、AI 学生が自分の答えについて非常に不確かなことがあります。LamPO には特別な「自信メーター」があります。

  • AI が答え A の方が答え B より優れていると非常に確信している場合、LamPO はその比較を注意深く耳を傾けます。
  • AI が混乱しており、それらがほぼ同じだと考えている場合、LamPO はその比較を低い重みで扱います。

これは、100% 確信を持って戦略を語っている選手の話をコーチが熱心に聞き、推測している選手の話をあまり熱心に聞かないのと同じです。

3. 「ヒントシステム」(高密度補助報酬)

通常、数学やコーディングでは、最終的にのみ「正解」か「不正解」かのシグナルが得られます。これは、どこで間違えたかを教えずに「不正解」と言う教師のようなものです。

LamPO は、教師が正解の鍵を持っている場合に「ヒントシステム」を追加します。これはROUGE-Lと呼ばれるツール(「単語の重複チェック」のようなもの)を使用して、学生の思考プロセスがどれほど正解のものに似ているかを調べます。

  • 最終的な答えが間違っていたとしても、学生のステップが正解のステップの 80% に似ている場合、LamPO は正しい方向に進んでいるとして小さな「ボーナス点」を与えます。これにより、学生が完全な「ゼロ」スコアに落胆するのを防ぎます。

結果:より滑らかな旅

この新しい方法(LamPO)は、従来の方法(GRPO)と比較して、難しい数学や科学のパズル(AIME や MATH データセットなど)でテストされました。

  • より良い成績: LamPO で訓練された AI モデルは、これらのテストでより高いスコアを獲得しました。
  • より少ないドラマ: 訓練プロセスははるかに滑らかでした。従来の方法は、AI が良いパフォーマンスと悪いパフォーマンスの間を激しく揺れ動く(ジェットコースターのよう)ことがありました。LamPO は、静かなエレベーターの移動のように、学習を安定させました。
  • 効率性: AI はより速く学習し、タスクを得意になるために必要な試行回数が少なくなりました。

注意点(限界)

この方法には、わずかなコストがあります。LamPO は、すべての答えを他のすべての答えと比較するため(ラウンドロビン・トーナメントのように)、それらのペアのすべてを計算するために少し多くの計算能力を必要とします。ただし、論文は、使用したグループサイズにおいては、このコストは非常に小さく、改善に見合うものであると指摘しています。

要約すると: LamPO は AI 向けのより賢明なコーチング方法です。単にクラスの平均を見るのではなく、すべての一対一の対戦を調べ、AI の自信に耳を傾け、道中で役立つヒントを与えます。これにより、より賢く、より安定した推論モデルが生まれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →