← 最新の論文
🤖 machine learning

Predictive Divergence Masks for LLM RL

本論文は、PPOの比率に基づく方向基準を、近接基準に使用される確率ダイバージェンスが次の勾配ステップで増加するか減少するかに関する閉形式の予測に置き換えることで、モデルのスケールを問わず学習の安定性と性能を向上させる、LLMの強化学習のための新しい手法であるPredictive Divergence Masksを提案する。

原著者: Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang, Tianyu Pang

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang, Tianyu Pang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超スマートなロボットに物語の書き方を教えていると考えてください。あなたは、ロボットに間違いから学んでほしいと考えていますが、一つの厳格なルールがあります。「一度にあまりに激しく書き方を変えてはいけない」というものです。もしロボットが興奮しすぎて、全く異なる声(スタイル)で書き始めたら、あなたはブレーキをかけなければなりません。これが、大規模言語モデル(LLM)における**強化学習(RL)**の仕事です。

長い間、そのブレーキを踏むための標準的な方法は、PPOと呼ばれる手法でした。それは、単一の単語に基づいた単純な信号機のように機能しました。ロボットが単語を選び出すたびに、システムはこうチェックしました。「この単語は、ロボットが通常選ぶものよりも大幅に確率が高いか? そして、報酬はそれをさらに高い確率にすることを求めているか?」もし答えが「はい」で、かつ両方の条件を満たす場合、システムは「止まれ! それはやりすぎだ!」と言い、その単語からの教訓を無視しました。

しかし、ここには問題があります。ロボットは単に一つの単語を選ぶだけでなく、その単語を選ぶために自身の「人格(確率分布)」全体を再構成しているのです。古い手法は、ロボットが選んだ特定の単語だけを見ていました。それはまるで、一つのバイオリンの音を聞いてオーケストラ全体を判断するようなものでした。他の楽器がどのように変化したかを見落としていたのです。

新しいアイデア:予測的ダイバージェンス・マスク(Predictive Divergence Mask)

Tencent、UIUC、NUSの研究チームは、この「単一単語の視点」が誤解を招くものであることに気づきました。彼らは、予測的ダイバージェンス・マスクと呼ばれる新しいルールを提案しました。

単にロボットが選んだ一つの単語を見るのではなく、この新しい手法はより大きな問いを投げかけます。「もしこのステップを踏んだとしたら、ロボットの『人格全体』は元の自分からさらに遠ざかってしまうだろうか?」

次のように考えてみてください:

  • 旧来の方法(PPO): 子供が崖に向かって走っているのが見えます。あなたは「その特定のステップ」が危険かどうかをチェックします。もし危険なら、「止まれ!」と叫びます。
  • 新しい方法(予測的ダイバージェンス): あなたは子供が走っているのを見ます。あなたは「経路全体」を見ます。たとえその特定のステップ自体が安全に見えたとしても、子供の勢いによって回転がかかり、別の崖へと放り出される可能性があるかもしれません。新しい手法は、ステップが行われる前に、その「回転全体」を予測します。

その仕組み(魔法の数学)

研究者たちは、実際にシミュレーションを実行することなく、この「回転全体」を予測する巧妙な数学的トリックを発見しました。

  1. ローカル項(Local Term): これは、古い手法がすでに知っていた部分です。ロボットが選んだ特定の単語の変化です。
  2. グローバル項(Global Term): これが新しい秘伝のソースです。一つの単語を変更することが、他のすべての単語(選ばれなかった単語)の確率をどのように強制的に調整させるかを考慮に入れます(合計確率が常に100%にならなければならないため)。

古い手法は、このグローバル項を無視していました。新しい手法は、これらを合算します。もし数学的に、ロボットの人格全体が遠ざかりすぎていることが示された場合、マスクが更新をブロックします。もし数学的に、ロボットが実は安全な方向へと戻ろうとしていることが示された場合、更新は許可されます。

「Top-K」問題

現実の世界では、ロボットのエンジン(ロールアウト・エンジン)は、時間とメモリを節約するために、最も可能性の高い上位20個の単語(「Top-K」)のみを表示します。それ以外の何千もの単語は「テイル(裾)」バケットに隠されています。

この限定的な視点でも予測を機能させるために、研究者たちは2つの軽量な推定器を考案しました。

  • 集約テイル推定器(Aggregated-Tail Estimator): 隠されたすべての単語を一つの巨大な塊として扱います。
  • 一様テイル推定器(Uniform-Tail Estimator): 隠された単語がすべて等確率であると仮定します。

彼らは、上位20個の単語が通常、ほぼすべての確率(99%以上)を保持しているため、どちらの手法もほぼ同じ結果になることを発見しました。それは、空を見て天気を予想するようなものです。雨が降るかどうかを知るために、雲を一つ一つ数える必要はありません。

実験が示したこと

チームは、さまざまなサイズのロボット(40億から300億パラメータの範囲のモデル)でテストを行い、さらに「FP8」精度(トレーニングや生成エンジンを高速化し、精度をわずかに下げた数学モード)で動作させた場合もテストしました。

  • 結果: 新しいマスクは、トレーニングをより安定させました。
  • 証拠: 彼らは61種類の異なる実験(シード)を実行しました。その結果、古い手法は、実際にはロボットを遠ざけてしまう更新を保持してしまうことがあった(「不適切な保持」率が36.9%)ことが分かりました。新しい手法はこの数値を**34.2%**に減少させました。
  • 改善点: 数字自体は小さく見えるかもしれませんが、巨大なAIモデルのトレーニングの世界では、たとえわずかな悪いステップを防ぐだけでも、ロボットがより良く、より速く学習する助けになります。新しい手法は、すべてのモデルサイズと精度設定において一貫して機能しました。

明確に否定されたこと

論文では、何がうまく機能しないかについても明確に述べています。

  • 彼らは、更新の方向を決定するために、サンプリングされたトークンの重要度比(sampled-token importance ratio)(古い「単一のバイオリン」によるチェック)を使用することに反対しています。彼らは、この単一単語のチェックが、ロボットの人格全体の真の変化としばしば食い違うことを示しました。
  • また、単に「安全圏(信頼領域)」を狭めること(閾値を0.15から0.05にするなど)は、すべてを悪化させることも示しました。これは、単に制限を厳しくすることが答えではなく、更新の「方向」についてより賢くなることが重要であることを示唆しています。

どの程度確実なのか?

著者らは、実験から得られた測定データに基づき、自らの発見に自信を持っています。彼らは単に真空状態でシミュレーションを行ったのではなく、実際の数学問題(DAPO-Math-17kデータセットを使用)を用いてモデルを訓練し、AIME24やAIME25といったベンチマークで精度を測定しました。

彼らは、このアプローチがより優れたルールの整合性をもたらすと示唆しています。もし、安全圏を「人格全体(ダイバージェンス)」を見て定義するのであれば、更新の方向を確認する際も、単一の単語ではなく、人格全体を見るべきです。結果は、これがより安定したトレーニングにつながることを示唆していますが、これは依然として「局所的な一次近似(local first-order approximation)」であることも認めています。つまり、これは次のステップに基づいた非常に優れた推測であり、未来全体を見通す完璧な水晶玉ではないということです。

要するに、新しい手法は、今踏み出そうとしているステップだけを見るのではなく、地図全体を見るGPSをロボットに与えるようなものです。これにより、ロボットは世界の端から外れることなく、より速く学ぶことができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →