← 最新の論文
🤖 machine learning

Rethinking the Divergence Regularization in LLM RL

本論文は、従来のダイバージェンスに基づく手法で用いられていたハードな勾配マスキングに代わり、連続的な修正信号を提供して学習の安定性を向上させるための、滑らかでアドバンテージ加重された二次正規化項を用いた、LLMのための新しいRL手法であるDivergence Regularized Policy Optimization (DRPO) を提案する。

原著者: Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, Tianyu Pang

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, Tianyu Pang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に才能はあるが少し無秩序な学生(AI)に、難しいテストの解き方を教えていると想像してください。その学生はすでに基礎は学んでいますが、あなたは今、より特定の、トリッキーな問題を解く方法を教えようとしています。あなたは練習問題を与え、学生が回答し、それに対して「よくできました!」あるいは「もう一度やってみて!」と伝えることで、学習を進めます。このプロセスは**強化学習(Reinforcement Learning: RL)**と呼ばれます。

しかし、一つ問題があります。学生は静かな図書室で練習(学習)しますが、実際のテストは騒がしく混沌とした試験会場で受けます。環境が少し異なるため、学生は混乱したり、習慣を極端に変えすぎてしまったりして、これまで知っていたことをすべて忘れてしまうようなパニック状態に陥ることがあります。

これを防ぐために、教師たちは「安全地帯」(信頼領域:Trust Region)を用います。これは、「答えを改善するために変えることは構わないが、足元をふらつかせないよう、あまりに大きく変えすぎてはいけない」というルールです。

問題点:古いルールはあまりに硬直的だった

長い間、教師たちはPPO(Proximal Policy Optimization)という手法を用いてきました。PPOを「厳格なルールブック」だと考えてください。「もし答えが20%以上変わったら、ストップ!その回答に対する評価は一切認めない!」というルールです。

この論文は、このアプローチには2つの大きな欠陥があると指摘しています。

  1. 「比率」の罠: PPOは、答えの「確率」がどれくらい変化したかという「比率」を見て変化を測定します。数百万もの単語が存在する世界(例えば5万語以上の辞書を持つ世界)では、非常に珍しい単語(例えば「xylophone(木琴)」)が、0.0001%の確率から0.001%に上がったとします。これは比率で見ると10倍という巨大な変化ですが、全体的な文脈ではほとんど意味を持ちません。一方で、一般的な単語(例えば「the」)が90%から80%に下がったとします。これは比率の変化としては小さいですが、意味としては非常に大きな変化です。PPOはこの違いに混乱し、珍しい単語を厳しく罰しすぎる一方で、一般的な単語が暴走するのを許してしまいます。

  2. 「ハードカット」の問題: より新しい手法(DPPOなど)は、確率の実際の「変化量」(比率ではなく、移動した距離のようなもの)を測定することでこれを解決しようとしました。しかし、それらは「ハードマスク」を使用していました。壁を想像してください。もし学生が壁から1インチでも踏み出したら、教師は即座に手を叩いて「ストップ!このステップでの学習は終了だ!」と言います。これは、全額のクレジットをもらえるか、ゼロになるかの二者択一のスイッチです。もし学生が壁をほんの少し超えてしまったとしても、元の場所に戻るための助けは得られず、ただ無視されるだけなのです。

解決策:DRPO(滑らかなガイド)

著者らは、新しい手法であるDRPO(Divergence Regularized Policy Optimization)を提案しています。

ハードな壁や厳格な比率のルールではなく、安全地帯の周囲にある「スマートで弾力性のあるトランポリン」を想像してください。

  • ゾーンの内側: 学生が安全地帯の中で良い変化を行っている場合、トランポリンは彼らを優しく前へと押し出し、さらなる改善を促します。
  • エッジ(境界)において: 学生が境界に近づくと、トランポリンは徐々に柔らかくなります。突然止めるのではなく、動きを緩やかにするのです。
  • ゾーンの外側: もし学生が誤って外側に踏み出してしまった(「悪い」動きをした)としても、トランポリンは単に遮断するわけではありません。代わりに、それは跳ね返します。それは「おっと、行き過ぎましたね。中心に戻りましょう」と伝えるような、穏やかな修正力を加えます。

なぜこれが優れているのか

論文によれば、DRPOは「硬いオン/オフのスイッチ」ではなく、「滑らかで連続的なガイド」であるとのことです。

  1. 「ロングテール」をより適切に扱う: AIの世界には、数千もの珍しい単語が存在します。DRPOは単語がどれだけ動いたかの「比率」ではなく、実際の「距離」を測定します。これにより、珍しい単語がほぼゼロから極めて小さな数字に跳ね上がったとしても、混乱することがありません。単語がどれほど一般的であるかにかかわらず、変化を公平に扱います。
  2. 学習を止めない: 学生がミスをして安全地帯の外に出たとしても、DRPOは単にそのレッスンを捨て去ることはありません。ミスを利用して、学生を優しく元の方向へ導きます。これにより、学習が不安定になったり「クラッシュ」したりすることを防ぎます。
  3. あらゆる場面で機能する: 著者らは、様々なサイズのAIモデル(小規模から大規模まで)、異なる種類のコンピュータチップ、さらにはコンピュータが低い精度(少しぼやけたレンズを使っているような状態)で動作している場合でも、DRPOをテストしました。あらゆるケースにおいて、DRPOはより安定しており、従来のメソッドよりも速く、より良くAIの学習を助けました。

まとめ

古い手法を、「あなたがわずかなミスをした瞬間に『止まれ!』と叫ぶか、あるいは少し道から外れただけで完全に無視する教師」だと考えてください。

DRPOは、「順調ですよ、でも少し行き過ぎています。少しペースを落としましょう。もし行き過ぎてしまったら、転ばないように優しく引き戻しますね」と言ってくれる賢明なコーチのようなものです。この滑らかで連続的な修正こそが、学習プロセス全体をより安全で、速く、そして信頼できるものにするのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →