← 最新の論文
🤖 machine learning

OR Else: A Differentiable Trust Region for Policy Optimization

本論文は、LLMのポストトレーニングにおけるPPOおよびGRPOのクリップされたサロゲート目的関数に代わる、滑らかで微分可能な代替手法としての「出力リセット(Output Reset: OR)」を調査し、ORはグループ相対的な設定において最適化の挙動を変化させ、分散を減少させるものの、標準的なクリップを用いた手法と比較して報酬モデルのスコアを一貫して向上させるわけではないことを明らかにしている。

原著者: Chinmay Rane, Kanishka Tyagi, Michael Manry

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Chinmay Rane, Kanishka Tyagi, Michael Manry

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

AIに「ちょうど良さ」を教える技術

非常に賢いけれど、少し混沌としたロボットに、人間が本当に楽しめる物語を書く方法を教えようとしているところを想像してみてください。この分野は「人間からのフィードバックを用いた強化学習(RLHF)」と呼ばれます。これは、ロボットが文章を書き、人間の審判がそれに対して「グッド」か「バッド」の評価を与え、ロボットが次にもっと良い文章を書けるようにそのフィードバックから学ぶ、というゲームのようなものです。目標は、ロボットが脱線することなく、役に立ち、かつ無害であるようにすることです。

これを行うために、科学者たちはロボットの文章をスコア化するデジタルな審判、「報酬モデル」を使用します。しかし、ここには厄えな点があります。もしロボットが高スコアを得ようとしすぎると、高得点を取るためだけに意味不明な言葉を書き始めたり、あるいは性格が劇的に変わりすぎて普通の話し方を忘れてしまったりする可能性があるのです。これを防ぐために、研究者たちは「信頼領域(trust region)」と呼ばれる安全ルールを使用します。これは、まるで「リード(紐)」のようなものです。ロボットは自由に動き回り、学習することが許されていますが、このリードが、ロボットが元の理にかなった自分自身から遠くへ走り去ってしまうのを防いでくれます。

このリードを管理する最も一般的な方法は、PPO(Proximal Policy Optimization)と呼ばれる手法です。PPOは「クリッピング(切り詰め)」という仕組みを使用しています。ロボットが目標に向かって走っているところを想像してください。もしロボットが安全圏の端に近づきすぎると、PPOは突然ブレーキをかけ、より速く走ろうとする追加のモチベーションを遮断します。これは効果的ですが、まるで「スイッチ」のように、オンかオフのどちらかです。この論文は、シンプルな問いを投げかけています。「もし、このリードがパチンと閉まるのではなく、ロボットが安全限界に達するにつれて、緩やかに消えていく(フェードアウトする)としたらどうだろうか?」と。著者たちは、この「スムーズなリード」のアプローチが、大規模言語モデル(LLM)を役立つように教える上でより効果的かどうかを確認するために、「出力リセット(Output Reset: OR)」という新しい手法を提案しています。

スムーズなリード vs. クリッピングされたスイッチ

研究者のChinmay Rane、Kanishka Tyagi、Michael Manryは、この新しい「スムーズなリード」のアイデアを、標準的な「クリッピングされたスイッチ」と2つの異なるトレーニングシナリオで比較テストすることに決めました。彼らは、小規模ながらも有能なロボットの脳(Llama-3.2-1Bモデル)を使用し、人間の好みのデータセット(Anthropic hh-rlhf)を用いてトレーニングを行いました。結果が単なる運ではないことを確認するため、異なるランダムシードを用いて実験を3回繰り返しました。

実験:2つの異なる世界
チームは、新しい手法であるPPO-ORGRPO-ORを、2つの異なる環境でテストしました。

  1. GAEの世界 (PPO): これは、ロボットが「クリティック(批評家)」(将来の報酬を予測するヘルパー)を持ち、単語(トークン)を一つずつ学んでいく古典的なセットアップです。
  2. グループ相対の世界 (GRPO): これは、より新しくシンプルなセットアップです。ロボットは一度に2つの回答を生成し、それらを比較し、クリティックを必要とせずにその差から学びます。

結果:2つの異なる結末
結果は驚くべきもので、この「スムーズなリード」は、あらゆる状況において同様に機能するわけではないことを示しました。

  • GAEの世界 (PPO) において: スムーズな手法(PPO-OR)は、生のスコアにおいて明確な勝者でした。新しい手法で訓練されたロボットは、標準的なクリッピング手法の0.195に対し、平均報酬スコア0.500を記録しました。これは0.305ポイントの跳ね上がりです!しかし、一つ問題がありました。結果が少し「不安定」だったのです。3回の実行間でのスコアの変動(標準偏差)は、標準的な手法の0.110に対し、新しい手法では0.158となりました。スムーズなリードはロボットをより速く走らせる助けにはなりましたが、その経路を少し予測しにくくしたようです。

  • グループ相対の世界 (GRPO) において: ここでは、スムーズな手法(GRPO-OR)はロボットをより速く走らせることはありませんでした。実際、平均スコアは0.488から0.457へとわずかに低下しました。しかし、ロボットは非常に安定しました。実行間の変動は、0.080から0.027へと劇的に縮まりました。それはまるで、ロボットがガタつきを止め、一定のリズムを見つけたかのようでしたが、最高スコアに到達することはできませんでした。

大きな驚き:リードは短くなっていなかった
しかし、最も重要な発見はスコアについてではありませんでした。研究者たちは、新しい手法によってロボットが元の性格から遠く離れてしまうのではないか(「ポリシー・ドリフト」と呼ばれる問題)と懸念していました。彼らは、ロボットの現在の文章スタイルが、開始時のスタイルからどれだけ逸脱したかを測定しました。

その結果、グループ相対の世界では、古いクリッピング手法を使っても新しいスムーズな手法を使っても、ロボットは5から13ユニットという膨大な距離を逸脱していることがわかりました。スムーズなリード(OR)は、ロボットが家から遠くへ走り去るのを止めることはできませんでした。それは単に、ロボットが「安全圏」に達したときの反応を変えただけなのです。この論文は、このスムーズな飽和(saturation)が、ロボットを家に留めておく厳格な「信頼領域」として機能するという考えを明確に否定しています。ロボットは依然として迷走しており、新しい手法は、そこに至ったときにどのように改善しようとする動きを止めるかという「計算」を変えただけでした。

これが将来にとって何を意味するか

著者らは、これを完全な勝利とは呼んでいません。彼らは、「スムーズなリード(出力リセット)」はロボットの学習方法を変えるものの、グループ相対手法における最大の課題、すなわち「元のポリシーから遠く離れてしまう傾向」を解決するものではないことを見出しました。

古典的なPPOの設定では、スムーズな手法は多少の不安定さを伴いつつも、ロボットにより高いスコアをもたらしました。より新しいグループ相対の設定では、トレーニングをより一貫したものにしましたが、最終的なスコアを向上させたり、ロボットの逸脱を止めたりすることはありませんでした。この論文は、単に数学的な処理を滑らかにするだけでは「ドリフト」の問題を解決するには不十分であり、ロボットが走り去るのを防ぐためには、より大きな比較グループや異なる安全ルールが必要になる可能性を示唆しています。

結局のところ、この研究は、AIのトレーニングの世界において単一の「魔法の弾丸(特効薬)」は存在しないことを示しています。ある設定で素晴らしく機能するテクニックが、別の設定では異なる挙動を示すことがあります。出力リセットによるスムーズで連続的なアプローチは、文脈に応じてより安定したり、より効果的になったりする、異なる種類の学習を提供しますが、それはこれら強力なモデルを制御するための普遍的な解決策ではありません。研究者たちは、彼らの新しい手法がトレーニングプロセスの振る舞いを変える一方で、より大きく複雑なAIシステムへと移行していく中で、これらの強力なモデルをいかにして最善に制御するかという問いは、依然として開かれたままであることを結論づけています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →