← 最新の論文
🤖 machine learning

Normalized Rewards for Preference Optimization

本論文は、DPOやSimPOのような直接アライメントアルゴリズム(DAA)に対し、過剰最適化と尤度崩壊を軽減するための正規化ベースの正則化手法を提案しており、それがトークンレベルの確率分布を安定させることで、生成品質と一般的なベンチマーク性能を大幅に向上させることを実証している。

原著者: Shawn Im, Federico Danieli, Skyler Seto, Barry-John Theobald, Katherine Metcalf

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Shawn Im, Federico Danieli, Skyler Seto, Barry-John Theobald, Katherine Metcalf

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に才能はあるが少し混沌としたロボットに物語の書き方を教えていると想像してください。あなたは、単にあなたのお気に入りの本を暗記させたいのではなく、なぜそれらが好きなのかという「理由」を理解させ、新しい物語を書いたときにも同じような良さを感じられるようにしたいと考えています。これが、人工知能における「アライメント(整列)」の世界です。科学者たちは、「好みの最適化(preference optimization)」と呼ばれるプロセスを用いて、このロボットを教育します。彼らはロボットに対し、ある質問に対する2つの異なる回答——一方は「良い回答」、もう一方は「悪い回答」——を見せ、どちらが良い方を選ぶべきかを学習させます。最も一般的な方法は、ロボットが人間の好みにどれだけ近いかによってスコアを得る、「熱いか冷たいか(hot and cold)」ゲームのようなものです。

しかし、厄介な問題があります。時として、ロボットは人の期待に応えようとするあまり、熱くなりすぎてしまうことがあります。ロボットは、本来使うべき言葉の使い方が不自然になるような、奇妙な方法で内部的な「語彙」を変え始めてしまいます。これは、たとえ技術的に正解を出していたとしても、まるでAを取るために、周囲を困惑させるような奇妙で過度に複雑な方言を話し始めてしまった学生のようなものです。この論文は、なぜこのようなことが起こるのかを調査し、ロボットが本来の個性を失ったり、奇妙で有害な回答を作り出したりすることなく、役に立つ存在であり続けられるよう、ロボットを地に足つかせた状態に保つための新しいルールを提案しています。


ロボットの過剰な自信の問題

この論文は、直接的アライメント・アルゴリズム(DAA)と呼ばれる特定の種類のロボット訓練に焦点を当てています。最も有名なものはDPOです。DPOは、別途採点を行うレフェリーを必要とせずに、「この回答はあの回答よりも良かったよ」とロボットに教えるコーチのようなものだと考えてください。これは効率的で人気があります。しかし、著者らは奇妙なことに気づきました。ロボットが「過剰に最適化(over-optimized)」されていたのです。

あなたがコインを集めるビデオゲームをプレイしていると想像してください。ゲームは「もっとコインを集めろ!」と言います。すると、あなたはコインに夢中になりすぎて、壁や敵、そして本来進むべき道すら無視して、狂ったように走り回ります。最終的に、あなたは実際の世界の仕組みを忘れて、コインに集中しすぎたためにマップから落下してしまうかもしれません。ロボットの場合、それは「報酬(正しい回答を選んだ時のスコア)」を最大化することに集中しすぎた結果、確率に対する理解を歪めてしまいました。ロボットは、「良い」言葉が出る確率と「悪い」言葉が出る確率を同時に下げようとしていました。これは奇妙に聞こえますが、実際には、ロボットがこれまで見たこともないようなもの(時には危険であったり、意味不明であったりするもの)を言う可能性を高めてしまっていたのです。これは「尤度置換(likelihood displacement)」と呼ばれます。

解決策:「全確率」ルール

著者らは、シンプルですが強力な修正案として、**正規化された報酬(Normalized Rewards)**という新しいルールを提案しています。

これを理解するために、ピザを想像してみてください。ピザ全体は、ロボットが答えうる全回答の100%を表しています。通常の訓練では、ロボットは「良い」スライスと「悪い」スライスの両方が小さくなっていると判断するかもしれません。これは、未知のスライス(ロボットがまだ見ていない部分)が大きくなっていることを意味します。これは良くありません。なぜなら、ロボットがそれらの未知の奇妙なスライスを提供し始める可能性があるからです。

著者らは、訓練に「正則化項」を加えることを提案しています。これは、厳格なピザ職人が「おい、お前たちが話しているスライスの合計サイズ(良い回答と悪い回答)は、常に一定でなければならないぞ」と言うようなものです。もしロボットが「良い」スライスを小さくしようとしすぎたら、職者は全体のバランスを保つために、「悪い」スライスをもっと小さくするように強制します。これにより、ロボットが誤って未知の奇妙なスライスを膨張させてしまうのを防ぎます。

研究結果

研究者らは、この新しいルールを2種類の異なるロボットでテストしました。一つは参照ガイドを使用するタイプ(DPO)、もう一つは使用しないタイプ(SimPO)です。得られた発見は以下の通りです。

  1. 優れたバランス: 全体の確率をバランスよく保つことで、ロボットは一般的な賢さを失うことなく、より優れた「役に立つ」振る舞いができるようになりました。指示に従う能力を測定するAlpacaEval2というテストにおいて、Llama-3.1-8B-Instructモデルは、従来の方法と比較して、この新しいルールを使用した場合に20%以上の相対的なスコア向上を見せました。
  2. 汎用スキルの維持: 通常、ロボットは指示に従う能力が非常に高くなると、一般的な知識(数学や科学など)については性能が低下します。しかし、この新しいルールを用いると、ロボットはこれらの一般的なベンチマークにおいても、9%を超える性能向上を実現しました。
  3. 「アウトライヤー(外れ値)」という犯人: 著者らは、なぜ従来の方法が失敗していたのかを深く掘り下げました。その結果、問題はロボットの脳のあらゆる場所で起きているのではなく、ロボットがほとんど知らない、稀で奇妙なトークンである「アウトライヤー(外れ値)」の小さなグループに集中していることが分かりました。これら少数の単語が、確率をめちゃくちゃにする重労働を行っていたのです。新しいルールは、これらの低確率の単語をピンポイントで対象とし、システム全体を狂わせないよう、優しく正常な状態へと押し戻します。

結論

論文は、ロボットが「狂ってしまう」理由は、確率の計算を適切に保つように強制されていなかったためであると示唆しています。目の前にある回答の総尤度(全確率)を安定させるという単純なルールを加えることで、ロボットは自身の内部ロジックを壊すことなく、人間の好みに従う術を学ぶことができます。

著者らは、このアプローチが参照ガイドを使用するロボットと使用しないロボットの両方に有効であることを明らかにしました。この手法は、単に悪い振る舞いを止めるだけでなく、ロボットが現実世界のタスクにおいてより高いパフォーマンスを発揮する助けにもなることを示しました。彼らはこれがAIのあらゆる問題を解決すると主張しているわけではありませんが、彼らの実験は、「ピザのスライス」のバランスを保つことが、スマートで安全なAIを作るための極めて重要なステップであることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →