TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching
本論文は、標準的なシーケンスレベルの比較からトークンレベルのブラッドリー・テリー選好モデルを導出することにより、Direct Preference Optimization (DPO) の単純性を維持しつつ、アライメントの質、訓練の安定性、および出力の多様性を向上させる新規手法であるトークンレベル・ブレグマン選好最適化 (TBPO) を紹介する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに物語を書かせることを想像してみてください。同じ物語の2つのバージョンを見せます。1 つは「勝者」(優れていて、有益で、安全)で、もう 1 つは「敗者」(劣っていて、非力か、危険)です。あなたの目標は、ロボットが「勝者」バージョンを書けるように調整することです。
長らく、これを行う標準的な方法(DPOと呼ばれます)は、物語全体を一度に評価するようなものでした。「この物語全体は素晴らしい、あの物語全体は悪い」と言うのです。ロボットはその後、物語全体を良くするために脳を調整しようとします。
問題点:
この論文は、これをマラソンランナーの足取りを見ずに着順だけで判断するようなものだと主張しています。言語モデルは一度に物語全体を書くのではなく、1 語ずつ書きます。彼らが選ぶすべての単語は、その前の内容に基づいた小さな決定です。ロボットが最初の単語で小さな間違いを犯せば、たとえ「物語全体」の評価が最終的に向上したとしても、物語全体が軌道から外れてしまう可能性があります。
既存の「トークンレベル」の手法は、物語を分解することでこれを修正しようとしましたが、それらは本質的に「物語全体」の評価を単語に分散させているだけであり、ロボットに各ステップで正しい選択をすることを教えているわけではありませんでした。
解決策:TokenRatio (TBPO)
著者らは、Token-level Bregman Preference Optimization (TBPO) という新しい手法を提案しています。彼らは以下の単純なアナロジーを用いてこれを説明しています。
1. 「GPS のターンバイターン」のアナロジー
ニューヨークからロサンゼルスへ車を運転していると想像してください。
- 旧手法(シーケンスレベル): 最終目的地を見ます。ロサンゼルスに到着すればゴールドスターがもらえます。カナダに着いてしまえば赤信号です。ゴールドスターを得るために運転を調整しようとしますが、どの曲がり角が間違いだったのかは正確にはわかりません。
- TBPO 手法(トークンレベル): この手法は、ターンバイターンでスコアを与える GPS のように機能します。すべての交差点(すべての単語)で、「良い物語につながる道を選んだのか、それとも悪い道を選んだのか?」と問いかけます。最終結果が良いことを願うのではなく、すべてのステップで完璧な選択をするようにロボットに教えます。
2. 「2 つの異なる道」の問題
ここで、この論文が解決する難しい部分があります。「勝者」の物語と「敗者」の物語を比較すると、それらは非常に早い段階で異なることがよくあります。
- シナリオ: 勝者の物語が「The cat sat...(猫が座った...)」で始まり、敗者の物語が「The dog ran...(犬が走った...)」で始まると想像してください。
- 問題点: 次の単語だけを比較すれば、単語そのものを比較しているのではなく、完全に異なる出発点を比較していることになります。山の上からスタートしたランナーと、山の下からスタートしたランナーを比較するようなものです。山の上にいる方が不公平な有利さを持っています。
- 解決策: 論文は「補正係数」(ベースラインと呼ばれます)を導入します。
- TBPO-Q: このバージョンは、出発点(プレフィックス)がどれほど「良い」かを推定する小型で軽量な「計算機」を構築します。その有利さを差し引くことで、履歴全体ではなく次の単語だけを評価するようにします。
- TBPO-A: このバージョンは同じ数学を行いますが、別のトリック(「アドバンテージ正規化」と呼ばれるもの)を使用して、別個の計算機を必要とせずに出発点の差異を相殺します。
3. 「密度比」の魔法
この論文は、Density Ratio Matching(具体的には Bregman 発散と呼ばれるものを使用)という高度な数学的概念を使用しています。
- 単純なアナロジー: 良い単語(赤いビー玉)と悪い単語(青いビー玉)が入った袋を持っていると想像してください。ロボットに赤いビー玉を選ばせたいのです。
- 単に数を数えるのではなく、この論文の手法は、「良い」物語と「悪い」物語における赤と青のビー玉の比率を見ます。ロボット内部の比率を「良い」比率に完全に一致させようとします。
- これを単語レベルで行うことで、ロボットは最終結果だけでなく、すべての瞬間で最適な「方策(ルールセット)」を学習します。
彼らは何を見つけましたか?
著者らは、この新しい手法を Mistral や Llama 3 といった 2 つの人気の AI モデルで、多くの異なるタスクにわたってテストしました。
- より賢い推論: モデルは数学や論理パズル(GSM8K や MMLU など)において向上しました。
- より良いアライメント: 彼らはより有益になり、有害なことを言う可能性が低くなりました。
- より多様性: AI 訓練における一般的な問題として、モデルが飽きられ、壊れたレコードのように反復的になることがあります。TBPO はモデルを多様で創造的に保ちましたが、他の手法はそれらをよりロボットのようにしました。
- 効率性: 彼らは複雑で高価な強化学習ループを必要とせずに、これらの結果を達成しました。標準的な手法に対する「プラグアンドプレイ」型の改善でした。
要約すると:
この論文は、「一度に Essay 全体を採点するのをやめよ。一部の物語が最初から有利なスタートを切っているという事実を補正しながら、AI にすべての単語に対して正しい選択をさせよ」と述べています。その結果、より賢く、より有益で、より反復的ではない AI が生まれます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。