Towards General Preference Alignment: Diffusion Models at Nash Equilibrium
本論文は、従来のブラッドリー・テリーに基づく選好手法の限界を克服するために、モデル同士による自己対戦を促すことで拡散モデルが優れたテキストから画像への整合性を達成できるようにするゲーム理論的枠組みである、拡散ナッシュ選好最適化(Diff.-NPO)を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に才能のある芸術家(拡散モデル)がいると想像してください。この芸術家はあなたの説明に基づいて絵を描くことができます。しかし、この芸術家はインターネット全体で訓練されたため、熟練している一方で、そのスタイルが必ずしもあなたが好むものとは一致しない可能性があります。時には猫が犬のように見えたり、夕日がスープのように見えたりすることがあります。
これを修正するために、通常は芸術家に画像のペアを見せて教えます。「こちらの方があちらよりも好きだ」といった具合です。これを選好アライメントと呼びます。
旧来の方法:「採点者」の問題
現在のほとんどの手法(DPOなど)は、隠れた「採点者」(報酬モデル)がいると仮定して芸術家に教えようとします。画像 A が画像 B より優れており、画像 B が画像 C より優れているなら、画像 A は必ず画像 C より優れていると仮定するのです。
この論文は、この仮定が欠陥があると主張しています。人間の好みは乱雑であり、時には循環的であるからです。まるでジャンケンのようなものです:
- あなたはグーをパーより好むかもしれません。
- あなたはパーをチョキより好むかもしれません。
- しかし、あなたはチョキをグーより好むかもしれません。
旧来の手法は、これらの選択を直線的(A > B > C)に押し込もうとしますが、これでは実際の人間の好みの複雑さを捉えきれていません。また、コンピュータが推測しなければならない「採点者」に依存しており、これは不正確になり得ます。
新しき方法:「スパーリングパートナー」ゲーム(Diff.-NPO)
著者らは、Diff.-NPO(Diffusion Nash Preference Optimization)と呼ばれる新しい手法を提案しています。スコアを推測する代わりに、トレーニングプロセスを芸術家の 2 つのバージョン間のゲームに変えるのです:
- 現在の芸術家:改善しようとしているモデルのバージョン。
- 過去の芸術家:前回のトレーニングステップからのモデルのバージョン(対戦相手として機能)。
ゲームの仕組み:
現在の芸術家と過去の芸術家がボクシングリングにいると想像してください。両者は同じプロンプト(例:「猫を描いて」)を受け取ります。
- 両者が絵を描きます。
- 審判(選好チェッカー)が両方を見て、どちらが優れているか決定します。
- 現在の芸術家は、過去の芸術家の絵よりも審判に好まれる絵を作ることで、そのラウンドに勝とうとします。
- 重要なのは、現在の芸術家はゲームに勝つためにだけ変で無意味なものを描き始めないよう、全体的に上手に描く能力を忘れないようにしなければならない点です(元のトレーニングに近い状態を維持する)。
これはナッシュ均衡と呼ばれます。目標は、現在の芸術家がこれ以上戦略を変えても一貫して勝てないほど優れている点に到達することです。静的なスコアを満たそうとするのではなく、モデルが自分自身と戦って向上する「自己対戦」ループです。
「絶妙なバランス」
この論文は、ゲームの進め方を制御する特別な「つまみ」( という数学的な比率)を導入しています:
- つまみを一方に回す:芸術家は「過去の芸術家」を倒すことだけを試みます。これは純粋な自己対戦のようなものです。攻撃的で学習が速いですが、芸術家は軌道から外れ、普通のものを描く方法を忘れる可能性があります。
- つまみをもう一方に回す:芸術家は「参照芸術家」(固定された元のバージョン)を倒すことだけを試みます。これは安全で安定していますが、目標が難しすぎたり厳しすぎたりするため、芸術家は行き詰まり、あまり改善しない可能性があります。
- 絶妙なバランス:Diff.-NPO は完璧な中間地点を見つけます。改善を促すために過去の芸術家を使用し(オンライン学習)、モデルを地に足着かせ安定させるために参照芸術家を使用します。
試した結果はどうだったか?
研究者らは、人間の選好に関する大規模なデータセットPick-a-Picを使用して、人気のある画像生成器(Stable Diffusion 1.5 および SDXL)でこれをテストしました。
- 結果:Diff.-NPO は旧来の手法を一貫して凌駕しました。
- 証拠:新しいモデルと旧モデルを「対決」させたところ、Diff.-NPO モデルの方が頻繁に勝利しました。人間(および自動ジャッジ)がより好む画像を生成しました。
- 視覚的品質:並べて比較すると、Diff.-NPO による画像はよりリアルで、プロンプトに忠実であり、旧来の手法で作られた画像よりも一貫性がありました。
まとめ
簡単に言えば、この論文はこう述べています。「人間の好みを完璧なスコアで計算しようとするのをやめなさい。なぜなら人間の好みはそれには複雑すぎるからだ。代わりに、AI が狂わないようにセーフティネットを備え、過去の自分自身とゲームをさせなさい。この『スパーリング』アプローチにより、より良く、よりアライメントされた芸術家が生まれる。」
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。