← 最新の論文
🤖 AI

Autoregressive Direct Preference Optimization

本論文は、Bradley-Terryモデルの前に自己回帰的な仮定を明示的に適用することでDPOの目的関数を再定式化し、その結果としてシフトした損失関数と、好みの最適化を向上させるための明確なトークン長およびフィードバック長の尺度を特定する、新たな変種であるAutoregressive Direct Preference Optimization (ADPO) を提案する。

原著者: Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

公開日 2026-06-11
📖 1 分で読めます☕ さくっと読める

原著者: Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

全体像:ロボットにより良い文章を書かせる方法

あなたがロボットに物語の書き方を教えていると想像してください。そこには「ゴールドスタンダード(基準となる本)」があり、学習対象である「生徒」ロボットがいます。あなたの目的は、生徒がゴールドスタンダードよりも人間にとって好ましい物語を書けるようにすることです。

長い間、このための最善の方法はDPO (Direct Preference Optimization) でした。DPOを、「生徒が書いた物語の全体を読み、それをゴールドスタンダードの物語と比較して、『良い』か『悪い』かの成績を一度だけつける教師」だと考えてみてください。

問題点:
この論文は、この「全か無か」の採点システムがいかに非効率であるかを指摘しています。大規模言語モデル(LLM)は、一つの巨大な跳躍で物語を書くのではなく、人が文章をタイピングするように、単語ごと(あるいはトークンごと)に物語を書いていきます。しかし、従来のDPO法は、フィードバックを与えるのを最後まで待ってしまいます。これは、コーチがランナーに「よく走れたよ」と伝えるために、マラソンが終わるまで待ち続け、走っている間のフォームについては一切修正を与えないようなものです。

解決策:ADPO (Autoregressive DPO)

著者らは、ADPOと呼ばれる新しい手法を提案しています。物語が終わるまで待ってから成績をつけるのではなく、ADPOは物語が書かれている最中に、ステップ・バイ・ステップでフィードバックを与えます。

「映画 vs スナップショット」の比喩

  • 旧DPO (スナップショット): 完成した絵画の写真を撮ることを想像してください。写真全体を見て、「これはあっちより良いね」と言います。しかし、どの筆致がそれを良くしたのかまでは分かりません。
  • 新ADPO (映画): アーティストがリアルタイムで絵を描いている様子を見ていることを想像してください。ADPOは、最初の筆致、次の筆致、その次の筆致を見ます。そして、「この特定の筆致は良かったか? 次のはもっと良かったか?」と問いかけます。ADPOは、最終的な結果だけでなく、書くという「プロセス」を好むように学習します。

2つの「長さ」のルール

この論文の最も興味深い発見の一つは、これらのモデルを教える際、実際には2つの異なる「長さ」の測定方法が存在し、従来の方法はそれらを混同していたということです。

  1. トークン長 (単語数): モデルが実際にタイピングする単語の数です。(例:「猫が座った」=3単語)。
  2. フィードバック長 (採点単位): 教師が一度にどれくらいの塊(チャンク)を採点するかです。

従来の方法: 教師は、物語がどれほど長くても、常に物語全体を一つの塊として採点していました(フィードバック長 = 1)。
新しい方法 (ADPO): 教師は物語を小さな塊に分割して採点することができます。単語ごとに採点することもできますし(フィードバック長 = 単語数)、10単語ごと、あるいは段落ごとに採点することも可能です。

論文では、物語をより小さな塊に分けることで(「フィードバック長」を「トークン長」に一致させることで)、モデルの学習が速まり、より優れた文章を書けるようになることを示しています。

仕組み(数式を簡単に)

従来の方法の計算は以下の通りでした:

物語全体を取り、差分を計算し、その後「シグモイド関数(平滑化関数)」を適用してスコアを出す。

新しいADPOの手法では、計算の順序が逆転します:

各ステップごとに差分を計算し、各ステップに「シグモイド関数」を適用し、それらすべてを足し合わせる。

比喩:

  • 従来の方法: ケーキの材料をすべて混ぜ合わせ、焼き上げ、全体を味わってから、砂糖が足りなかったかどうかを判断します。(生地の状態を直すには遅すぎます)。
  • 新しい方法: 小麦粉を入れた後、卵を入れた後、砂糖を入れた後に、それぞれ味見をします。工程を進めながらレシピを調整していくのです。

結果:効果はあるのか?

著者らは、この新手法を2種類のタスクでテストしました:

  1. 数学の問題: モデルに複雑な算数の文章題を解かせました。
  2. 会話: モデルに人間とチャットをさせました。

判明したこと:

  • より高い成績: ほとんどすべてのテストにおいて、ADPOで訓練されたモデルは、従来のDPOで訓練されたモデルよりも高いスコアを獲得しました。
  • 細かい方が良い: モデルは「フィードバック長」が非常に小さいとき(単語ごとにチェックしているとき)に最高のパフォーマンスを発揮しました。これは、モデルが絶え間なく、粒度の細かいフィードバックを受けることで恩恵を受けることを証明しています。
  • 追加コストなし: 単語ごとにチェックすることは時間がかかるように聞こえますが、著者らは必要な追加時間は無視できる程度(6%未満の低速化)であることを発見しました。

まとめ

この論文は、AIモデルを訓練するためのよりスマートな方法であるADPOを紹介しています。AIがタスクを完了するまで待ってから成績をつけるのではなく、ADPOはプロセスのあらゆるステップでフィードバックを与えます。AIの執筆を一つの大きなブロックとしてではなく、一連の小さなステップとして扱うことで、モデルは生成プロセス全体を通じてより良い選択ができるようになり、結果として、より高度な数学的推論やより優れた会話を実現します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →