UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective
本論文は、様々な離散拡散目的関数間の接続を確立することで、学習済み自己回帰モデルの一様ノイズ拡散への直接的な適応を可能にする統一フレームワークであるUNIFUSIONを提案しており、生成品質とダウンストリームタスク精度の両方において最先端の性能を実現している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに物語の書き方を教えようとしている場面を想像してみてください。長い間、その最善の方法は、人間が文章をタイピングするように、左から右へと一単語ずつ書いていく方法でした。この方法は「自己回帰的(オートレグレッシブ)」学習と呼ばれ、非常に高速で、ロボットが多くの言語規則を学習できるという優れた点があります。しかし、これには大きな欠点があります。一度ロボットが単語を書くと、二度とそれを書き直すことができないのです。もし最初の文で間違いを犯してしまったら、過去を編集することができないため、物語全体が台無しになってしまう可能性があります。
最近、科学者たちは異なるアプローチである「離散拡散(ディスクリート・ディフュージョン)」を試みました。これは、単語を一つずつ書いていくのではなく、バラバラにされたり「ノイズ」で汚されたりした完全な文章からスタートし、ロボットがその文章を「掃除」して、完璧な文章になるまで一つずつ単語を修正していく方法です。これは、散らかった部屋を少しずつ整理していく作業に似ています。問題は、これらの新しい「お掃除ロボット」の多くがゼロから訓練されているため、従来の「一単語ずつ」のロボットがすでに持っていた言語知識をすべて無駄にしてしまうことです。さらに、多くの新しいロボットは、単語を「マスク(黒い箱)」で隠してしまう特定の種類のノイズを使用しています。つまり、ロボットは隠された部分を修正することはできますが、既に見えている単語を修正することはできないのです。ここで大きな疑問が生じました。「賢い『一単語ずつ』のロボットを連れてきて、即座に強力な『お掃除』ロボットに変えることはできるのか? ただし、隠されていない単語であっても修正できるような、そんなロボットに。 」
「Unifusion」と題されたこの論文は、答えは「イエス」であり、その方法も示しています。研究者たちは、さまざまな「お掃除」ロボットが使用する数学的な公式が異なっていても、それらはすべて、実は同じ根本的な問題、つまり「単語がどのくらいの速さで一つの状態から別の状態へ変化すべきか」を予測しようとしているのだということを発見しました。彼らはこれを「逆レート(reverse rate)」と呼んでいます。これらの異なる手法が、実は同じ言語の異なる方言を話しているだけであると気づいたことで、彼らは「ユニバーサル翻訳機」を作り上げました。この翻訳機によって、標準的な「一単語ずつ」のモデル(GPT-2など)から、直接「一様ノイズ(uniform-noise)」拡散モデルへと適応させることが可能になったのです。
この主要な革新は、Unifusionが単語をマスクで隠す必要がないという点です。その代わりに、文章内のあらゆる単語を、Googleドキュメントで編集できるように「編集可能なもの」として扱います。研究者たちは、1億2400万個のパラメータを持つバージョンと、3億5500万個のパラメータを持つバージョンの2種類の事前学習済みモデルを用いて、これらを「お掃除アーティスト」として訓練することでテストを行いました。その結果、モデルに考える時間を与えるほど(ステップ数を16から256へと増やすほど)、テキストの品質が着実に向上することを発見しました。
最大である256ステップにおいて、小型モデル(Unifusion-S)は「生成パープレキシティ」(モデルがテキストに対してどれほど混乱しているかを示す指標)で97.783を達成し、大型モデル(Unifusion-M)は71.516に達しました。より重要なことに、これらのモデルは流暢なテキストを書くだけでなく、高い「ユニグラム・エントロピー」(テキストが多様であり、同じフレーズやパターンを繰り返すことがないことを示す高度な指標)も維持していました。実際、256ステップにおいて、同等のサイズでテストされた他のどのモデルも、流暢さと多様性の両方においてUnifusionを超えることはできませんでした。
また、この論文は、直接的な変換が、「一単語ずつ」から「マスク拡散」へ、そして「一様拡散」へと進む古い方法よりも優れていることを示しました。仲介役をスキップすることで、Unifusionはより効率的に高い品質に到達したのです。現実世界の論理パズルや常識問題(WinoGrandeやSIQAなど)でテストした際、これらの新しい拡散モデルは、同サイズの他のすべての拡散モデルを凌駕しました。これは、彼らが単にノイズを掃除することを学んだだけでなく、元の「一単語ずつ」のトレーニングによる賢い推論能力を実際に保持していたことを証明しています。
要するに、Unifusionは、食材を一つずつ調理することに慣れた熟練のシェフに、スープ全体の味を見ながら調整するという新しいテクニックを教えるようなものです。しかも、長年の料理経験を捨てることなく。その結果、Unifusionは、文章全体を一度に編集することを学ぶだけで、流暢かつ創造的に多様なテキストを生成できるモデルを実現したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。