Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging
Any-OPDは、凍結されたモデルに依存しない視覚表現と連続的なノイズレベルのマッチングを介して任意の潜在フローマッチングモデル間を橋渡しすることにより、従来の潜在回帰が失敗する場面において2.5Bの生徒モデルが12Bの教師モデルの性能に匹敵することを可能にする、異種間オンポリシー蒸留のための新しいフレームワークを導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
アーティストが筆ではなく、数学で絵を描く世界を想像してみてください。これはAI画像生成という領域であり、コンピュータが何百万もの例を学習することで、ゼロから画像を生成することを学ぶ分野です。これを行うために、現代のAIモデルは**フロー・マッチング(flow matching)**と呼ばれる巧妙なトリックを使用しています。それは、混沌としたノイズの滝(純粋な静止画)から、穏やかで澄んだ湖(完璧な画像)へと流れる川のようなものです。AIは、その川の正確な経路を学習し、ノイズから美しい画像へと、あらゆる水滴を導くことができるようにします。
しかし、そこには落とし穴があります。最も強力なAIアーティストは、巨大で動きの遅いゾウのようなものです。彼らは極めて巨大であり、実行にはスーパーコンピュータを必要とし、たった一枚の画像を生成するのにも膨大な時間がかかります。私たちは、俊敏なリスのようなスピードと効率性を求めつつ、同時にゾウのような芸術的天才をも手にしたいと考えています。その解決策が**蒸留(distillation)**です。つまり、小さくて速い「生徒モデル」に、大きくて遅い「教師モデル」を模倣させる方法です。しかし、問題があります。通常、教師と生徒は全く同じ言語を話し、同じ内部マップを使用し、同じ時計に従わなければなりません。もし彼らが異なるAIの「家族」であれば、まるで異なる方言を話していたり、異なるタイムゾーンに住んでいたりするようなものです。これまで、設計図(ブループリント)が全く異なる場合、リスにゾウのなり方を教えることは不可能だとされてきました。
本論文では、万能な翻訳機であり、時間を操るコーチとしても機能する新しい手法、Any-OPDを紹介します。研究者たちは、教師と生徒が同じ内部マップや時計を共有する必要はないことを発見しました。彼らの秘密の内部メモを直接比較させようとする(それは相手にとって意味不明な記号になります)代わりに、Any-OPDは、画像の「意味」を理解する第三者の「美術批評家」(DINOv2と呼ばれる凍結されたビジョンモデル)を用いて、最終的に作成された画像を比較させます。
チームは、この手法を検証するために、わずか25億パラメータを持つ小さな生徒モデル(SD3.5-Medium)を取り上げ、120億パラメータを持つ巨大な教師(FLUX.1-dev)に模倣させる実験を行いました。これら二つのモデルは完全に異なります。内部構造も、ノイズの扱い方も、スケジュールの組み方も異なります。標準的な手法では、彼らの内部データを直接比較しようと試みましたが、それは学習がぼやけた情報の塊へと崩壊する原因となりました。しかし、Any-OPDは、両者を共通の「意味空間」の中で最終的な画像のみを比較することで、この問題を回避しました。
結果は驚くべきものでした。Any-PODで訓練された小さな生徒モデルは、単に少し向上しただけでなく、熟練した芸術家となりました。人間が好む画像を生成する能力(PickScoreと呼ばれるスコアで測定)において、0.846から0.884へと向上し、人間の好みのスコア(HPSv3)は9.12から10.97へと跳ね上がりました。事実、この小さな生徒は、自身の巨大な120億パラメータの教師に匹敵し、場合によってはそれを凌駕するほどのパフォーマンスを見せ始めました。しかも、そのサイズとコストはごくわずかです。
本論文は、モデルが異なる場合に、生の内部データ(潜在変数/latents)や画像のピクセル単位の詳細を単純に比較することはできないという考えを明確に否定しています。彼らは、異なるモデルファミリー間で直接的な「ピクセル回帰」を行おうとすると、学習が完全に失敗することを示しました。その代わりに、まず生徒をアンカー(固定)し、次にノイズレベルのマッチングシステムを使用してステップを時間軸上で整合させることで、モデルがいかに異なっていても、知識を正常に転送できることを証明しました。これは、将来、私たちはただ一つの巨大なAIに縛られることはないことを示唆しています。利用可能な最高の教師が誰によって作られたものであれ、それを利用して、私たちがデプロイ(展開)したいあらゆる小さなモデルに、同等の能力を持たせることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。