← 最新の論文
🤖 AI

MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture

本論文は、学習時とテスト時の条件をより良く一致させるための「低速化された補間混合(slowed interpolation mixture)」戦略を活用することで、拡散モデルにおける露呈バイアス(exposure bias)を緩和する新しい学習手法であるMixFlowを提案し、それによってImageNetにおいて最先端の画像生成結果を実現する。

原著者: Hui Li, Fu-Yun Wang, Haoyuan Xia, Jiayue Lyu, Kaihui Cheng, Siyu Zhu, Jingdong Wang

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Hui Li, Fu-Yun Wang, Haoyuan Xia, Jiayue Lyu, Kaihui Cheng, Siyu Zhu, Jingdong Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがロボットに、ノブをゆっくり回して静止画のノイズ(砂嵐)を鮮明な画像へと変化させることで、絵を描く方法を教えているところを想像してください。これは、現代の「拡散(ディフューザー)」モデルが機能する仕組みです。これらは、写真を観察し、そこにノイズを加え、そして元の画像に戻るために、そのノイズをどのようにステップバイステップで取り除くかを学習することで機能します。

ここで問題が発生します。学習時(学習フェーズ)において、ロボットは少し「ズル」をしています。ロボットが次のステップを予測しようとするたびに、前のステップにおける「完璧な」バージョンのノイズが提示されるのです。これは、まるで生徒がテストを受けている最中に、自分で問題を書き込む前に、先生が前の問題の正解をささやいて教えてくれるようなものです。

しかし、テスト時(実際にロボットが新しい絵を描くとき)には、先生はささやきをやめます。ロボットは、次のステップを判断するために、自分自身の「前の予測」を使わなければなりません。もし早い段階で小さなミスをしてしまうと、そのミスはそのまま引き継がれ、次第に大きくなり、最終的に画像が奇妙になったり、ぼやけたりしてしまいます。これは「露出バイアス(exposure bias)」と呼ばれます。ロボットは学習中には完璧なデータに触れていますが、一人で作業するときには、乱れたデータに直面するのです。

「スローフロー(緩やかな流れ)」の発見

著者たちは、ロボットが絵を描いている様子を観察しているときに、奇妙なことが起きていることに気づきました。彼らは、ロボットがある特定の瞬間(これを「時刻T」と呼びます)にノイズの画像を生成しているとき、そのノイズの「完璧な」バージョン(本来ロボットが見るべきもの)は、実はプロセスにおける「より早い」時刻、つまり「より多くのノイズが含まれている」時刻のものであることを発見しました。

例えるなら、このようなものです。あなたがレースを走っていると想像してください。10秒経過した時点で振り返ってみると、あなたの「完璧な」位置は、実は8秒時点のものであったことに気づきます。あなたは、真実の進行よりも「遅れて」おり、停滞しているのです。ロボットの生成する経路は、真実の経路から遅れており、よりノイズの多い「遅れた」状態に陥っています。

MixFlowによる解決策

著者たちは、ロボットの走り方を後から修正しようとするのではなく(他の手法が試みてきたこと)、ロボットがレースを「どう学ぶか」を変えることにしました。彼らは、MixFlowと呼ばれる新しい学習手法を導入しました。

標準的な学習では、ロボットはまさに自分がいるはずの瞬間の、完璧なノイズだけを見ます。しかし、MixFlowでは、ロボットは「混合された」完璧なノイズを見るように訓練されます。現在の瞬間の完璧なノイズだけでなく、「遅れた」状態にある、よりノイズの多い過去の瞬間の完璧なノイズも見るのです。

比喩:
あなたが自転車の乗り方を練習していると想像してください。

  • 標準的な学習: あなたは完璧に平坦で滑らかな道でのみ練習します。そのため、現実の世界に出て、凸凹や風に遭遇したとき、準備ができていなかったために転倒してしまいます。
  • MixFlow学習: あなたは滑らかな道で練習しますが、同時に、後に感じるであろう「遅れ」を模した、少しデコボコした「遅い」バージョンの道でも練習します。これにより、学習中であっても、その「遅れている」感覚を扱えるようになります。

この「遅延を伴う補間混合(slowed interpolation mixture)」を用いて訓練することで、ロボットは、自分自身の予測が真実のデータよりも「遅れ」、かつノイズが多いという事実に対処できるようになります。これにより、自分の以前の予測に頼らざるを得なくなったとしても、混乱することがなくなります。

彼らが否定したもの

著者たちは、何がうまくいかないのかを慎重にテストしました。彼らは、学習データにランダムなノイズを加える「入力摂動(Input Perturbation)」という手法を試しました。これは、ミスをシミュレートするためにランダムなノイズを加えるものです。彼らは、もし「スローフロー」のパターンを理解せずに単にランダムなノイズを加えるだけでは、現実とは一致しない「速い(ノイズが少ない)」データを与えてしまったり、あるいは「遅すぎる」データを与えてしまったりする可能性があることを発見しました。彼らの実験によれば、無計画にノイズを加えることは多くの場合状況を悪化させますが、彼ら独自の「遅延させた」混合こそが鍵であるということが示されました。

また、彼らは描画プロセス(推論)の最中にステップを微調整することで問題を解決しようとする手法とも比較しました。そのような微調整も多少の効果はあるものの、それは「すでにドリフト(流されている)している車を操縦しようとする」ようなものであり、最初から「エンジン(学習)」を修理しておく方が優れていることがわかりました。

結果:どれほど確かなのか?

著者たちは単に推測したわけではありません。彼らは実際の画像データセットを用いて大規模な実験を行いました。

  • 証明: 彼らは、1,000種類のオブジェクトカテゴリを含む120万枚の画像を含むImageNetデータセットを使用し、いくつかのトップクラスの画像生成モデル(SiT、REPA、RAEなど)に対してMixFlowメソッドをテストしました。
  • 数値: 256 × 256 ピクセルの画像において、彼らのMixFlowモデルは、ガイダンスなしで1.43、ガイダンスありで1.10のスコアを達成しました。より大きな512 × 512 ピクセルの画像では、ガイダンスなしで1.55、ガイダンスありで1.10に達しました。
    • 注: この分野では、FIDスコアは低いほど優れています。これらの数値は極めて低く、生成された画像が本物の写真とほとんど区別がつかないことを意味しています。
  • テキストからの画像生成(Text-to-Image): 彼らはテキストからの画像生成モデル(SD 3.5)でもテストを行いました。「5枚のセイボリーピザ」や「時計の左側に鳥」といった複雑なシーンを描くよう指示されたとき、MixFlow版は標準版よりも指示をはるかに正確に守り、数や位置を正しく捉えることができました。

この論文は、このアプローチが重要な前進であることを示唆しています。なぜなら、エラーの蓄積という根本的な原因に直接対処しているからです。これは魔法のようなトリックではなく、より賢い練習方法なのです。ロボットに「遅れた」バージョンの真実を練習させることで、一人で画像を生成しなければならないとき、より堅牢(ロバスト)になれるのです。

要約すると、この論文は、学習のメニューに「遅延させた」データを含めるように変更することで、拡散モデルが自分の足に躓くのを防ぎ、よりスムーズにレースを走れるようになることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →