← 最新の論文
🤖 machine learning

Parallel Decoding Distillation for Fast Image and Video Generation

本論文は、1回のネットワーク評価につき複数のデノイジングステップを予測することで、画像および動画生成を加速させる、スケーラブルかつ簡略化された軌跡ベースの手法であるParallel Decoding Distillation(PDD)を提案するものであり、これは4〜8回の関数評価で最先端の性能を達成し、既存の蒸留技術と比較して動画の多様性を大幅に向上させている。

原著者: Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

公開日 2026-07-29
📖 1 分で読めます☕ さくっと読める

原著者: Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに傑作を描かせたり、映画を監督させたりする方法を教えようとしているところを想像してみてください。人工知能の世界では、これは「拡散(ディフュージョン)」や「フロー」モデルを用いて行われます。これらのモデルは、キャンバスが静止画のノイズ(テレビの砂嵐のようなもの)で覆われた状態からスタートし、一歩ずつ、一歩ずつ、それを浄化して、鮮明な画像やビデオが現れるまで整えていくアーティストだと考えてください。問題は、この浄化のプロセスが非常に遅いことです。高品質な結果を得るために、ロボットは何百もの微細なステップを踏み、その一つひとつで自分の作業を確認しなければならない場合があります。それは、1ミリメートルずつ歩を進めて部屋を横切ろうとするようなものです。目的地には着きますが、永遠に時間がかかってしまいます。

これを加速させるために、科学者たちはロボットに大きな跳躍をすることを教えようとしてきました。ある手法は、一度の巨大なジャンプで最終目的地を予測しようとし、またある手法は、ロボットが進むべき「経路」を学習させることで、退屈な中間部分をスキップしようとします。しかし、ビデオ生成における現在の最良の手法は扱いにくいものです。それらはしばしば、複雑で不安定な学習トリックに依存しており、それが原因でロボットが動き方を忘れてしまうことがあります。その結果、見た目は素晴らしいものの、時間が止まったように見えるビデオになったり、あるいは反復的で退屈なパターンに陥ったり(崩壊したり)します。大きな疑問は、「私たちは、創造性の魔法を失うことなく、モデルに速くスムーズに動くことを教えられるのか?」ということです。

この論文は、Parallel Decoding Distillation (PDD) と呼ばれる新しい技術を紹介しています。これは、これらのAIアーティストにとっての、非常に効率的なコーチのような役割を果たします。PDDは、ロボットに一歩ずつ進むことを強制するのではなく、一瞥するだけで一連のステップ全体を予測することを教えます。あなたが廊下を歩いているところを想像してください。通常のロボットは、次のドアへ進む前に、ドアが開いているかどうかを一つひとつのドアで確認して立ち止まります。しかし、PDDは廊下の先を見渡し、次の10歩で足の裏がどのように感じられるかを正確に予測し、その距離全体を一気に自信を持って踏み出します。

著者たちは、モデルに一定期間の「平均速度(または速度)」を一度に予測するように学習させることで、通常は何百ステップも必要とされるところを、わずか 4〜8ステップ(これをFunction Evaluations、またはNFEと呼びます)で高品質な画像やビデオを生成できることを見出しました。これは劇的なスピードアップです。以前の手法は、ロボットに厳格な経路に従わせようとしたり、モデルの多様性を損なう原因となる複雑な数学を用いたりしていましたが、PDDはよりシンプルで直接的なアプローチを採用しています。PDDは、複雑な微分を計算したり、二つのAIが互いに向上するために戦う「敵対的ゲーム(アドバーサリアル・ゲーム)」を使用したりする必要はありません。これらは「モード崩壊(mode collapse)」、つまりAIが同じものばかりを作り続けてしまう現象を引き起こすことが知られています。

この手法は、テキストからのビデオ生成やテキストからの画像生成を行う大規模モデルにおいて、極めて優れた成果を上げることが示されています。例えば、Wan2.1 ビデオモデルにおいて、PDDが生成した 4 NFE のビデオは、他のトップレベルの手法よりも高速であるだけでなく、より多様でダイナミックでした。10秒間のビデオとオーディオを生成する LTX-2.3 モデルを用いたテストでは、PDDは 4 × 30 NFE(合計120ステップ)を要するティーチャーモデルの品質に、わずか 8 NFE で匹ディップしました。これらの結果は、PDDが、ビデオに生命感を与える多様性と動きを犠牲にすることなく、AI生成を高速化するための堅牢な方法であることを示唆しています。これは、素晴らしい結果を得るために何百万もの小さなステップを踏む必要はなく、時には、前方の経路全体を見通す方法を学ぶだけでよいのだということを証明する、重要な一歩なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →