Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
原著者: Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術サマリー:Kandinsky 5.0 – 画像および動画生成のための基盤モデルファミリー
1. 問題定義
拡散モデルやフローマッチングアプローチによる画像生成の急速な進展にもかかわらず、動画生成は生成 AI における重要な課題のままです。主な障壁には、時間依存性の 3 次元動画データを処理する際の計算複雑性の指数関数的増大、時間的整合性と運動のリアリズムを維持する難しさ、ならびにトレーニングと推論の両方に対する複雑な多段階最適化の必要性が含まれます。Sora や Veo などのモデルは高品質を示していますが、研究コミュニティがアクセス可能な効率的で制御可能かつ高解像度の動画生成システムを構築することは、依然として大きな障壁です。Kandinsky 5.0 は、最先端(SOTA)のパフォーマンスと運用効率を備えた高解像度画像および 10 秒間の動画合成を可能にする基盤モデルファミリーを提供することで、これらの課題に対処することを目的としています。
2. 手法
2.1 データ処理パイプライン
トレーニングフレームワークは、収集、処理、フィルタリング、クラスタリングを含む包括的な多段階データキュレーションライフサイクルに依存しています。
- テキストから画像(T2I): 5 億枚以上の画像からなるデータセットは、厳格なフィルタリング(解像度、重複排除、透かし検出、TOPIQ および Q-Align による品質評価、テキスト/複雑さフィルタリング)と、マルチモーダルモデル(InternVL2、Qwen2.5VL)を用いた合成キャプション生成を経ます。
- テキストから動画(T2V): 2 億 5 千万以上の動画シーンは、構造的ダイナミクス、技術的/美的品質(DOVER、Q-Align)、およびコンテンツに対してセグメント化、重複排除、フィルタリングされます。合成キャプションは Tarsier2-7B を用いて生成されます。
- 画像編集(I2I): 特殊なパイプラインが、正確な指示を伴う約 1 億 5 千万の画像ペアを構築します。これには、類似性マッチング(CLIP、DINO、顔認識)、幾何学的検証(LoFTR、RANSAC)、および高忠実度の変換例を確保するための品質フィルタリングが含まれます。
- 文化および SFT データセット: 文化的特異性のためにロシア文化コード(RCC)データセットが手動でキュレーションされます。高品質の教師あり微調整(SFT)データセットは、専門家の手動選択とドメイン分類(動物、建築、芸術など 9 ドメイン)を通じて作成され、美的感覚と指示への追従を強化します。
2.2 アーキテクチャ:CrossDiT と NABLA
中核となるアーキテクチャは、フローマッチングパラダイムを用いてトレーニングされた統合された**クロスアテンション付き拡散トランスフォーマー(CrossDiT)**です。
- CrossDiT: 以前の MMDiT 様のアーキテクチャがトレーニングを遅くする連結操作を必要としたのに対し、CrossDiT はスパースアテンションとの互換性を高めるためにクロスアテンション機構を利用します。これは、テキストエンコーダー(Qwen2.5-VL)および視覚エンコーダー(画像用 FLUX.1-dev VAE、動画用 HunyuanVideo VAE)を統合します。
- NABLA(Neighborhood Adaptive Block-Level Attention): 高解像度(最大 1024px)および長時間(最大 10 秒)の動画生成を処理するために、著者は NABLA を導入します。このスパースアテンション機構は、ブロック単位次元削減と適応的スパース化(CDF 閾値処理)を通じてコンテンツ認識マスクを動的に構築します。これは標準的な空間時間アテンションの二次的な複雑さを削減し、動画品質を維持しながらトレーニングおよび推論を2.7 倍高速化します。
- トークン再順序付け: NABLA は、空間トークンをグループ化してメモリアクセスパターンを最適化するために、フラクタルフラッテンを採用します。
2.3 トレーニングパイプライン
トレーニングプロセスは多段階であり、異なるモデルサイズ(Image Lite、Video Lite、Video Pro)に合わせて調整されています。
- プレトレーニング: モデルは、低、中、高解像度にわたる大規模な T2I、T2V、および I2V データセットでプレトレーニングされます。動画モデルは、特定の確率分布を伴うタスクの混合(T2I、T2V、I2V)でトレーニングされます。
- 教師あり微調整(SFT): 「モデルスープ」技術が採用されます。データは主題ドメインとサブドメインにクラスタリングされます。各サブドメインで独立したフル微調整が行われ、結果として得られるチェックポイントは加重平均(等重みまたはルート比例重み)を通じて集約され、堅牢な最終モデルを作成します。これにより過学習が防止され、汎化性が向上します。
- 蒸留: 動画モデルについては、組み合わせたアプローチが使用されます。
- クラスターフリーガイダンス(CFG)蒸留: サンプリングステップを削減します。
- 軌道セグメント化整合性蒸留(TSCD): ステップをさらに 16 に削減します。
- 敵対的ポストトレーニング: 激しい蒸留中に失われた視覚的忠実度を回復させるために、ヒンジ損失と確率的摂動(再ノイズ)を備えた識別器(LADD に着想を得た)を使用した 2 段階の微調整を行います。
- RL ベースのポストトレーニング(画像のみ): 画像生成については、生成された画像を実際の SFT 画像と比較するようにトレーニングされた報酬モデル(Qwen 2.5VL ベース)が使用されます。その後、ジェネレーターは**直接報酬微調整(DRaFT-K)**を用いて微調整され、報酬モデルの好みを最大化しつつ SFT モデルからの KL 発散を最小化します。
2.4 最適化
- VAE 高速化: コードの書き換えと
torch.compileによる最適化された HunyuanVideo VAE エンコーダーにより、2.5 倍の高速化を実現しました。 - 推論最適化: 標準解像度には Flash/Sage Attention を、HD/長動画には NABLA を使用します。MagCache による拡散ステップのキャッシングにより 46% の高速化が得られます。
- メモリ管理: GPU メモリ消費を削減するために、HSDP(ハイブリッドシャーディングデータ並列)、シーケンス並列、およびホストオフローディングを備えたアクティベーションチェックポイントを実装しました。
3. 主要な貢献
- 包括的なデータパイプライン: T2I、T2V、I2V、および指示ベースの編集のためのデータキュレーションの詳細な記述。ロシアの文化的コンテンツおよび高品質 SFT データセットの特殊な処理を含みます。
- 多段階トレーニングフレームワーク: プレトレーニング、ドメイン固有の SFT(モデルスープを介して)、蒸留、および RL ベースのポストトレーニング(画像用)を包含する統合パイプラインにより、リアリズムと整合性を強化します。
- CrossDiT および NABLA アーキテクチャ: クロスアテンショントランスフォーマーバックボーンと、高解像度動画の二次的な複雑さを克服し、トレーニング/推論を 2.7 倍高速化する NABLA スパースアテンション機構の導入。
- 最適化技術: VAE 高速化、テキストエンコーダーの量子化、およびメモリ効率的なトレーニング戦略(HSDP、オフローディング)の実装により、コンシューマーおよびプロフェッショナルハードウェアでの高忠実度生成を可能にします。
- 蒸留戦略: 視覚的品質を維持しつつ関数評価数(NFE)を 100 から 16 に削減するための、CFG 蒸留、TSCD、および敵対的ポストトレーニングの新奇な組み合わせ。
- オープンソースリリース: Hugging Face および GitHub を通じて、すべてのモデル(Image Lite、Video Lite、Video Pro、およびそれらの Flash 変種)のコード、重み、トレーニングチェックポイントの完全なリリース。
4. 結果
- 人間による評価: MovieGen ベンチマーク(1,000 以上のプロンプト)で約 20 人のトレーニング済み注釈者による広範なサイドバイサイド(SBS)評価が実施されました。
- Video Lite vs Sora/Wan: Kandinsky 5.0 Video Lite は、Sora および Wan モデルと比較して視覚的品質と運動ダイナミクスで優れていましたが、Wan モデルはプロンプト追従(意味的整合性)においてより強力でした。
- Video Lite vs Kandinsky 4.1: 運動ダイナミクス、オブジェクトのリアリズム、アーティファクトの抑制において大幅な改善が観察されました。
- Video Pro vs Veo 3/Wan 2.2: Kandinsky 5.0 Video Pro は、Veo 3 および Wan 2.2 A14B と比較して視覚的品質と運動ダイナミクスでより高いスコアを達成しましたが、プロンプト追従においては Veo 3 変種が上回りました。
- Image Lite: 視覚的品質において FLUX.1 および Qwen-Image を上回り、プロンプト追従においても競争力がありました。
- パフォーマンス指標:
- 速度: 蒸留された「Flash」モデルは生成時間を大幅に短縮します(例:H100 上の Video Lite 10 秒生成は約 224 秒から約 61 秒に低下)。
- 品質: 定量的指標(FVD、VBench、CLIP スコア)および人間による評価は、多段階トレーニングおよび NABLA メカニズムが計算の削減にもかかわらず高品質を維持することを確認しています。
5. 意義と主張
本論文は、Kandinsky 5.0 をオープンソース生成 AIにおける重要なマイルストーンとして位置づけ、画像および動画のための高品質基盤モデルへのアクセスを民主化することを目的としています。
- アクセシビリティ: 異なるパラメータ数(2B、6B、19B)および蒸留された「Flash」変種をリリースすることで、このフレームワークは異なるハードウェア制約での展開を可能にします。
- 技術的進歩: フローマッチング、CrossDiT、および NABLA の統合は、動画生成に内在するスケーラビリティおよび効率性のボトルネックに対処し、プロプライエタリなクローズドソースシステムに対する実用的な代替案を提供します。
- コミュニティへの影響: 著者は、オープンソースコード、トレーニングチェックポイント、詳細な技術報告書のリリースが、研究コミュニティにおける高品質生成モデルの開発とアクセシビリティを大幅に進展させることを期待しています。
- 倫理的立場: このモデルは、イノベーションを促進するために組み込みのコンテンツフィルタリングなしで MIT ライセンスの下でリリースされ、倫理的利用と責任の所在はエンドユーザーに委ねられています。著者はトレーニングデータに内在するバイアスを認識しており、ステレオタイプを緩和するための具体的なプロンプティングを推奨しています。
本報告書は、Kandinsky 5.0 が視覚的品質と運動整合性において SOTA パフォーマンスを達成している一方で、エンコーダーのコンテキスト制限に起因するテキストと視覚の整合性、および複雑な長距離物理的相互作用のモデリングにおいて課題が残されており、これらが将来の作業の方向性として特定されていると結論付けています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。