Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
Auteurs originaux : Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé Technique : Kandinsky 5.0 – Une Famille de Modèles de Base pour la Génération d'Images et de Vidéos
1. Énoncé du Problème
Malgré les avancées rapides des modèles de diffusion et des approches d'appariement de flux pour la génération d'images, la génération vidéo reste un défi critique en IA générative. Les principaux obstacles incluent la croissance exponentielle de la complexité computationnelle lors du traitement de données vidéo 3D dépendantes du temps, les difficultés à maintenir la cohérence temporelle et le réalisme du mouvement, ainsi que la nécessité d'optimisations complexes et multi-étapes pour l'entraînement et l'inférence. Bien que des modèles comme Sora et Veo aient démontré une haute qualité, la création de systèmes de génération vidéo efficaces, contrôlables et haute résolution accessibles à la communauté de recherche demeure un obstacle majeur. Kandinsky 5.0 vise à relever ces défis en fournissant une famille de modèles de base capables de synthétiser des images haute résolution et des vidéos de 10 secondes avec des performances de pointe (SOTA) et une efficacité opérationnelle.
2. Méthodologie
2.1 Pipeline de Traitement des Données
Le cadre d'entraînement repose sur un cycle de vie complet de curation des données en plusieurs étapes, impliquant la collecte, le traitement, le filtrage et le regroupement :
- Texte vers Image (T2I) : Un jeu de données de plus de 500 millions d'images subit un filtrage rigoureux (résolution, déduplication, détection de filigranes, évaluation de la qualité via TOPIQ et Q-Align, filtrage texte/complexité) et une génération de légendes synthétiques à l'aide de modèles multimodaux (InternVL2, Qwen2.5VL).
- Texte vers Vidéo (T2V) : Plus de 250 millions de scènes vidéo sont segmentées, dédupliquées et filtrées selon les dynamiques structurelles, la qualité technique/esthétique (DOVER, Q-Align) et le contenu. Des légendes synthétiques sont générées à l'aide de Tarsier2-7B.
- Édition d'Images (I2I) : Un pipeline spécialisé construit environ 150 millions de paires d'images avec des instructions précises. Cela implique un appariement de similarité (CLIP, DINO, reconnaissance faciale), une vérification géométrique (LoFTR, RANSAC) et un filtrage de qualité pour garantir des exemples de transformation haute fidélité.
- Jeu de Données Culturel et SFT : Un jeu de données du Code Culturel Russe (RCC) est curé manuellement pour la spécificité culturelle. Un jeu de données de Finetuning Supervisé (SFT) de haute qualité est créé par sélection manuelle d'experts et classification par domaine (9 domaines : animaux, architecture, art, etc.) pour améliorer l'esthétique et le suivi des instructions.
2.2 Architecture : CrossDiT et NABLA
L'architecture de base est un Transformateur de Diffusion avec Attention Croisée (CrossDiT) unifié, entraîné selon le paradigme de l'appariement de flux (Flow Matching).
- CrossDiT : Contrairement aux architectures précédentes de type MMDiT qui nécessitaient des opérations de concaténation ralentissant l'entraînement, CrossDiT utilise un mécanisme d'attention croisée pour une meilleure compatibilité avec l'attention parcimonieuse. Il intègre des encodeurs de texte (Qwen2.5-VL) et des encodeurs visuels (VAE FLUX.1-dev pour les images, VAE HunyuanVideo pour la vidéo).
- NABLA (Neighborhood Adaptive Block-Level Attention) : Pour gérer la génération vidéo haute résolution (jusqu'à 1024 px) et longue durée (jusqu'à 10 s), les auteurs introduisent NABLA. Ce mécanisme d'attention parcimonieuse construit dynamiquement des masques conscients du contenu via une réduction de dimensionnalité par blocs et une sparsification adaptative (seuillage CDF). Il réduit la complexité quadratique de l'attention spatio-temporelle standard, permettant une accélération de 2,7× lors de l'entraînement et de l'inférence tout en maintenant la qualité vidéo.
- Réordonnancement des Tokens : NABLA utilise un aplatissement fractal pour regrouper les tokens spatiaux, optimisant les modèles d'accès mémoire.
2.3 Pipeline d'Entraînement
Le processus d'entraînement est multi-étapes et adapté à différentes tailles de modèles (Image Lite, Video Lite, Video Pro) :
- Pré-entraînement : Les modèles sont pré-entraînés sur de grands jeux de données T2I, T2V et I2V à basse, moyenne et haute résolution. Les modèles vidéo sont entraînés sur un mélange de tâches (T2I, T2V, I2V) avec des distributions de probabilité spécifiques.
- Finetuning Supervisé (SFT) : Une technique de « model souping » est employée. Les données sont regroupées en domaines thématiques et sous-domaines. Un finetuning complet indépendant est effectué sur chaque sous-domaine, et les checkpoints résultants sont agrégés par moyenne pondérée (poids égaux ou proportionnels à la racine) pour créer un modèle final robuste. Cela évite le surapprentissage et améliore la généralisation.
- Distillation : Pour les modèles vidéo, une approche combinée est utilisée :
- Distillation par Guidage Sans Classificateur (CFG) : Réduit les étapes d'échantillonnage.
- Distillation de Cohérence par Segmentation de Trajectoire (TSCD) : Réduit davantage les étapes à 16.
- Post-entraînement Adversarial : Un raffinement de deuxième étape utilisant un discriminateur (inspiré de LADD) avec une perte Hinge et une perturbation stochastique (re-bruitage) pour restaurer la fidélité visuelle perdue lors d'une distillation agressive.
- Post-entraînement basé sur RL (Images uniquement) : Pour la génération d'images, un modèle de récompense (basé sur Qwen 2.5VL) est entraîné pour comparer les images générées aux images SFT réelles. Le générateur est ensuite affiné en utilisant le Direct Reward Fine-Tuning (DRaFT-K), maximisant la préférence du modèle de récompense tout en minimisant la divergence KL par rapport au modèle SFT.
2.4 Optimisations
- Accélération VAE : Encodeur VAE HunyuanVideo optimisé avec refactoring de code et
torch.compile, offrant une accélération de 2,5×. - Optimisation de l'Inférence : Utilisation de Flash/Sage Attention pour les résolutions standard et de NABLA pour les vidéos HD/longues. La mise en cache des étapes de diffusion via MagCache offre une accélération de 46 %.
- Gestion de la Mémoire : Mise en œuvre de HSDP (Hybrid Sharded Data Parallel), de la parallélisation de séquence et de la vérification d'activation avec déchargement vers l'hôte pour réduire la consommation de mémoire GPU.
3. Contributions Clés
- Pipeline de Données Complet : Une description détaillée de la curation des données pour T2I, T2V, I2V et l'édition basée sur des instructions, incluant un traitement spécialisé pour le contenu culturel russe et des jeux de données SFT de haute qualité.
- Cadre d'Entraînement Multi-étapes : Un pipeline unifié englobant le pré-entraînement, le SFT spécifique au domaine (via model souping), la distillation et le post-entraînement basé sur RL (pour les images) afin d'améliorer le réalisme et l'alignement.
- Architecture CrossDiT et NABLA : Introduction d'un backbone transformateur à attention croisée et du mécanisme d'attention parcimonieuse NABLA, qui surmonte la complexité quadratique pour la vidéo haute résolution, permettant un entraînement/inférence 2,7 fois plus rapide.
- Techniques d'Optimisation : Mise en œuvre de l'accélération VAE, de la quantification des encodeurs de texte et de stratégies d'entraînement économes en mémoire (HSDP, déchargement) pour permettre une génération haute fidélité sur du matériel grand public et professionnel.
- Stratégie de Distillation : Une combinaison novatrice de distillation CFG, TSCD et de post-entraînement adversarial pour réduire les Évaluations de Fonction (NFE) de 100 à 16 tout en préservant la qualité visuelle.
- Publication Open-Source : Publication complète du code, des poids et des checkpoints d'entraînement pour tous les modèles (Image Lite, Video Lite, Video Pro et leurs variantes Flash) via Hugging Face et GitHub.
4. Résultats
- Évaluation Humaine : Des évaluations extensives côte à côte (SBS) ont été menées sur le benchmark MovieGen (plus de 1 000 prompts) avec environ 20 annotateurs formés.
- Video Lite vs Sora/Wan : Kandinsky 5.0 Video Lite a démontré une Qualité Visuelle et une Dynamique du Mouvement supérieures aux modèles Sora et Wan, bien que les modèles Wan aient montré un meilleur Suivi des Prompts (alignement sémantique).
- Video Lite vs Kandinsky 4.1 : Des améliorations significatives ont été observées dans la dynamique du mouvement, le réalisme des objets et la suppression des artefacts.
- Video Pro vs Veo 3/Wan 2.2 : Kandinsky 5.0 Video Pro a obtenu des scores plus élevés en Qualité Visuelle et Dynamique du Mouvement par rapport à Veo 3 et Wan 2.2 A14B, bien que les variantes Veo 3 aient surpassé en Suivi des Prompts.
- Image Lite : A surpassé FLUX.1 et Qwen-Image en Qualité Visuelle tout en restant compétitif en Suivi des Prompts.
- Métriques de Performance :
- Vitesse : Les modèles « Flash » distillés réduisent considérablement le temps de génération (par exemple, la génération de 10 s par Video Lite passe d'environ 224 s à environ 61 s sur un H100).
- Qualité : Les métriques quantitatives (FVD, VBench, CLIP-score) et les évaluations humaines confirment que l'entraînement multi-étapes et le mécanisme NABLA maintiennent une haute qualité malgré les réductions computationnelles.
5. Importance et Revendications
L'article positionne Kandinsky 5.0 comme une étape importante dans l'IA générative open-source, visant à démocratiser l'accès aux modèles de base de haute qualité pour les images et les vidéos.
- Accessibilité : En publiant des modèles avec différents nombres de paramètres (2B, 6B, 19B) et des variantes « Flash » distillées, le cadre permet un déploiement sur différentes contraintes matérielles.
- Avancement Technique : L'intégration de l'appariement de flux, de CrossDiT et de NABLA répond aux goulots d'étranglement de l'évolutivité et de l'efficacité inhérents à la génération vidéo, offrant une alternative viable aux systèmes propriétaires fermés.
- Impact sur la Communauté : Les auteurs espèrent que la publication du code open-source, des checkpoints d'entraînement et d'un rapport technique détaillé fera progresser substantiellement le développement et l'accessibilité des modèles génératifs de haute qualité pour la communauté de recherche.
- Position Éthique : Le modèle est publié sous licence MIT sans filtrage de contenu intégré pour favoriser l'innovation, plaçant la responsabilité de l'utilisation éthique et de la responsabilité sur l'utilisateur final. Les auteurs reconnaissent les biais inhérents aux données d'entraînement et encouragent des prompts spécifiques pour atténuer les stéréotypes.
Le rapport conclut que si Kandinsky 5.0 atteint des performances SOTA en matière de qualité visuelle et de cohérence du mouvement, des défis subsistent dans l'alignement texte-visuel (en raison des limites du contexte de l'encodeur) et la modélisation d'interactions physiques complexes à longue portée, identifiés comme des axes de travail futurs.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.
Recevez les meilleurs articles machine learning chaque semaine.
Adopté par des chercheurs de Stanford, Cambridge et de l'Académie des sciences.
Vérifiez votre boîte mail pour confirmer votre inscription.
Quelque chose s'est mal passé. Réessayer ?
Pas de spam, désinscription à tout moment.