← Derniers articles
🤖 machine learning

Parallel Decoding Distillation for Fast Image and Video Generation

Cet article présente la Décodage Parallèle par Distillation (PDD), une méthode basée sur les trajectoires, scalable et simplifiée, qui accélère la génération d'images et de vidéos en prédisant plusieurs étapes de débruitage par évaluation de réseau, atteignant des performances de pointe avec 4 à 8 évaluations de fonction tout en améliorant considérablement la diversité vidéo par rapport aux techniques de distillation existantes.

Auteurs originaux : Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

Publié 2026-07-29
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot à peindre un chef-d'œuvre ou à réaliser un film. Dans le monde de l'intelligence artificielle, cela se fait à l'aide de modèles de « diffusion » ou de « flux ». Considérez ces modèles comme des artistes qui commencent avec une toile recouverte de bruit statique — comme une télévision réglée sur une chaîne morte — et qui nettoient lentement, étape par étape, jusqu'à ce qu'une image ou une vidéo claire apparaisse. Le problème est que ce processus de nettoyage est incroyablement lent. Pour obtenir un résultat de haute qualité, le robot pourrait avoir besoin de faire des centaines de petites étapes, en vérifiant son travail à chacune d'entre elles. C'est comme essayer de traverser une pièce en faisant des pas d'un millimètre à la fois ; vous y arriverez, mais cela prendra une éternité.

Pour accélérer cela, les scientifiques essaient d'apprendre à ces robots à faire de plus grands bonds. Certaines méthodes tentent de deviner la destination finale en un seul saut géant, tandis que d'autres essaient d'apprendre le « chemin » que le robot doit suivre afin qu'il puisse sauter les parties ennuyeuses du milieu. Cependant, les meilleures méthodes actuelles pour la vidéo sont délicates. Elles reposent souvent sur des astuces d'entraînement complexes et instables qui peuvent faire oublier au robot comment bouger, ce qui donne des vidéos qui ont l'air superbes mais qui sont figées dans le temps, ou qui s'effondrent en motifs répétitifs et ennuyeux. La grande question est : peut-on apprendre à ces modèles à se déplacer rapidement et de manière fluide sans perdre la magie de leur créativité ?

Ce document présente une nouvelle technique appelée Parallel Decoding Distillation (PDD), qui agit comme un entraîneur super efficace pour ces artistes de l'IA. Au lieu de forcer le robot à faire un pas à la fois, la PDD lui apprend à prédire toute une séquence d'étapes en un seul coup d'œil. Imaginez que vous marchez dans un couloir. Un robot normal s'arrête devant chaque porte pour vérifier si elle est ouverte avant de passer à la suivante. La PDD, cependant, regarde tout le long du couloir, prédit exactement comment le sol sera sous ses pieds pour les dix prochaines étapes, puis avance d'un pas assuré, couvrant toute cette distance en une seule fois.

Les auteurs ont découvert qu'en entraîant le modèle à prédire la « vitesse moyenne » (ou vélocité) pour un bloc de temps entier d'un seul coup, ils pouvaient générer des images et des vidéos de haute qualité en seulement 4 à 8 étapes (appelées évaluations de fonction, ou NFE), contre les centaines habituellement requises. C'est une accélération massive. Contraquirement aux méthodes précédentes qui tentaient de forcer le robot à suivre un chemin rigide ou qui utilisaient des mathématiques compliquées qui brisaient souvent la capacité du modèle à créer de la variété, la PDD utilise une approche plus simple et plus directe. Elle n'a pas besoin de calculer des dérivées complexes ou d'utiliser des jeux adverses (où deux IA se battent pour s'améliorer), qui sont connus pour causer l'« effondrement de mode » — une façon élégante de dire que l'IA reste bloquée à produire toujours la même chose.

Le document montre que cette méthode fonctionne incroyablement bien sur des modèles à grande échelle, incluant ceux qui génèrent du contenu texte-vidéo et texte-image. Par exemple, sur le modèle vidéo Wan2.1, la PDD a produit des vidéos en 4 NFE qui étaient non seulement plus rapides, mais aussi plus diverses et dynamiques que les autres méthodes de pointe. Dans des tests avec le modèle LTX-2.3, qui crée des vidéos de 10 secondes avec du son, la PDD a réussi à égaler la qualité d'un modèle enseignant qui prenait 4 × 30 NFE (120 étapes au total) en utilisant seulement 8 NFE. Les résultats suggèrent que la PDD est une méthode robuste pour rendre la génération d'IA plus rapide sans sacrifier la variété et le mouvement qui font que les vidéos semblent vivantes. C'est une avancée significative, prouvant que vous n'avez pas besoin de faire un million de petits pas pour obtenir un excellent résultat ; parfois, il suffit d'apprendre à voir tout le chemin devant soi.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →