← Derniers articles
💻 computer science

DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

DiTango est un cadre de diffusion parallèle rentable qui accélère la génération de DiT multi-nœuds en exploitant l'hétérogénéité des partitions de contexte pour réutiliser stratégiquement les états d'attention, atteignant une accélération allant jusqu'à 3,2x avec une mise à l'échelle quasi linéaire tout en préservant la qualité de la génération.

Auteurs originaux : Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

Publié 2026-07-20
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où les ordinateurs peuvent rêver des films entiers, pas seulement des images fixes, mais des histoires fluides et en haute définition qui durent plusieurs minutes. C'est la magie des « Diffusion Transformers », un type d'intelligence artificielle qui construit des images et des vidéos étape par étape, transformant lentement un bruit statique en une scène claire et magnifique. Imaginez cela comme un sculpteur taillant un bloc de marbre ; l'IA commence avec un nuage chaotique de pixels et, au fil de nombreuses étapes de raffinement, révèle une vidéo parfaite.

Cependant, il y a un piège : ces sculpteurs numériques sont incroyablement lents. Créer une seule vidéo de cinq secondes peut prendre plus d'une heure sur un ordinateur puissant. Pour accélérer les choses, les ingénieurs tentent souvent de faire travailler plusieurs ordinateurs ensemble, en divisant la longue séquence vidéo en segments et en les distribuant comme une course de relais. Mais voici le problème : lorsque ces ordinateurs essaient de partager leur travail, ils se retrouvent coincés dans des embouteillages. Le temps passé à attendre le transfert des données va et vient annule souvent le gain de vitesse obtenu en ayant plus de travailleurs. Cela crée un goulot d'étranglement frustrant où l'ajout d'ordinateurs ne fait pas réellement finir la vidéo plus vite, et parfois même la ralentit.

Entrez en scène DiTango, un nouveau système conçu pour résoudre cet embouteillage. Les chercheurs derrière DiTango ont remarqué quelque chose de fascinant sur la façon dont ces modèles d'IA « portent attention » aux différentes parties de la vidéo. Ils ont découvert que toutes les parties de la vidéo ne sont pas également importantes à chaque instant. Tout comme vous vous concentrez intensément sur la personne qui parle juste devant vous, mais que vous remarquez à peine la personne située trois pièces plus loin, l'attention de l'IA est beaucoup plus forte pour les parties proches de la vidéo et beaucoup plus faible pour les parties distantes.

DiTango utilise cette intuition pour jouer un jeu astucieux de « sauter et réutiliser ». Au lieu de forcer chaque ordinateur à chercher et calculer constamment chaque morceau de donnée auprès de tous les autres ordinateurs (ce qui cause l'embouteillage), le planificateur intelligent de DiTango décide quelles parties sont cruciales à recalculer de manière fraîche et quelles parties sont si peu importantes que l'ordinateur peut simplement utiliser un ancien résultat, stocké en cache, d'il y a quelques secondes. C'est comme un groupe de chefs dans une cuisine immense : au lieu que tout le monde coure au garde-manger pour attraper la même épice à chaque fois, ils réalisent que pour la garniture située de l'autre côté de la table, le pot d'épices posé sur le comptoir à proximité est « assez bon » et ne nécessite pas un nouveau trajet.

En étant sélectif, DiTango réduit considérablement le temps que les ordinateurs passent à communiquer entre eux. Lors de tests utilisant de puissants modèles vidéo, cette approche a rendu le processus de génération presque deux fois plus rapide de bout en bout et a accéléré les calculs d'« attention » de base de plus de trois fois lors de l'utilisation de 32 ordinateurs ensemble. Crucialement, les chercheurs ont constaté que cette accélération n'a pas dégradé la qualité de la vidéo ; les films finaux étaient aussi nets et cohérents que ceux produits par les méthodes traditionnelles plus lentes. DiTango prouve qu'en comprenant où l'IA a réellement besoin de regarder, nous pouvons l'empêcher de gaspiller de l'énergie pour des choses qu'elle remarque à peine, rendant le rêve d'une génération de vidéos IA instantanée et de haute qualité un peu plus proche de la réalité.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →