← Derniers articles
💻 computer science

Token Radius Attention for Efficient Video Generation

Token Radius Attention (TRA) est un cadre d'apprentissage sans entraînement qui accélère efficacement les Transformers de diffusion vidéo en mappant dynamiquement l'entropie des requêtes à des rayons d'attention dépendants des jetons, réalisant ainsi des accélérations significatives avec une perte de qualité minimale tout en ne conservant que 9 à 19 % des interactions d'attention.

Auteurs originaux : Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

Publié 2026-08-04
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de peindre une fresque monumentale et mouvante sur un mur qui s'étend sur des kilomètres. Pour que l'image paraisse réelle, vous devez regarder chaque coup de pinceau que vous avez fait jusqu'à présent et décider comment il se connecte à celui que vous êtes en train de peindre. Dans le monde de l'intelligence artificielle, c'est exactement ce que font les « Video Diffusion Transformers ». Ce sont les artistes numériques qui créent de magnifiques vidéos à partir de rien, mais pour qu'une vidéo paraisse fluide et réaliste, l'ordinateur doit vérifier chaque pixel par rapport à tous les autres pixels de la vidéo entière. C'est comme essayer de serrer la main de chaque personne dans un stade tout en restant debout au même endroit ; c'est incroyablement minutieux, mais cela demande un temps et une énergie considérables. Les scientifiques appellent cela l'« attention dense », et c'est la raison pour laquelle la création de vidéos IA de haute qualité est actuellement si lente et coûteuse. La grande question que se posent les chercheurs est la suivante : pouvons-nous rendre l'IA plus intelligente sur le choix de qui elle serre la main, afin qu'elle saute les parties ennuyeuses et se concentre uniquement sur les connexions importantes, sans pour autant gâcher l'image ?

Ce document présente une nouvelle stratégie ingénieuse appelée Token Radius Attention (TRA) pour résoudre ce problème. Au lieu de traiter chaque partie de la vidéo de la même manière, les auteurs ont découvert que différentes parties de la vidéo nécessitent en réalité des quantités d'attention différentes. Pensez à une fête : certains invités sont plongés dans une conversation sérieuse et n'ont besoin d'écouter que les personnes juste à côté d'eux (faible attention), tandis que d'autres dansent follement et doivent garder un œil sur toute la pièce (haute attention). Les chercheurs ont découvert qu'ils pouvaient prédire exactement de combien d'« attention » chaque partie de la vidéo avait besoin simplement en mesurant à quel point sa concentration actuelle est « confuse » ou « dispersée ». Ils appellent cette mesure l'« entropie ».

En utilisant cette intuition, l'équipe a construit un système qui agit comme un garde de rayon intelligent. Pour chaque petite partie de la vidéo (appelée « token »), le système calcule un cercle de taille personnalisée autour de celle-ci. Si la partie est concentrée et calme, le cercle est petit, et l'IA ne regarde que ses voisins immédiats. Si la partie est chaotique ou complexe, le cercle s'agrandit pour inclure plus de voisins. Cela se produit automatiquement sans que l'IA n'ait besoin de s'arrêter pour classer chaque possibilité, ce qui permet de gagner un temps précieux. Le résultat est un générateur de vidéos qui conserve 9 % à 19 % des connexions originales mais fonctionne 1,56 à 2,05 fois plus vite, produisant des vidéos qui sont tout aussi bonnes que les versions lentes et lourdes. Les auteurs ont testé cela sur plusieurs modèles différents de création de vidéos et ont constaté que cela fonctionne de manière constante, prouvant qu'il n'est pas nécessaire de tout vérifier pour obtenir un excellent résultat — il faut juste vérifier les bonnes choses.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →