Résumé Technique : Token Radius Attention pour la Génération de Vidéo Efficace
1. Énoncé du Problème
Les Transformers de Diffusion Vidéo (VDiT) sont devenus l'architecture dominante pour la génération de vidéos haute fidélité, s'appuyant sur une attention auto-attention 3D dense pour capturer des dépendances spatiales et temporelles complexes. Cependant, l'attention dense entraîne un coût computationnel quadratique (O(N2)) par rapport au nombre de tokens vidéo N, créant un goulot d'étranglement significatif pour l'inférence lors du passage à l'échelle et du déploiement.
Les approches existantes pour atténuer ce coût emploient des mécanismes d'attention parcimonieuse (sparse attention), principalement classés en méthodes de niveau tête (head-level) et de niveau bloc (block-level).
- Les méthodes de niveau tête assignent des motifs spatiaux ou temporels structurés à des têtes d'attention individuelles.
- Les méthodes de niveau bloc sélectionnent des paires de blocs requête-clé (query–key) importantes.
La limitation fondamentale : Les deux paradigmes partagent généralement un budget de calcul unique (par exemple, une densité de rétention ou un rayon fixes) pour tous les tokens de requête au sein d'une tête ou d'un bloc. Cette hypothèse d'« allocation partagée » entre en conflit avec la nature intrinsèque de l'auto-attention, où la normalisation Softmax est effectuée indépendamment pour chaque requête. Par conséquent, les requêtes ayant des distributions d'attention concentrées (faible entropie) gaspillent de la puissance de calcul si elles sont forcées d'accorder de l'attention à de nombreuses clés, tandis que les requêtes ayant des distributions diffuses (haute entropie) peuvent perdre des interactions critiques si le budget partagé est trop faible. Ce décalage dégrade la qualité de la génération ou échoue à atteindre une efficacité optimale.
2. Méthodologie : Token Radius Attention (TRA)
Les auteurs proposent la Token Radius Attention (TRA), un cadre sans entraînement (training-free) qui réalise une parcimonie structurée spécifique aux tokens sans nécessier de classement (ranking) explicite des clés par requête. TRA opère sur deux intuitions empiriques dérivées de l'analyse des motifs d'attention des VDiT.
Intuition I : Parcimonie de l'Attention Spécifique aux Tokens
Les auteurs observent que la « densité retenue » (la fraction des clés les mieux classées nécessaires pour préserver une masse d'attention cible) varie de plusieurs ordres de grandeur selon les requêtes au sein d'une même couche et d'une même tête. De plus, ils trouvent une forte relation log-linéaire entre cette densité retenue et l'entropie de l'attention.
- Mécanisme : Une entropie élevée indique une distribution d'attention diffuse nécessitant un budget de tokens plus large, tandis qu'une faible entropie indique une distribution concentrée nécessitant moins de tokens.
- Implémentation : TRA utilise une approximation analytique pour mapper directement l'entropie de la requête vers un budget spécifique au token (B^≈τexp(Hi)/N), éliminant ainsi le besoin de tris ou de classements coûteux par requête.
Intuition II : Motif d'Attention par Rayon de Token (Token Radius Attention Pattern)
Les auteurs observent que les interactions dominantes pour une requête forment des voisinages circulaires centrés sur la requête dans le domaine spatial. La probabilité d'attention normalisée décroît approximativement de manière exponentielle avec la distance spatiale 2D.
- Mécanisme : Au lieu de sélectionner des clés arbitraires de type top-k, TRA convertit le budget de tokens scalaire en un rayon spatial.
- Décroissance Temporelle : Pour gérer les séquences vidéo, le rayon spatial est modulé par une règle de décroissance de la distance temporelle (ϕ(δ)=exp(−γδ)), créant une structure de support spatiotemporelle régulière.
Le Pipeline TRA
- Entropie-vers-Budget : Lors d'une phase initiale de « chauffe » (warm-up) dense, TRA calcule l'entropie de l'attention pour chaque requête. Cette entropie est ensuite mappée vers un budget de tokens spécifique.
- Budget-vers-Rayon : Le budget est converti en un rayon de base spécifique à la requête. Ce rayon est ensuite ajusté pour chaque image en fonction de la distance temporelle afin de former un masque de disque 2D.
- Exécution Efficace :
- Disposition Tile-Major : Les tokens vidéo sont réorganisés dans un ordre tile-major pour garantir que les tokens spatialement voisins (qui tombent dans le rayon) sont contigus dans la séquence.
- Noyaux CUDA Fusionnés : Un noyau personnalisé fusionne le calcul de la distance, la comparaison de rayon, l'élagage de blocs (block pruning) et le vote de tokens pour convertir les masques de rayon irréguliers au niveau du token en masques de parcimonie par blocs réguliers compatibles avec FlashInfer.
- Réutilisation Inter-Étapes : L'entropie est calculée uniquement pendant la phase de chauffe et réutilisée pour les étapes de parcimonie suivantes, en tirant parti de la stabilité observée des motifs d'entropie à travers les étapes de débruitage.
3. Contributions Clés
- Découverte de la Parcimonie Spécifique aux Tokens : L'article révèle que la densité retenue varie considérablement selon les requêtes mais suit une relation log-linéaire prévisible avec l'entropie de l'attention, et que les interactions dominantes suivent un motif de rayon centré sur la requête.
- Token Radius Attention (TRA) : Un cadre sans entraînement qui transforme les demandes de calcul spécifiques aux tokens en supports spatiotemporels réguliers via un pipeline entropie-vers-budget-vers-rayon, évitant le classement explicite des clés.
- Co-conception de Système : Les auteurs co-conçoivent un noyau de masque de rayon et un noyau d'entropie fusionné pour minimiser les surcoûts, permettant une exécution efficace sur les backends de parcimonie par blocs existants.
- Validation Complète : TRA est validé sur sept configurations de Wan2.1, Wan2.2 et HunyuanVideo (allant de 1,3B à 14B de paramètres) pour les tâches de Text-to-Video (T2V) et d'Image-to-Video (I2V).
4. Résultats Expérimentaux
TRA a été évalué par rapport à l'attention dense et à trois bases de comparaison de parcimonie sans entraînement (SVG, SVG2 et Radial) sur la suite de benchmarks VBench.
- Efficacité : TRA ne retient que 9 % à 19 % des interactions d'attention. Il obtient une accélération de 1,56× à 2,05× par rapport aux modèles denses sur toutes les configurations testées. Par exemple, sur HunyuanVideo-13B, il atteint une accélération de 2,05× pour le T2V et de 2,02× pour l'I2V.
- Qualité : TRA maintient une qualité de génération compétitive, atteignant souvent les meilleurs scores globaux VBench parmi les méthodes de parcimonie. Sur Wan2.1-14B T2V, il égale presque le score de l'attention dense tout en offrant une accélération de 1,75×.
- Fidélité : Les résultats qualitatifs montrent que TRA préserve mieux l'identité du sujet, l'intégrité structurelle et la cohérence temporelle par rapport aux autres méthodes de parcimonie, avec moins d'artefacts comme le scintillement ou la distorsion.
- Études d'Ablation : Supprimer la cartographie du budget guidée par l'entropie ou le masquage par rayon (en le remplaçant par une distance 1D) dégrade considérablement les performances, confirmant la nécessité de l'adaptativité spécifique aux tokens et du support spatial structuré.
5. Signification et Revendications
L'article affirme que la Token Radius Attention traite une inefficacité fondamentale des paradigmes d'attention parcimonieuse actuels : le décalage entre les budgets d'allocation partagés et les demandes d'attention spécifiques aux tokens. En exploitant la relation intrinsèque entre l'entropie et la parcimonie de l'attention, TRA parvient à un compromis qualité-efficacité favorable sans nécessiter d'entraînement supplémentaire ou de mécanismes de classement en ligne complexes.
Les auteurs positionnent TRA comme une technique complémentaire aux autres méthodes d'accélération (comme le cache ou la quantification) qui se concentre spécifiquement sur la réduction du coût quadratique des interactions requête-clé au sein des couches d'attention exécutées. Ce travail démontre que l'adaptativité au niveau du token peut être réalisée efficacement grâce à un masquage structuré par rayon, offrant une voie évolutive pour le déploiement de modèles de génération de vidéo haute fidélité.