Résumé Technique : Self Gradient Forcing (SGF)
1. Énoncé du Problème : Le fossé entre le contexte historique et le gradient
Les avancées récentes dans la diffusion vidéo autorégressive se sont tournées vers le Self Forcing (auto-forçage), un paradigme où les modèles sont entraînés sur des historiques générés par leurs propres déroulements (rollouts) autorégressifs plutôt que sur des contextes vidéo de vérité terrain. Cette approche atténue le biais d'exposition en alignant les distributions d'entraînement avec les conditions d'inférence. Cependant, les auteurs identifient une limitation critique dans les implémentations actuelles du Self Forcing : le fossé entre le contexte historique et le gradient (historical context-gradient gap).
Dans le Self Forcing standard, bien que le modèle apprenne à lire l'historique auto-généré (via le cache Clé-Valeur ou KV) pour prédire les images futures, l'écriture de cet historique dans le cache reste non supervisée. Plus précisément :
- Cache KV Figé : Lors du déroulement autorégressif, les latents précédemment générés sont traités à un pas de temps de contexte propre (tctx=0) pour produire des entrées Clé-Valeur (KV). Ces entrées sont stockées dans le cache comme un état « figé » pour les blocs futurs.
- Absence de Supervision : Les pertes futures (par exemple, les pertes de distillation de correspondance de distribution à des pas de temps de bruit élevés) peuvent se propager en arrière à travers la lecture du cache (la façon dont les futurs tokens sont attentifs à l'historique), mais ne peuvent pas se propager à travers l'écriture du cache (la façon dont les latents antérieurs sont encodés en représentations KV).
- Conséquence : À mesure que le déroulement s'étend, les paramètres responsables de l'écriture des entrées KV à pas de temps propre dérivent car ils sont mis à jour par des pertes à des pas de temps bruités sans retour direct sur l'utilité de la représentation mémorielle résultante pour la génération à long terme. Cela conduit à une dérive d'identité, des incohérences de mise en page et des ruptures de scène dans les vidéos longues.
Une solution directe — maintenir l'intégralité du graphe de déroulement sériel différentiable pour permettre aux pertes futures de se propager à travers tout l'historique — est informatiquement irréalisable en raison de l'explosion de la mémoire à mesure que le graphe croît avec la longueur du déroulement.
2. Méthodologie : Self Gradient Forcing (SGF)
Les auteurs proposent le Self Gradient Forcing (SGF), une stratégie d'entraînement en deux passes qui restaure le signal de supervision de l'écriture de la mémoire manquant sans nécessiter une rétropropagation complète à travers le déroulement sériel. Le SGF est orthogonal aux améliorations de forcing existantes et peut être appliqué par-dessus celles-ci.
La Stratégie en Deux Passes
Le SGF décompose l'étape d'entraînement en deux phases distinctes :
Passe 1 : Déroulement Autorégressif sans Gradient
- Le modèle effectue un déroulement autorégressif sériel standard identique à l'inférence, mais avec les gradients désactivés.
- Pour chaque bloc i, le modèle débruite le latent zi en utilisant l'actuel cache KV historique.
- À un « pas de sortie » (s) échantillonné (un pas de temps de débruitage spécifique), le modèle enregistre :
- Les latents d'entrée bruités (Z∗).
- Les latents propres prédits (X~ctx) générés au pas de sortie.
- Les latents propres sont traités à tctx=0 pour mettre à jour le cache KV sériel pour le bloc suivant, mais cette mise à jour est détachée du grapfun de calcul.
Passe 2 : Reconstruction Parallèle du Gradient de Contexte
- Le modèle abandonne le cache sériel et reconstruit le calcul pour le pas de sortie échantillonné de manière parallèle.
- Les latents propres enregistrés (X~ctx) de la Passe 1 sont réinjectés dans le modèle comme entrées avec arrêt de gradient (stop-gradient).
- Le modèle re-calcule les états cachés de contexte propre, les représentations KV et l'attention causale futur-vers-contexte.
- Crucialement, les représentations KV générées lors de cette passe sont différentiables.
- Le modèle traite ensuite les latents bruités enregistrés (Z∗) pour générer des prédictions, et la perte résultante (par exemple, la perte DMD) est propagée en arrière.
- Résultat : Le gradient coule de la perte future, à travers le débruitage du côté cible, à travers le mécanisme d'attention, et revient vers le calcul d'écriture du KV (la passe avant du contexte propre). Cela permet aux pertes futures de superviser la manière dont l'historique auto-généré est encodé dans la mémoire.
Détails de l'Implémentation Technique
- Frontière de Gradient : La méthode évite la rétropropagation complète du déroulement (BPTT). Les gradients ne circulent qu'à travers la reconstruction bornée de la Passe 2. Les entrées de la reconstruction (les latents enregistrés) restent en arrêt de gradient, garantissant que l'optimisation se concentre sur le mécanisme d'écriture plutôt que sur la trajectoire du déroulement elle-même.
- Efficacité : En utilisant une reconstruction parallèle avec un masque causal statique (par exemple, via FlexAttention), le SGF évite l'explosion de la mémoire associée à un cache sériel entièrement différentiable.
- Politique de Flux (Streaming) : Pour la génération image par image, le SGF utilise une politique de contexte de type « puits plus FIFO », maintenant un préfixe de puits fixe et une fenêtre de latents récents pour isoler l'effet du forçage de gradient.
3. Contributions Clés
- Identification du Fossé : L'article identifie formellement le « fossé entre le contexte historique et le gradient » dans le Self Forcing à cache figé, où les pertes futures supervisent la lecture du cache mais pas le calcul d'écriture du contexte propre, entraînant une dérive lors de la génération à long terme.
- Algorithme SGF : Introduction d'une stratégie d'entraînement en deux passes qui récupère la supervision de l'écriture de la mémoire via une reconstruction parallèle du gradient de contexte, permettant aux pertes futures d'entraîner le modèle à encoder le contexte dans une mémoire causale plus efficace.
- Validation Empirique : Expérimentations approfondies démontrant que le SGF améliore significativement l'extrapolation native de vidéos longues (60s et 240s) tout en maintenant une qualité de l'horizon court (5s) comparable au Self Forcing.
4. Résultats Expérimentaux
Les auteurs ont évalué le SGF par rapport à des bases de comparaison de Self Forcing appariées pour la génération image par image et par blocs, en utilisant diverses initialisations (Causal ODE, Causal CD, Teacher Forcing) et divers horizons (5s, 60s, 240s).
- Métriques Quantitatives :
- Le SGF surpasse systématiquement le Self Forcing en termes de cohérence du sujet, de cohérence du décor/mise en page, de stabilité temporelle (scintillement) et de qualité esthétique pour les horizons de 60s et 240s.
- Bien que le Self Forcing obtienne parfois des scores plus élevés sur le « degré de dynamique », les auteurs attribuent cela à un mouvement incohérent (sauts de scène, déformation d'objets) plutôt qu'à la qualité. Le SGF maintient une évolution de caméra plus stable et plausible.
- À l'horizon de 5s, le SGF est comparable au Self Forcing, confirmant que la méthode ne dégrade pas la génération à court terme.
- Résultats Qualitatifs :
- Les comparaisons visuelles montrent que les modèles Self Forcing finissent par souffrir de dérive d'identité, de sauts de vue et de ruptures de mise en page à mesure que l'extrapolation continue.
- Les modèles SGF préservent l'identité du sujet, la pose et la mise en scène sur 240 secondes, même lorsqu'ils sont entraînés sur une fenêtre de seulement 5 secondes.
- Étude Utilisateur : Une étude de préférence aveugle GSB (Greater-Same-Better) avec plus de 1 900 jugements appariés a montré une préférence constante pour le SGF par rapport au Self Forcing dans tous les réglages testés, avec des scores de préférence allant de ~29% à ~48%.
- Faisabilité de l'Entraînement : Le SGF introduit un surcoût modeste. La mémoire de pointe augmente légèrement (de ~79 Go à ~87 Go), mais la mémoire stable diminue (de ~79 Go à ~63 Go) grâce à l'élimination du graphe récurrent. Le temps d'exécution augmente d'environ 1,3 seconde par 5 étapes d'entraînement.
5. Signification et Revendications
L'article affirme que le SGF répond à une limitation fondamentale de l'entraînement actuel de la diffusion vidéo autorégressive : l'incapacité des pertes futures à superviser l'encodage de l'historique auto-généré dans la mémoire.
- Extrapolation Native : Le SGF permet aux modèles entraînés sur de courtes fenêtres (ex: 5 secondes) de s'étendre à des vidéos de plusieurs minutes (60s, 240s) avec une cohérence nettement améliorée.
- Orthogonalité : La méthode est présentée comme une amélioration prête à l'emploi qui peut être combinée avec d'autres techniques de forcing (ex: Causal Forcing, Rolling Forcing) sans conflit.
- Supervision de l'Écriture de la Mémoire : La signification centrale réside dans le passage de l'objectif d'entraînement pour garantir que le modèle n'apprend pas seulement à lire son propre historique, mais à l'écrire de manière à ce qu'il reste utile pour les étapes de génération futures.
Les auteurs concluent qu'en comblant le fossé entre le contexte historique et le gradient, le SGF offre une voie évolutive vers la génération de vidéos longues de haute qualité sans les coûts de mémoire prohibitifs des déroulements entièrement différentiables.