Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models
Auteurs originaux : Taesung Kwon, Jonghyun Park, Hyungjin Chung, Jong Chul Ye
Auteurs originaux : Taesung Kwon, Jonghyun Park, Hyungjin Chung, Jong Chul Ye
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé technique : Accélération des solveurs de problèmes inverses vidéo avec des modèles de diffusion autoregressifs
Énoncé du problème
Les problèmes inverses vidéo visent à reconstruire une vidéo propre x à partir d'une mesure dégradée y (par exemple, basse résolution, masquée ou floue) définie par y=A(x)+n. Bien que les modèles de diffusion et basés sur le flot soient devenus des a priori puissants sans échantillonnage préalable pour ces tâches, leur déploiement en temps réel est actuellement entravé par deux inefficacités critiques :
- Latence initiale élevée : Les solveurs de problèmes inverses vidéo basés sur des modèles de diffusion (DVIS) existants restaurent généralement les vidéos de manière holistique, en échantillonnant l'ensemble de la séquence simultanément. Par conséquent, la première image ne peut être affichée qu'une fois la vidéo entièrement restaurée, créant un goulot d'étranglement de latence égal au temps total de restauration.
- Débit faible : Les modèles de diffusion vidéo modernes fonctionnent souvent dans l'espace latent d'un autoencodeur variationnel (VAE). Pour assurer la cohérence avec la mesure, les solveurs actuels nécessitent plusieurs passages VAE (encodage et décodage) pendant le processus de restauration, limitant le débit à moins de 1 image par seconde (IPS).
Méthodologie
Les auteurs proposent le Solveur de problèmes inverses vidéo autoregressif (AVIS) et sa variante accélérée, AVIS Flash, qui exploitent des modèles de diffusion vidéo autoregressifs (AR) pour résoudre ces goulots d'étranglement.
Cadre central : AVIS
Contrairement aux solveurs non autoregressifs qui traitent l'ensemble de la vidéo conjointement, AVIS restaure les vidéos de manière en flux, en générant des segments vidéo séquentiellement. Cette architecture élimine naturellement le goulot d'étranglement de la latence initiale. Pour résoudre le problème de débit et la lenteur inhérente des modèles de diffusion, AVIS introduit une initialisation cohérente avec la mesure :
- Initialisation : Au lieu de démarrer la diffusion inverse à partir d'un bruit gaussien pur, AVIS calcule d'abord une estimation grossière et cohérente avec la mesure xinit dans l'espace des pixels en minimisant l'objectif ∥y−A(x)∥2 à l'aide d'un algorithme d'optimisation multi-étapes (gradient conjugué).
- Échantillonnage accéléré : Cette estimation est encodée dans l'espace latent et diffusée jusqu'à un instant intermédiaire t0. Le processus de diffusion inverse commence alors à partir de t0 plutôt que de t=1, réduisant considérablement le nombre d'étapes d'échantillonnage requises.
- Guidage itératif : Pour chaque segment vidéo, AVIS impose la cohérence avec la mesure à chaque étape de débruitage en utilisant le cadre d'échantillonnage de diffusion décomposée (DDS). Cela implique de décoder l'estimation latente, de résoudre un problème d'optimisation proximale pour s'aligner sur les mesures, puis de réencoder, le tout sans nécessiter de calculs coûteux de Jacobien.
Variante accélérée : AVIS Flash
Pour améliorer encore l'efficacité, AVIS Flash modifie la stratégie de guidage :
- Guidage sur un seul segment : Il impose la cohérence avec la mesure (via des passages VAE itératifs) uniquement sur le premier segment vidéo.
- Propagation autoregressive : Les segments suivants (n≥2) sont générés exclusivement par propagation autoregressive à partir du préfixe corrigé (en utilisant la mise en cache KV), contournant ainsi le guidage explicite par la mesure.
- Justification théorique : Les auteurs fournissent une analyse de décomposition de l'erreur (Proposition 1), montrant que l'erreur finale est bornée par l'erreur initiale (atténuée par l'initialisation) et l'erreur de contexte propagée depuis les segments précédents. Ils observent que l'erreur de contexte agit comme une perturbation additive plutôt que comme un amplificateur multiplicatif, permettant au système de maintenir la fidélité sans guidage continu.
- Stabilité des vidéos longues : Pour les séquences très longues, le cadre peut réinjecter périodiquement la cohérence avec la mesure (par exemple, tous les N segments) pour éviter la dérive temporelle.
Contributions clés
- Cadre AVIS : L'investigation des modèles de diffusion vidéo autoregressifs pour la restauration vidéo sans échantillonnage préalable. AVIS accélère la restauration en initialisant le processus de diffusion inverse avec une estimation cohérente avec la mesure, réduisant les étapes d'échantillonnage tout en maintenant la cohérence pour chaque segment.
- AVIS Flash : Une variante hautement accélérée qui impose la cohérence avec la mesure uniquement sur le premier segment. Cette approche augmente considérablement le débit tout en maintenant des performances compétitives, offrant un compromis favorable entre efficacité et performance.
- Gains de performance : L'article démontre que ces méthodes réduisent drastiquement la latence initiale et augmentent le débit par rapport aux solveurs non autoregressifs de pointe, ouvrant la voie à un déploiement en temps réel.
Résultats expérimentaux
Les méthodes ont été évaluées sur 100 vidéos haute résolution couvrant cinq problèmes inverses : Super-résolution (4×), Inpainting aléatoire (masque 50 %), Défloutage gaussien, Moyenne temporelle et Moyenne spatio-temporelle.
- Efficacité :
- Latence : AVIS réduit la latence initiale de 114 s (LVTINO) à 4 s.
- Débit : AVIS augmente le débit de 0,71 IPS à 1,18 IPS. AVIS Flash atteint 5,91 IPS sur un seul GPU RTX 4090 (et 10,2 IPS sur un H100), représentant une accélération de 8 à 12 fois par rapport aux références.
- Qualité de restauration :
- AVIS obtient des résultats supérieurs ou hautement compétitifs sur les métriques de fidélité (PSNR, SSIM, LPIPS, FVD) et les métriques perceptuelles (VBench) par rapport à des références telles que DiffIR2VR-Zero, VISION-XL et LVTINO.
- AVIS Flash maintient des performances compétitives, avec une légère baisse sur certaines métriques spécifiques par rapport à AVIS, mais offre une amélioration spectaculaire de la vitesse.
- Études d'ablation :
- La suppression du cache KV autoregressif dégrade les performances, confirmant la valeur de la propagation du contexte.
- Le démarrage du processus inverse à partir d'un bruit pur (sans initialisation) entraîne une dérive ; l'initialisation cohérente avec la mesure est cruciale pour la fidélité.
- Un temps de démarrage t0=0,1 et K=2 étapes d'échantillonnage ont été jugés offrir le meilleur équilibre entre vitesse et qualité.
Importance et affirmations
L'article affirme qu'AVIS et AVIS Flash établissent une base solide pour le déploiement pratique et en temps réel des solveurs de problèmes inverses vidéo basés sur la diffusion. En exploitant la génération autoregressive et une stratégie d'initialisation novatrice, le cadre comble le fossé entre les a priori génératifs de haute qualité des modèles de diffusion et les exigences strictes de latence et de débit des applications réelles.
Les auteurs notent que, bien que les méthodes fassent progresser considérablement l'état de l'art, elles reposent encore sur plusieurs passages VAE pour le guidage initial dans l'espace des pixels. Les travaux futurs pourraient explorer l'imposition de la cohérence avec la mesure directement dans l'espace latent pour accélérer davantage le processus. De plus, la capacité à restaurer des vidéos haute fidélité à partir d'entrées dégradées soulève des considérations éthiques concernant la désinformation et la reconstruction de données sensibles, ce que les auteurs reconnaissent comme un impact plus large à prendre en compte.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.
Recevez les meilleurs articles machine learning chaque semaine.
Adopté par des chercheurs de Stanford, Cambridge et de l'Académie des sciences.
Vérifiez votre boîte mail pour confirmer votre inscription.
Quelque chose s'est mal passé. Réessayer ?
Pas de spam, désinscription à tout moment.