Résumé Technique : Vorch-Streamer
Problématique
La génération audio-vidéo d'avatars en temps réel et sur de longues durées fait face à deux dilemmes primordiaux lors de l'adaptation de modèles de diffusion bidirectionnels pré-entraînés à un environnement de streaming :
- Biais d'exposition et dérive visuelle : Le streaming de longue durée nécessite une génération autorégressive où les propres prédictions du modèle servent de contexte pour les blocs suivants. De petites erreurs d'apparence, de mouvement ou de synchronisation s'accumulent au fil du temps, créant un décalage entre l'entraînement (données propres) et l'inférence (historiques auto-générés). Cela conduit à des artefacts cumulatifs et à une dérive temporelle, déstabilisant la génération sur de longs horizons.
- Incohérence entre le discours global et le contexte causal : Dans les tâches de Text-to-Audio-Video (T2AV), l'invite (prompt) décrit une énonciation complète. Cependant, un générateur causal opérant dans une fenêtre de streaming ne peut porter attention qu'à un historique local limité. Sans planification explicite, le modèle peine à déterminer quelle partie de la transcription globale doit être prononcée ensuite, ce qui entraîne souvent un audio qui commence en milieu de phrase, perd la synchronisation temporelle ou génère un contenu de parole incorrect.
Les modèles existants sont typiquement conçus pour des clips courts et hors ligne avec une attention bidirectionnelle, ce qui les rend incompatibles avec les systèmes de streaming qui doivent générer le segment suivant avant que le contenu futur ne soit observé. De plus, de nombreux avatars de streaming existants reposent sur des audios directeurs ou des images de référence fournis de l'extérieur, échouant à synthétiser conjointement la parole et la vidéo à partir du texte de manière véritablement causale.
Méthodologie
Vorch-Streamer est un cadre de post-entraînement conçu pour étendre le modèle de fondation audio-vidéo bidirectionnel LTX2.3 vers un générateur de streaming causal, en temps réel et de longue durée. L'approche se compose de trois étapes principales :
1. Construction d'un corpus synthétique
Les auteurs ont construit un corpus synthétique de 80 000 clips audio-vidéo d'avatars de haute qualité (durée de 12 à 21 secondes) en utilisant le modèle bidirectionnel pré-entraîné LTX2.3. Cela garantit que les données d'entraînement sont cohérentes avec l'initialisation du modèle, fournissant une supervision cohérente pour l'entraînement causal ultérieur.
2. Streaming Audio-Vidéo Causal (Étape 2)
Pour convertir le modèle bidirectionnel en un générateur de streaming par blocs autorégressifs, les auteurs emploient une stratégie d'entraînement mixte :
- Mélange de Teacher Forcing et de Diffusion Forcing : Le modèle est entraîné avec un mélange au niveau de l'échantillon où 10 % des échantillons utilisent un historique de vérité terrain propre (Teacher Forcing) et 90 % utilisent un historique corrompu (Diffusion Forcing). Cela réduit le décalage entraînement-test en exposant le modèle à des contextes imparfaits et auto-générés durant l'entraînement.
- Masquage d'attention causal : Le modèle préserve l'attention bidirectionnelle au sein de chaque bloc audio-vidéo synchronisé (environ 1 seconde) pour modéliser les interactions fines, mais impose une attention causale entre les blocs.
- Contexte borné : Pour maintenir une utilisation constante de la mémoire, le modèle porte attention à une fenêtre bornée composée des trois premiers blocs (préfixe persistant) et du bloc précédent le plus récent.
3. Self Forcing sur long horizon (Étape 3)
Pour traiter l'accumulation d'erreurs sur de longues séquences, le cadre applique le Self Forcing avec la Distribution Matching Distillation (DMD) :
- Le modèle étudiant causal génère des séquences complètes de 12 à 21 secondes bloc par bloc à partir de ses propres prédictions.
- Un modèle LTX2.3 bidirectionnel gelé agit comme un enseignant de "vrai score" (real-score), représentant la distribution cible.
- Un modèle de "faux score" (fake-score) entraînable estime la distribution évolutive de l'étudiant.
- L'étudiant est optimisé pour minimiser la différence entre sa distribution et la distribution de l'enseignant, transférant efficacement la qualité du modèle bidirectionnel pré-entraîné vers de longues trajectoires causales tout en exposant le modèle à sa propre distribution de déploiement lors de l'inférence.
4. Planification de la parole basée sur un LLM
Pour résoudre l'incohérence entre les invites textuelles globales et la génération causale locale, Vorch-Streamer introduit une voie de planification de la parole explicite :
- Un LLM externe (Fun-CosyVoice) prédit des jetons de planification de la parole discrets à 25 Hz (unités de 40 ms).
- Ces jetons sont convertis en caractéristiques continues et injectés dans la branche de diffusion audio via un module de cross-attention dédié.
- Un opérateur de fusion à porte (gated fusion) combine de manière adaptative ces caractéristiques de planification avec les caractéristiques audio originales conditionnées par le texte.
- Cela sépare la planification de la parole (quoi dire et quand) de la génération audio (comment synthétiser), permettant l'interruption, le changement et l'inclusion d'un jeton de silence apprenable pour l'écoute interactive.
Principales Contributions
- Cadre (Framework) : Introduction de Vorch-Streamer, un cadre de post-entraînement qui adapte un modèle de diffusion audio-vidéo bidirectionnel pré-entraîné pour une génération de streaming causale, en temps réel et de longue durée.
- Stratégie d'entraînement : Construction d'un corpus synthétique de 80k et d'un nouveau pipeline d'entraînement combinant le mélange Teacher/Diffusion Forcing avec le long-horizon Self Forcing et la distillation d'enseignant pour aligner l'entraînement causal avec l'inférence en streaming.
- Planification de la parole : Proposition d'une voie de planification de la parole basée sur un LLM qui fournit des caractéristiques de planification continues à la branche audio, permettant un contrôle explicite de la progression de la parole, de l'interruption et de l'écoute silencieuse sans fixer l'intégralité de l'énonciation future au début du flux.
- Performance : Démonstration d'un streaming T2AV de longue durée en temps réel à 27,12 FPS (dépassant le seuil de lecture en temps réel de 24 FPS) tout en maintenant une synchronisation et une précision de parole compétitives.
Résultats Expérimentaux
Les auteurs ont évalué Vorch-Streamer sur des déploiements continus de longue durée (environ 2 minutes) contre des bases T2AV natives (LTX2.3, JoyAI-Echo, OmniForcing, Hallo-Live) et des références TIA2V conditionnelles (LiveAvatar, SoulX-FlashTalk).
- Vitesse : Vorch-Streamer atteint 27,12 FPS sur un seul GPU NVIDIA H200, ce qui en fait la seule méthode T2AV native évaluée dépassant la lecture en temps réel. Il est nettement plus rapide que le LTX2.3 bidirectionnel (1,83 FPS) et les autres bases de streaming.
- Précision de la parole : Le modèle atteint un taux d'erreur de mots (WER) de 7,92 %, comparable au LTX2.3 bidirectionnel hors ligne (7,59 %). En revanche, les bases sans planification de parole explicite (OmniForcing, Hallo-Live) souffrent de WER catastrophiques (>90 %) lors de l'extrapolation sur de longues durées.
- Synchronisation : Le modèle maintient une forte synchronisation audio-lèvres (Sync-C : 6,62, Sync-D : 8,95), comparable au LTX2.3 beaucoup plus lent.
- Stabilité sur long horizon : Sur un déploiement de deux minutes, Vorch-Streamer présente une dégradation minimale de la préservation de l'identité (la similitude ArcFace reste stable autour de 0,73–0,77) et de la cohérence de la scène (similitude CLIP autour de 0,92–0,94). Les autres méthodes T2AV natives montrent une dérive et une perte d'identité significatives sur de telles durées.
- Études d'ablation :
- La suppression du planificateur de parole LLM entraîne un WER de 184 %, confirmant la nécessité d'une planification explicite pour le T2AV causal.
- La suppression de l'étape 2 (initialisation causale) entraîne un effondrement du mouvement (le degré dynamique chute de 0,2706 à 0,0824).
- La suppression de l'étape 3 (long-horizon self forcing) entraîne un WER plus élevé (9,17 %) et une dérive accrue.
- Une fenêtre de contexte de 3+1 (3 blocs de préfixe persistant + 1 bloc récent) s'est révélée optimale pour équilibrer la préservation de l'identité et l'accumulation d'erreurs.
Signification
L'article affirme que Vorch-Streamer établit une voie pratique pour adapter de puissants modèles de fondation bidirectionnels à la génération d'avatars interactifs en temps réel. En résolvant le problème du biais d'exposition par le long-horizon self forcing et le problème de progression de la parole par une planification explicite basée sur un LLM, le cadre permet une génération Text-to-Audio-Video native qui est à la fois causale et de longue durée. Contrairement aux pipelines conditionnels qui dépendent d'audios externes ou de cadres de référence, Vorch-Streamer génère les deux modalités de zéro, maintenant la stabilité et la synchronisation sur des durées étendues sans nécessiter une croissance de la mémoire proportionnelle à la longueur de la séquence.