Résumé technique : InteracVid
Énoncé du problème
Bien que les modèles de langage de grande taille (LLM) aient établi le texte comme le support par défaut de l'interaction humain-IA, le texte seul est insuffisant pour les assistants multimodaux, les avatars et les agents incarnés qui nécessitent des réponses expressives et ancrées. Les modèles génératifs audio-vidéo récents ont amélioré la fidélité de la synthèse et la synchronisation, pourtant leur supervision reste largement descriptive : les modèles sont entraînés pour rendre un contenu spécifié par des légendes d'entrée plutôt que pour produire des réponses causées par des interactions utilisateur externes.
Les jeux de données existants pour la génération audio-visuelle interactive souffrent de trois limitations principales :
- Manque de structure causale : Ils associent souvent un contexte vidéo à du texte, mais ne parviennent pas à identifier les segments vidéo réactifs spécifiques ou la requête côté utilisateur qui les a déclenchés.
- Contraintes de modalité : De nombreux jeux de données sont restreints aux "talking-heads" (têtes parlantes) ou aux comportements humains de parole, manquant de diverses interactions avec des objets, des actions sur écran ou des démonstrations incarnées.
- Absence de supervision : Les ressources actuelles ne fournissent pas suffisamment de données pour apprendre des réponses audio-visuelles réactives, ancrées dans le contexte et déclenchées par une requête, où le modèle doit générer une réaction audio-visuelle appropriée à un stimulus utilisateur spécifique.
Méthodologie
Curation du jeu de données : InteracVid
Les auteurs introduisent InteracVid, le premier jeu de données open-source à grande échelle conçu pour répondre au manque de supervision pour la génération de réponses audio-visuelles interactives. Le jeu de données est construit à partir de vidéos de chat en direct, capturant la boucle d'interaction naturelle où les streamers réagissent aux commentaires des spectateurs.
Le pipeline de curation emploie une approche à deux branches sensible aux métadonnées pour gérer la parcimonie et le bruit des flux en direct bruts :
Branche de Requête Réelle (Interactions Naturelles) :
- Pour les vidéos possédant des métadonnées de chat en direct horodatées, le système aligne les commentaires des spectateurs avec les énoncés ultérieurs du streamer.
- Une chronologie sémantique au niveau de la phrase est construite à partir des sous-titres pour déterminer les rôles discursifs (monologue proactif vs réponse réactive).
- Un LLM filtre les paires pour garantir un lien causal plausible entre requête et réponse, extrayant la structure d'interaction complète : contexte précédent (C), requête utilisateur (Q) et la véritable réponse audio-visuelle (Y).
Branche de Requête Reconstruite (Déclencheurs Synthétiques) :
- Pour les vidéos dépourvues de métadonnées de chat (ex: VOD), le système identifie les moments de réponse réactive dans la transcription en se basant sur la classification du rôle discursif.
- Un modèle de langage-vision (VLM) observe le contexte vidéo local et la transcription de la réponse pour reconstruire une requête utilisateur plausible qui aurait pu déclencher la réponse.
- Crucialement, la réponse cible (Y) est toujours extraite de séquences réelles ; seule la condition de la requête d'entrée est synthétique. Cela garantit que le jeu de données reste ancré dans de véritables réactions humaines.
Traitement des données et contrôle qualité
- Échelle : Le pipeline produit plus de 454 000 triplets contexte-requête-réponse à partir de plus de 59 000 vidéos de streaming, couvrant des scénarios centrés sur la conversation, l'objet, les procédures, l'incarnation et les actions sur écran.
- Filtrage multimodal : Un contrôle qualité rigoureux assure l'alignement sémantique entre la parole et le visuel. Les clips présentant des transitions de scène abruptes sont supprimés. La reconnaissance automatique de la parole (ASR) est ré-exécutée sur les clips extraits pour affiner les transcriptions et les horodatages au niveau du mot.
* Légendage auxiliaire : Une légende audio-visuelle auxiliaire (T) est générée pour chaque clip, combinant la parole et les observations visuelles pour soutenir l'entraînement et l'analyse.
Cadre expérimental
Les auteurs proposent un pipeline de génération en deux étapes pour traiter la complexité de la génération interactive :
- Planificateur d'interaction : Un modèle de langage-vision (VLM) prend le contexte (C) et la requête (Q) pour prédire une description textuelle sensible à l'interaction (T).
- Co-générateur Audio-Vidéo : Un modèle de diffusion (MOVA) prend la description (T) et le contexte (C) pour synthétiser la réponse multimodale finale (Y).
Les expériences impliquent l'ajustement fin (fine-tuning) du planificateur et du générateur sur InteracVid, en les comparant aux bases de référence zero-shot et aux limites supérieures des légendes "oracle".
Contributions clés
- Jeu de données InteracVid : Un jeu de données de grande taille et de haute qualité comprenant plus de 454 000 triplets interactifs (C,Q,Y) qui modélise explicitement le lien causal entre les stimuli externes et les réponses audio-visuelles. C'est le seul jeu de données supportant à la fois l'entrée/sortie audio-visuelle avec un contexte précédent à travers divers domaines vidéo.
- Pipeline de construction sensible aux métadonnées : Une méthode novatrice pour extraire des clips interactifs de longs flux en direct bruités, utilisant une stratégie à deux branches (requêtes réelles et reconstruites) pour maximiser la couverture des données tout en maintenant l'intégrité causale.
- Validation humaine : Une étude menée auprès de dix évaluateurs confirme que les requêtes réelles et reconstruites sont causales, naturelles et temporellement complètes. Les requêtes reconstruites ont obtenu des scores légèrement supérieurs en termes de naturel grâce à l'élimination de l'argot et des formulations elliptiques courants dans le chat en direct brut.
- Validation empirique des données structurées par l'interaction : Les expériences démontrent que l'ajustement fin sur InteracVid améliore significativement tant le planificateur d'interaction en amont que le générateur audio-visuel en aval, prouvant que les données structurées par l'interaction constituent un fondement critique pour les agents multimodaux.
Résultats
Performance sémantique
Sur un benchmark de test de 100 requêtes authentiques de chat en direct :
- Ajustement fin du générateur : L'ajustement fin du co-générateur audio-visuel (MOVA) sur InteracVid a produit des gains substantiels dans toutes les dimensions sémantiques (Pertinence, Adéquation, Expressivité). Par exemple, en utilisant Qwen3.5-9B comme planificateur, le score global (OVRL) a augmenté de +1,41.
- Ajustement fin du planificateur : L'ajustement fin du planificateur d'interaction a également apporté des améliorations constantes, bien que plus faibles que celles du générateur (ex: +0,44 OVRL pour Qwen3.5-9B). Cela suggère que l'apprentissage de la planification d'une réponse interactive est un goulot d'étranglement majeur.
- Comparaison Oracle : Même avec des légendes de vérité terrain (Oracle), le générateur n'a obtenu que des gains marginaux (+0,09 OVRL) lors de son ajustement fin, indiquant que la limitation principale réside dans la planification de la bonne réponse plutôt que dans son rendu. Cependant, l'Oracle surpasse toujours le meilleur planificateur appris de 0,71 OVRL, soulignant l'écart dans les capacités de planification actuelles.
Évaluation humaine
Une évaluation humaine indépendante de 10 évaluateurs sur les vidéos générées a reproduit les classements du juge VLM automatique (corrélation de Pearson r≈0,96).
- Les évaluateurs humains ont confirmé que l'ajustement fin du générateur est le facteur dominant d'amélioration (+1,68 OVRL avec le planificateur InternVL).
- Les résultats ont validé que le modèle répond à la requête plutôt qu'à la scène seule, ce qui a été confirmé par des tests contrefactuels où l'échange de la requête n'a maintenu un score de pertinence que lorsque le modèle était conscient de la requête.
Qualité audio-visuelle
L'ajustement fin sur InteracVid a amélioré les métriques de génération de bas niveau :
- Vidéo : Améliorations de la cohérence du sujet (+1,3 %), de la cohérence de l'arrière-plan (+1,2 %) et de la fluidité du mouvement (réduction de l'erreur de +39,2 %).
- Audio : Gains en plaisir de contenu (+3,4 %), utilité du contenu (+5,7 %) et qualité de production (+5,6 %).
- Synchronisation : La distance de synchronisation labiale s'est améliorée de 4,1 %, et l'AV-Align a augmenté de 16,3 %.
- Audio contextuel : Les expériences ont montré que le conditionnement sur l'audio précédent (en plus de la première image) améliore considérablement la similitude du locuteur et l'état acoustique, comblant une fraction substantielle de l'écart avec les enregistrements réels.
Signification et affirmations
L'article affirme que les données structurées par l'interaction sont un fondement manquant crucial pour la prochaine génération d'agents multimodaux. Alors que les modèles actuels excellent dans la génération descriptive, ils peinent pour la génération interactive — produire des réponses causées par des stimuli externes.
Les auteurs postulent que :
- La donnée est le goulot d'étranglement : Le manque de jeux de données associant des stimuli externes à des réponses audio-visuelles réactives et ancrées a entravé les progrès des agents interactifs. InteracVid comble cette lacune.
- La planification est le défi principal : Les expériences suggèrent qu'apprendre à planifier une réponse interactive plausible (l'étape du "penseur") reste un goulot d'étranglement plus important que le rendu de cette réponse (l'étape de "l'acteur").
- Généralisabilité : La couverture diversifiée du jeu de données (de la manipulation d'objets aux actions sur écran) permet l'étude de l'interaction audio-visuelle dans des cas généraux, dépassant les limites des jeux de données de "talking-heads".
Le travail conclut qu'InteracVid facilite la recherche sur les assistants multimodaux capables de réponses audio-visuelles ancrées, expressives et conscientes de l'interaction, fournissant la supervision nécessaire pour passer des chatbots textuels à de véritables agents incarnés et avatarisés.