← Derniers articles
💻 computer science

Native Audio-Visual Alignment for Generation

NAVA est un cadre novateur pour la génération conjointe audio-vidéo qui emploie une stratégie d'alignement audio-visuel natif au sein d'une architecture MMDiT de type Aligner- puis-Fusionner afin d'obtenir une synchronisation supérieure, une qualité vidéo améliorée et un timbre de parole contrôlable tout en n'utilisant que 6,3 milliards de paramètres.

Auteurs originaux : Longbin Ji, Guan Wang, Xuan Wei, Chenye Yang, Xiangrui Liu, Zhenyu Zhang, Shuohuan Wang, Yu Sun, Jingzhou He

Publié 2026-05-29
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Longbin Ji, Guan Wang, Xuan Wei, Chenye Yang, Xiangrui Liu, Zhenyu Zhang, Shuohuan Wang, Yu Sun, Jingzhou He

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous souhaitiez créer une scène de film où un personnage pédale à vélo tout en parlant. Vous avez besoin que deux éléments se produisent parfaitement de concert : la vidéo du vélo en mouvement et le son du vent ainsi que la voix de la personne.

Pendant longtemps, les ordinateurs ont tenté de créer ces deux éléments séparément, puis de les assembler à la fin. C'est comme si un artiste dessinait le vélo et qu'un tout autre artiste enregistrait la voix, avant d'essayer de les faire correspondre plus tard. Souvent, la voix était légèrement décalée par rapport aux mouvements des lèvres, ou le son ne semblait pas appartenir à cette scène spécifique.

D'autres méthodes plus récentes ont essayé de mettre l'artiste, l'acteur de doublage et le réalisateur dans la même toute petite pièce pour travailler sur tout en même temps. Bien que cela les aide à communiquer, cela devient désordonné. Le « réalisateur » (les instructions textuelles) finit par se confondre avec le « ingénieur du son » (le timing du bruit), rendant difficile le contrôle de détails spécifiques comme qui parle ou à quoi ressemble sa voix.

Voici NAVA : L'approche de la « salle de répétition »

L'article présente NAVA (Native Audio-Visual Alignment), qui modifie le flux de travail. Au lieu de travailler séparément ou de tout mélanger dans un même grand pot, NAVA utilise un processus astucieux en deux étapes appelé « Alignement puis Fusion ».

Pensez-y comme à une répétition de théâtre :

  1. La Répétition (Alignement) : D'abord, les acteurs (audio) et l'équipe de plateau (vidéo) se rencontrent dans une « salle de répétition » dédiée. Ici, ils s'exercent ensemble sans que le réalisateur ne leur donne de nouvelles répliques. Ils déterminent exactement comment le son d'un pas correspond à la vue d'un pied frappant le sol, ou comment un accord de guitare correspond à un mouvement de main. Ils établissent une connexion naturelle et native entre le son et la vue.
  2. La Représentation (Fusion) : Une fois qu'ils savent comment bouger et parler ensemble, le réalisateur (l'invite textuelle) intervient. Le réalisateur n'a plus besoin de leur apprendre à se synchroniser ; il leur dit simplement quoi faire. « Maintenant, le personnage doit dire cette réplique avec une voix grognon. » Parce que les acteurs et l'équipe savent déjà bouger en synchronisation, ils peuvent s'adapter instantanément aux nouvelles instructions sans perdre leur rythme.

L'ingrédient secret : « Timbre dans le Contexte »

NAVA possède également un tour de magie spécial pour gérer plusieurs interlocuteurs. Imaginez un scénario où une mère et son enfant parlent. Vous ne voulez pas que la voix de la mère ressemble à celle de l'enfant.

Les anciennes méthodes pourraient avoir un bouton « commutateur de voix » séparé qui change la voix de toute la scène. NAVA est plus intelligent. Il traite le style vocal (le timbre) comme faisant partie du scénario lui-même. Il attache une « étiquette de voix » spécifique aux répliques de la mère et une étiquette différente à celles de l'enfant. Lorsque l'ordinateur génère la scène, il sait exactement quelle voix appartient à quelle phrase, tout comme un réalisateur lisant un scénario avec des notes sur qui parle.

Ce que l'article a découvert

Les chercheurs ont testé NAVA par rapport à d'autres modèles de pointe en utilisant un benchmark appelé Verse-Bench (un test de la correspondance entre audio et vidéo) et Seed-TTS (un test de contrôle de la voix).

  • Meilleure synchronisation : NAVA a été le meilleur pour s'assurer que le son se produisait au moment exact où l'événement visuel se produisait (comme une porte qui claque ou des lèvres qui bougent).
  • Haute qualité : La vidéo était excellente, et l'audio était clair et réaliste.
  • Efficacité : Bien que plus petit que de nombreux concurrents (n'utilisant que 6,3 milliards de « cellules cérébrales » ou paramètres), il surpassait des modèles beaucoup plus grands.
  • Contrôle : Il pouvait basculer entre différents interlocuteurs dans la même scène de manière transparente, en gardant les voix distinctes et précises.

En résumé

NAVA résout le problème de la création de son et de vidéo en leur donnant un espace dédié pour apprendre à bouger ensemble avant d'essayer de suivre des instructions complexes. C'est comme enseigner à un duo de danseurs de maîtriser leurs pas avant que le chorégraphe ne leur dise quelle chanson danser. Le résultat est une scène de film où le son et l'image semblent être nés ensemble, et non simplement collés ensemble.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →