← Nieuwste papers
💻 computer science

Native Audio-Visual Alignment for Generation

NAVA is een nieuw raamwerk voor gezamenlijke audio-video-generatie dat een native audio-visuele afstemmingstrategie hanteert binnen een Align-then-Fuse MMDiT-architectuur om superieure synchronisatie, videokwaliteit en controleerbare spraaktimbre te bereiken met slechts 6,3 miljard parameters.

Oorspronkelijke auteurs: Longbin Ji, Guan Wang, Xuan Wei, Chenye Yang, Xiangrui Liu, Zhenyu Zhang, Shuohuan Wang, Yu Sun, Jingzhou He

Gepubliceerd 2026-05-29
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Longbin Ji, Guan Wang, Xuan Wei, Chenye Yang, Xiangrui Liu, Zhenyu Zhang, Shuohuan Wang, Yu Sun, Jingzhou He

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een filmscène wilt creëren waarin een personage op een fiets rijdt terwijl het praat. Je hebt twee dingen nodig die perfect samen moeten gebeuren: de video van de bewegende fiets en het geluid van de wind en de stem van de persoon.

Lange tijd probeerden computers deze twee dingen apart te maken en ze vervolgens aan het einde aan elkaar te plakken. Dit is alsof één kunstenaar de fiets tekent en een volledig andere kunstenaar de stem opneemt, waarna je later probeert ze op elkaar af te stemmen. Vaak was de stem iets uit de pas met de lipbewegingen, of klonk het geluid alsof het niet bij die specifieke scène hoorde.

Andere, nieuwere methoden probeerden de kunstenaar, de stemacteur en de regisseur allemaal in dezelfde kleine kamer te zetten om tegelijk aan alles te werken. Hoewel dit helpt om met elkaar te praten, wordt het rommelig. De "regisseur" (de tekstinstructies) raakt uiteindelijk verward met de "geluidstechnicus" (het timing van het geluid), waardoor het moeilijk wordt om specifieke details te controleren zoals wie er spreekt of hoe hun stem klinkt.

Maak kennis met NAVA: de "Repetitieruimte"-aanpak

Het artikel introduceert NAVA (Native Audio-Visual Alignment), wat de workflow verandert. In plaats van apart te werken of alles door elkaar te halen in één grote pot, gebruikt NAVA een slim tweestapsproces genaamd "Align-then-Fuse" (Eerst uitlijnen, dan samenvoegen).

Denk hierbij aan een theaterrepetitie:

  1. De Repetitie (Uitlijning): Eerst ontmoeten de acteurs (audio) en het podiumpersoneel (video) elkaar in een speciale "repetitieruimte". Hier oefenen ze samen zonder dat de regisseur hen nieuwe tekst geeft. Ze ontdekken precies hoe het geluid van een voetstap overeenkomt met het beeld van een voet die de grond raakt, of hoe een gitaarslag overeenkomt met een handbeweging. Ze bouwen een natuurlijke, inherente verbinding tussen geluid en beeld.
  2. De Voorstelling (Samenvoegen): Zodra ze weten hoe ze samen moeten bewegen en spreken, komt de regisseur (de tekstprompt) naar voren. De regisseur hoeft hen niet langer te leren hoe ze op elkaar moeten afstemmen; hij vertelt hen alleen wat ze moeten doen. "Nu moet het personage deze zin zeggen met een chagrijnige stem." Omdat de acteurs en het personeel al weten hoe ze synchroon moeten bewegen, kunnen ze zich direct aanpassen aan de nieuwe instructies zonder hun timing te verliezen.

Het geheime ingrediënt: "Timbre-in-Context"

NAVA heeft ook een speciale truc voor het hanteren van meerdere sprekers. Stel je een script voor waarin een moeder en haar kind met elkaar praten. Je wilt niet dat de stem van de moeder klinkt als die van het kind.

Oudere methoden hebben misschien een aparte "stemwissel"-knop die de hele stem van de scène verandert. NAVA is slimmer. Het behandelt de stemstijl (timbre) als onderdeel van het script zelf. Het plakt een specifiek "stemlabel" aan de tekstregels van de moeder en een ander "stemlabel" aan de regels van het kind. Wanneer de computer de scène genereert, weet het precies welke stem bij welke zin hoort, net als een regisseur die een script leest met aantekeningen over wie er spreekt.

Wat het artikel heeft gevonden

De onderzoekers hebben NAVA getest tegen andere topmodellen met behulp van een benchmark genaamd Verse-Bench (een test van hoe goed audio en video overeenkomen) en Seed-TTS (een test van stemcontrole).

  • Bessere Synchroon: NAVA was het beste in het zorgen dat het geluid op het exacte moment plaatsvond waarop het visuele gebeurtenis plaatsvond (zoals een deur die slampt of lippen die bewegen).
  • Hoge Kwaliteit: De video zag er geweldig uit, en de audio klonk helder en realistisch.
  • Efficiëntie: Ondanks dat het kleiner is dan veel concurrenten (met slechts 6,3 miljard "hersencellen" of parameters), presteerde het beter dan veel grotere modellen.
  • Controle: Het kon naadloos wisselen tussen verschillende sprekers in dezelfde scène, waarbij de stemmen duidelijk en accuraat bleven.

Samenvattend

NAVA lost het probleem op van het maken van geluid en video door hen een speciale ruimte te geven om te leren hoe ze samen moeten bewegen voordat ze proberen complexe instructies te volgen. Het is alsof je een dansduo leert hun stappen te beheersen voordat de choreograaf hen vertelt op welk liedje ze moeten dansen. Het resultaat is een filmscène waarin geluid en beeld lijken te zijn geboren samen, en niet alleen maar aan elkaar zijn geplakt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →