← Nieuwste papers
💻 computer science

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

Omni-Customizer is een end-to-end framework dat nauwkeurige gezamenlijke audio-video-generatie met consistente visuele identiteiten en vocale klankkleuren over meerdere onderwerpen mogelijk maakt door middel van de introductie van nieuwe modules zoals Omni-Context Fusion, Masked TTS Cross-Attention en Semantic-Anchored Multimodal RoPE om uitdagingen zoals spraaklekkage op te lossen en state-of-the-art multimodale aanpassing te bereiken.

Oorspronkelijke auteurs: Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je regisseur bent die probeert een filmscène met meerdere acteurs op te nemen. Je hebt een script, maar je moet ook ervoor zorgen dat Acteur A er altijd uitziet als de specifieke persoon die je hebt ingehuurd en precies klinkt als hun unieke stem, terwijl Acteur B hetzelfde doet voor zichzelf. Als de camera in de war raakt, kan het gebeuren dat je Acteur A's gezicht ziet bewegen terwijl Acteur B's stem spreekt, of erger: de acteurs beginnen zinnen te spreken die niet in het script staan, alleen maar omdat je ze in de scène-notities hebt beschreven.

Dit is precies het probleem dat Omni-Customizer oplost. Het is een nieuw AI-systeem dat is ontworpen om video's te maken waarin meerdere mensen kunnen praten en interageren, terwijl hun unieke uiterlijk en stem perfect behouden blijven.

Hieronder wordt uitgelegd hoe het werkt, opgesplitst met eenvoudige analogieën:

1. Het Probleem: De "Verwarde Regisseur"

Eerdere AI-tools waren goed in het maken van video's of goed in het maken van audio, maar toen ze probeerden beide tegelijk te doen met meerdere mensen, raakten ze in de war.

  • De Verwarring: De AI kan verwarren wie er spreekt. Het kan gebeuren dat de man in het rode overhemd de zinnen van de vrouw spreekt.
  • De "Geest"-Stem: Soms zou de AI per ongeluk de beschrijving van de scène in spraak omzetten. Als je schreef: "De man is lang", zou de AI de personage misschien daadwerkelijk laten zeggen: "Ik ben lang", zelfs al stond dat niet in de dialoog.
  • De Afdrijving: Naarmate de video vordert, kunnen de personages langzaam hun gezicht of stem veranderen, waardoor ze hun identiteit verliezen.

2. De Oplossing: De "Omni-Customizer"-Toolkit

De onderzoekers bouwden een systeem met drie hoofd-"gereedschappen" om deze problemen op te lossen:

A. De "Super-Connector" (Omni-Context Fusion)

Stel je het brein van de AI voor als bestaande uit verschillende afdelingen: één voor tekst, één voor afbeeldingen en één voor geluid. Normaliter praten deze afdelingen zeer traag en indirect met elkaar.

  • De Oplossing: Omni-Customizer bouwt een "Super-Connector" die alle deze afdelingen dwingt aan dezelfde tafel te zitten en direct te praten. Het neemt de beschrijving van de persoon, hun foto en hun stemsample en smeedt ze samen tot één strak pakket voordat de video-generatie zelfs maar begint. Dit zorgt ervoor dat de AI weet: "Dit gezicht, deze stem en deze naam behoren allemaal tot dezelfde persoon."

B. Het "Naamkaartje"-Systeem (Semantic-Anchored RoPE)

Stel je een hoop puzzelstukken voor: sommige zijn gezichten, sommige zijn stemmen en sommige zijn woorden. Als je ze zomaar in een doos gooit, raken ze door elkaar.

  • De Oplossing: Het systeem gebruikt een speciaal "Naamkaartje" (SA-MRoPE genoemd). Het plakt het puzzelstuk van "Gezicht A" en "Stem A" fysiek direct vast aan het tekstwoord "Onderwerp 1" in het script. Het is alsof je een magnetisch label op de puzzelstukken plakt zodat ze niet kunnen wegdrijven en aan het verkeerde persoon kunnen vastgrijpen. Dit voorkomt dat de AI in de war raakt over wie wie is, zelfs in drukke scènes met drie of vier mensen.

C. De "Stilte-knop" (Masked TTS Cross-Attention)

Herinner je je het probleem waarbij de AI per ongeluk de scènebeschrijvingen sprak?

  • De Oplossing: De onderzoekers installeerden een "Stilte-knop" (MTP-CA). Ze zeggen tegen de AI: "Spreek alleen de woorden binnen de <S> (Start) en <E> (Eind) tags." Alles anders—zoals beschrijvingen van het weer of de kleding van de personages—wordt strikt stilgelegd. De AI wordt gedwongen de beschrijvende tekst te negeren bij het genereren van spraak, zodat het nooit per ongeluk de regie-aanwijzingen hardop voorleest.

3. De Training: "De Gym-routine"

Om dit systeem te leren, gooiden de onderzoekers niet alle data er ineens op. Ze gebruikten een slim trainingschema:

  • De "Alleen-Audio"-Oefeningen: Soms oefent de AI alleen met audio (luisteren naar stemmen en talen leren) zonder zich zorgen te maken over de video. Dit helpt het om vele verschillende talen te leren spreken zonder in de war te raken.
  • De "Video-Audio"-Oefeningen: Op andere momenten oefent het om video en audio perfect op elkaar te laten aansluiten (lip-syncen).
  • De "Makkelijk naar Moeilijk"-Ladder: Ze begonnen met het leren van de AI om slechts één persoon te laten praten. Zodra dat onder de knie was, gingen ze naar twee mensen, en uiteindelijk naar complexe scènes met meerdere mensen die over elkaar heen praten. Deze stap-voor-stap aanpak voorkwam dat de AI overweldigd raakte.

4. Het Resultaat

Bij tests bleek Omni-Customizer dat het kon:

  • Gezichten en stemmen consistent houden, zelfs in lange gesprekken.
  • Het "Geest-Stem"-probleem voorkomen (waarbij beschrijvingen worden gesproken).
  • Complexe scènes met meerdere mensen beter aan dan enig eerder open-source model.

Kortom: Omni-Customizer is als een zeer georganiseerde filmcrew die nooit vergeet welke acteur wie is, ervoor zorgt dat ze alleen hun eigen zinnen spreken, en hun stemmen en gezichten consistent houdt van de eerste seconde tot de laatste.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →