← Nieuwste papers
💻 computer science

OmniForcing: Unleashing Real-time Joint Audio-Visual Generation

OmniForcing is een nieuw framework dat een offline bidirectioneel audio-visueel diffusiemodel distilleert naar een stabiele, real-time autoregressieve generator door middel van asymmetrische blok-causele uitlijning en gezamenlijke zelf-forcerende distillatie, waardoor synchronisatie en hoge kwaliteit worden behaald bij 25 FPS op één GPU.

Oorspronkelijke auteurs: Yaofeng Su, Yuming Li, Zeyue Xue, Jie Huang, Siming Fu, Haoran Li, Ying Li, Zezhong Qian, Haoyang Huang, Nan Duan

Gepubliceerd 2026-03-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yaofeng Su, Yuming Li, Zeyue Xue, Jie Huang, Siming Fu, Haoran Li, Ying Li, Zezhong Qian, Haoyang Huang, Nan Duan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🎬 De Droom: Een Live Show in Echtijd

Stel je voor dat je een film wilt maken waarin een acteur praat, terwijl je tegelijkertijd de geluiden van de achtergrond en zijn stem hoort. Tot nu toe waren de slimste AI-modellen (zoals de "LTX-2" in dit paper) als een perfecte regisseur die alles in één keer doet. Hij kijkt naar het hele script, hoort het hele geluidsbestand en bedenkt dan pas het eerste beeld.

Het probleem? Dit duurt eeuwen. Het is alsof je een film van 5 minuten moet maken, maar de regisseur eerst 3 uur nodig heeft om alleen maar het eerste beeld te bedenken. Dat is te traag voor live-gesprekken, games of interactieve apps.

OmniForcing is de oplossing. Het is als een slimme, snelle regisseur die de film terwijl hij draait maakt, beeld voor beeld en geluid voor geluid, zonder te wachten. En het beste van alles: hij maakt het net zo goed als de trage regisseur, maar dan in echt real-time (ongeveer 25 beelden per seconde).


🚧 De Grote Uitdaging: De Tijdenverschil

Waarom is dit zo moeilijk? Stel je voor dat video en audio twee verschillende talen spreken met verschillende snelheden:

  • Video is traag en visueel: Het heeft maar een paar "woorden" (beelden) per seconde nodig.
  • Audio is snel en druk: Het heeft honderden "woorden" (geluidsgolven) per seconde nodig.

Als je deze twee samen probeert te laten praten in een live-stream, ontstaat er een chaos. De snelle audio-modus wacht op de trage video, of de video mist de snelle audio. In de wereld van AI leidt dit tot een "explosie" van fouten; de computer raakt in paniek en stopt.


🛠️ De Oplossing: De "OmniForcing" Magie

De onderzoekers hebben een slimme manier bedacht om de trage, perfecte regisseur (de "leraar") te trainen om een snelle, live-regisseur (de "leerling") te worden. Ze gebruiken drie slimme trucjes:

1. De "Gouden Anker" (Global Prefix)

Stel je voor dat je een lange trein bouwt. Als je begint met het eerste wagonnetje, moet je zeker weten dat de rest er perfect op aansluit.
OmniForcing gebruikt een Gouden Anker aan het begin van de trein. Dit is een stukje data dat voor altijd zichtbaar blijft voor de AI. Het zorgt ervoor dat video en audio vanaf seconde 0 perfect op elkaar afgestemd zijn, zodat ze niet uit elkaar drijven terwijl de trein langzaam rijdt.

2. De "Geluidskraan" (Audio Sink Tokens)

Dit is misschien wel de coolste truc. Omdat audio zo snel is en video zo traag, krijgt de audio-afdeling soms te weinig informatie om te kunnen praten. Het is alsof je iemand vraagt om een verhaal te vertellen, maar je geeft hem maar één woord per minuut. Hij raakt in paniek (de AI "crasht").

Om dit op te lossen, voegen ze Geluidskraantjes toe. Dit zijn speciale, onzichtbare "vullers" die als een veiligheidsnet fungeren. Ze vullen de lege plekken op in het geheugen van de AI, zodat de audio nooit in paniek raakt, zelfs als er nog geen video is. Ze zorgen ervoor dat de "stem" van de AI altijd stabiel blijft.

3. De "Zelf-Correctie" (Self-Forcing)

Wanneer je live een verhaal vertelt, maak je soms fouten. Als je die fouten niet corrigeert, wordt het verhaal steeds slechter.
OmniForcing gebruikt een Zelf-Correctie-methode. Tijdens het trainen laat de AI haar eigen fouten zien en leert ze zichzelf te verbeteren. Het is alsof de regisseur tijdens het filmen zegt: "Oeps, die zin klonk raar, laten we het direct opnieuw doen." Hierdoor blijft de synchronisatie tussen beeld en geluid perfect, zelfs na minutenlang filmen.


🚀 Het Resultaat: Van Trager dan Snel naar Echt Snel

Vroeger duurde het genereren van een korte clip met perfect geluid en beeld bijna 3 minuten (197 seconden).
Met OmniForcing duurt het 5,7 seconden voor dezelfde clip, en het kan zelfs live streamen met een snelheid van 25 beelden per seconde.

  • Vroeger: Je wachtte tot de hele film klaar was voordat je het eerste beeld zag.
  • Nu: Je ziet en hoort het direct, terwijl de AI het tegelijkertijd bedenkt.

💡 Samenvattend

OmniForcing is als het vinden van de perfecte tandem-fiets voor een snelle renner (audio) en een langzame wandelaar (video). Door slimme ankers, veiligheidsnetten en zelf-correctie, kunnen ze nu samen rennen in perfect ritme, zonder dat de snelle renner de langzame wandelaar hoeft te wachten. Hierdoor kunnen we in de toekomst AI gebruiken voor live-gesprekken, games en interactieve shows die direct reageren op wat we zeggen en doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →