OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars
OmniMate is een verenigd framework dat hoogwaardige, lage-latentie, open-ended real-time audio-visuele avatar-generatie mogelijk maakt door een Generation Progress Controller te introduceren voor adaptieve respons-progressie en een Multi-Reference Conditioning Module om langdurige cross-modale identiteitsconsistentie te waarborgen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je praat met een vriend die binnen in een computerscherm leeft. Je wilt dat hij niet alleen spreekt, maar ook zijn handen beweegt, knippert en in realtime reageert op je stem, net als een echt persoon. Dit is de droom van "interactieve avatars". Lange tijd was het maken van deze digitale personages als het filmen van een film: je moest elke regel tekst en elk gebaar plannen voordat je op "afspelen" kon drukken. Maar onlangs hebben wetenschappers "diffusiemodellen" gebouwd, die als magische penseelstreken werken die direct hoogwaardige video's en geluiden kunnen creëren vanuit tekst. Deze technologie is zo goed geworden dat het een personage kan laten spreken en bewegen in synchronisatie met audio. Er is echter een addertje onder het gras: deze modellen werken meestal het beste wanneer ze precies weten hoe lang het gesprek zal duren. Als je een vrij vloeiend gesprek probeert te voeren waarbij de computer moet raden wanneer hij stopt met praten en weer moet beginnen met luisteren, raakt het personage vaak in de war, blijft het te lang praten, of begint het na een paar minuten op een ander persoon te lijken. Dit artikel pakt precies dat probleem aan: hoe je een digitale vriend maakt die eeuwig met je kan chatten, zonder zijn gezicht of stem te verliezen, en zonder achter jouw woorden aan te lopen.
De onderzoekers achter dit project, een team van de Xi'an Jiaotong Universiteit en China Telecom, hebben een nieuw systeem gebouwd genaamd OmniMate. Denk aan OmniMate als een superintelligente digitale poppenspeler die een eindeloos gesprek kan afhandelen. In tegen tegenstelling tot eerdere systemen die wellicht struikelen wanneer het gesprek lang wordt of wanneer de gebruiker de ander onderbreekt, is OmniMate ontworpen om natuurlijk te stromen, waarbij het direct schakelt tussen "praten" en "luisteren"-modi terwijl het personage er exact hetzelfde uitziet en klinkt.
Het geheim van het succes van OmniMate ligt in twee slimme trucs die het gebruikt om alert te blijven. Ten eerste gebruikt het iets dat een Generation Progress Controller (GPC) wordt genoemd. Stel je voor dat je een verhalenboek leest, maar je weet niet hoeveel pagina's er nog over zijn. Meestal lees je dan door tot voorbij het einde of stop je te vroeg. De GPC is als een ingebouwde paginateller die de avatar precies vertelt hoeveel van zijn reactie nog moet worden gegenereerd. Het geeft het systeem een "progressiebalk" voor elk klein stukje video en audio dat het creëert. Hierdoor weet de avatar precies wanneer hij een zin moet afmaken en soepel moet terugschakelen naar een "luisterhouding", wachtend op jouw volgende input. Zonder dit zou de avatar na het praten kunnen blijven praten, of ongemakkelijk kunnen bevriezen.
De tweede truc is de Multi-Reference Conditioning Module (MRCM). Heb je ooit gemerkt dat als je naar een foto van een persoon kijkt vanuit een vreemde hoek, die persoon er een beetje anders uit kan zien? In lange video's lijden digitale avatars vaak aan "identiteitsdrift", waarbij hun gezicht langzaam verandert in iemand anders, of hun stem van toonhoogte verandert. OmniMate lost dit op door zichzelf constant te herinneren aan wie het personage is. In plaats van alleen naar het allereerste frame van de video te kijken, houdt het een "geheugenbank" bij van verschillende referentiefoto's en een sample van de stem van het personage. Terwijl de video speelt, controleert het constant deze referenties, zoals een schilder die even terugkijkt naar een portret om er zeker van te zijn dat de neus en ogen kloppen, waardoor het personage er hetzelfde uitziet en klinkt of er nu 10 seconden of 10 minuten wordt gepraat.
Het team heeft OmniMate getest op een benchmark genaamd VerseBench, die echte gesprekken simuleert. De resultaten waren indrukwekkend: het systeem kan video en audio genereren met een snelheid van 27,64 frames per seconde (FPS), met een "time-to-first-frame" (hoe lang het duurt voordat de video voor je wordt getoond) van slechts 3,49 seconden. Dit is snel genoeg om aan te voelen als een echt, live gesprek. In tests versloeg OmniMate andere topmodellen in het behouden van de consistentie van het gezicht en de stem over lange perioden. Waar andere systemen na een minuut misschien wazig worden of van stem veranderen, bleef OmniMate stabiel, zelfs in tests die tot 240 seconden duurden.
De auteurs merken echter voorzichtig op dat het systeem nog niet perfect is. Als het systeem de verkeerde tijd voor een reactie inschat, kan de avatar een woord afkappen of zichzelf herhalen. Ook, als het personage iets moet doen dat hun uiterlijk drastisch verandert, zoals een grote kostuumwissel, kan het systeem moeite hebben om de identiteit consistent te houden. Maar over het algid, suggereert OmniMate een grote stap voorwaarts: een manier om digitale vrienden te hebben die in realtime met ons kunnen chatten, weten wie ze zijn, en op ons kunnen reageren zonder de ongemakkelijke glitches van het verleden. Het transformeert de statische, vooraf geplande video's van vandaag in dynamische, levende gesprekken van morgen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.