Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
Dit artikel introduceert Live Avatar, een co-ontworpen algoritme-systeemframework dat de eerste praktische, real-time, oneindig lange streaminggeneratie van 14 miljard parameters tellende audio-gestuurde avatars mogelijk maakt door een gedestilleerde causale diffusiepipeline te combineren met Timestep-forcing Pipeline Parallelism om 45 FPS te bereiken terwijl lange-termijn identiteitsdrift wordt geëlimineerd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren om een verhaal te vertellen. Je wilt dat de robot spreekt, zijn lippen beweegt en zijn gezichtsuitdrukkingen verandert in perfecte synchronisatie met jouw stem, terwijl hij eruitziet als een echt mens. Dit is de wereld van audio-gestuurde avatar-generatie. Al een lange tijd bouwen wetenschappers "digitale acteurs" met behulp van een type AI dat een diffusiemodel wordt genoemd. Denk aan een diffusiemodel als een beeldhouwer die begint met een blok ruisachtige statische elektriciteit en langzaam de ruis wegbeitelt om een perfect beeldhouwwerk te onthullen. Meestal werkt deze beeldhouwer in een zeer strikte volgorde: hij moet eerst het hoofd afmaken voordat hij aan het lichaam kan beginnen, en hij moet dit stap voor stap doen, wat veel tijd kost.
Het grote probleem is dat als je deze robot vraagt om een uur lang een verhaal te vertellen, hij de draad kwijtraakt. Hij kan vergeten hoe het gezicht van het personage er vijf minuten geleden uitzag, of zijn stem kan plotseling klinken als die van een heel ander persoon. Dit wordt "drift" genoemd. Bovendien, omdat de beeldhouwer zo traag werkt, kun je geen realtime gesprek met hem voeren; tegen de tijd dat hij een zin heeft afgemaakt, ben je alwe Verd quên wat je hebt gezegd. Het doel voor onderzoekers is geweest om een digitale acteur te bouwen die snel genoeg is om live met je te praten, slim genoeg is om zijn identiteit urenlang te behouden, en gedetailleerd genoeg is om fotorealistisch te zijn.
Maak kennis met Live Avatar, een nieuw project dat fungeert als een meesterdirigent voor een enorm orkest van computerchips. De onderzoekers achter dit werk, geleid door teams van de University of Science and Technology of China en Alibaba, hebben ontdekt hoe ze een gigantisch AI-model met 14 miljard parameters (een "14B" model, wat enorm is in de wereld van AI) kunnen laten praten, bewegen en videostreamen in realtime zonder de controle te verliezen.
Normaal gesproken is het maken van een video die zo lang én zo snel is een tegenstrijdigheid. Je kunt snelheid hebben, of kwaliteit, maar niet beide. Live Avatar lost dit op door de manier waarop de AI over tijd en geheugen "denkt" te veranderen. In plaats van te proberen elk enkel perfect detail uit het verleden te onthouden (wat ervoor zorgt dat de AI in de war raakt en gaat driften), slaat het systeem een "ruizig" geheugen op. Stel je voor dat je een liedje probeert te onthouden door de melodie ruw te neuriën, in plaats van te proberen elke enkele noot perfect te herinneren. Dit "ruwe" geheugen werkt als een filter, waardoor het gezicht van het personage stabiel blijft terwijl de mond natuurlijk beweegt.
Het team heeft ook een slimme manier uitgevonden om de snelheid te verhogen, genaamd Timestep-forcing Pipeline Parallelism. Stel je een fabriekslijn voor waar, in plaats van één arbeider die elke stap van het bouwen van een auto doet, een team van arbeiders aan het werk is. In een normale video-AI wacht elke arbeider tot de vorige klaar is voordat hij kan beginnen. Live Avatar verandert de regels: elke arbeider op de lijn (of elke computerchip, bekend als een GPU) krijgt een specifieke taak toegewezen. Terwijl Arbeider A de wielen polijst, is Arbeider B de deur aan het spuiten, en Arbeide C de motor aan het installeren, en dat allemaal tegelijkertijd. Dit verandert een traag, sequentieel proces in een snel, parallel proces.
De resultaten zijn indrukwekkend. Op een opstelling met 5 krachtige H100-videokaarten kan Live Avatar video genereren met 45 frames per seconde (FPS), wat sneller is dan de snelheid van het menselijk oog. Het duurt slechts 1,21 seconde om de eerste frame te genereren nadat je spreekt. Het belangrijkste is dat het voor altijd kan doorgaan. De onderzoekers testten dit door de avatar meer dan 10.000 seconden (dat is bijna drie uur lang) te laten praten, en het personage vertoonde geen drift, geen glitches en verloor zijn identiteit niet.
Dit is niet alleen een theoretische overwinning; het team heeft een nieuwe testomgeving gebouwd genaamd GenBench om te bewijzen dat andere methoden falen bij lange duur terwijl hun methode slaagt. Ze ontdekten dat terwijl andere systemen er na een paar seconden goed uit kunnen zien, ze na een paar minuten beginnen te verslechteren, van kleur veranderen of het gezicht van de persoon verliezen. Live Avatar blijft echter consistent. Dit suggereert dat door een "ruizige" geheugenstrategie te combineren met een slim assemblage-lijn systeem, we eindelijk digitale mensen kunnen hebben die klaar zijn voor oneindige, realtime gesprekken.
Het artikel sluit expliciet de mogelijkheid uit dat je de AI moet trainen op uren aan video om dit te laten werken. In plaats daarvan hebben ze aangetoond dat trainen op korte clips (ongeveer 3 seconden) voldoende is, mits je hun speciale "ruisige historie"-truc gebruikt. Ze argumenteren ook tegen de oude overtuiging dat je moet kiezen tussen een snel, laagwaardig model en een traag, hoogwaardig model. Met hun methode kun je een enorm, hoogwaardig model hebben dat in realtime draait.
Hoewel het systeem ongelooflijk snel is, merken de auteurs op dat er nog steeds een kleine vertraging is. De tijd van wanneer je spreekt tot de video op het scherm verschijnt, is ongeveer 3 seconden wanneer je de netwerkverplaatsingstijd meerekent. Dit is snel genoeg voor veel interacties, maar misschien niet snel genoeg voor een naadloos, face-to-face gesprek waarbij elke milliseconde telt. Echter, voor streaming, virtuele assistenten en digitaal storytelling, is dit een enorme sprong voorwaarts, wat suggereert dat het tijdperk van oneindige, realtime digitale avatars niet langer slechts een droom is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.