Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars
Avatar-Forever is een ontkoppeld parallel trainingsframework dat volledige-parameter distillatie combineert voor hoge visuele kwaliteit met een lichtgewicht lange-horizon adapter getraind via Recovery-oriented Rollout Training, wat stabiele, real-time, oneindige audio-gestuurde avatar-generatie mogelijk maakt op een enkele H100 GPU.
Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin je kunt praten met een digitale vriend die er precies zo uitziet en beweegt en spreekt als een echt persoon, voor altijd. Dit is niet alleen een droom uit een sciencefictionfilm; het is het doel van een vakgebied genaamd visual computing, waar wetenschappers computers leren om bewegende beelden te begrijpen en te creëren. Om dit te doen, gebruiken onderzoekers AI-modellen—massieve digitale breinen die getraind zijn op miljoenen video's—om te leren hoe mensen eruitzien en bewegen. Een belangrijke uitdaging in dit veld is streaming video generatie. Denk aan een estafette: de computer genereert een paar seconden video, gebruikt dat resultaat vervolgens als het startpunt voor de volgende paar seconden, enzovoort. Het probleem is dat als de computer een kleine fout maakt in de eerste paar seconden, die fout wordt doorgegeven aan de volgende lijn, waarbij de fout steeds groter en vreemder wordt bij elke stap, totdat de digitale persoon begint te smelten of vergeet wie hij is. Dit artikel pakt de hoofdpijn aan van het perfect houden van deze digitale mensen en het laten natuurlijk overkomen, zelfs wanneer ze urenlang zonder te stoppen praten.
De onderzoekers achter Avatar-Forever realiseerden zich dat proberen dit "estafette"-probleem op te lossen met de oude methoden leek op het proberen te leren aan een student om snel te rennen en tegelijkertijd nooit te struikelen met behulp van één enkele, verwarrende lesopbouw. De oude manier probeerde twee zeer verschillende doelen in één trainingsproces te persen: de video-generatie super snel maken (zodat het echt aanvoelt in real-time) en het super robuust maken (zodat het niet na een minuut uit elkaar valt). De auteurs stellen dat deze twee doelen elkaar eigenlijk tegenwerken. Als je te veel focust op snelheid, wordt de video schokkerig; als je te veel focust op het herstellen van fouten, wordt het te traag.
Dus, in plaats van de computer te dwingen beide vaardigheden tegelijkertijd te leren, splitst Avatar-Forever de training op in twee aparte, parallelle klassen. Stel je een digitale sportschool voor met twee verschillende banen. Op de eerste baan, de Efficiency Branch, oefent de AI een sprint. Het leert om hoogwaardige video te genereren in slechts een paar stappen, met de focus puur op snelheid en er goed uitzien op de korte termijn. Op de tweede baan, de Robustness Branch, oefent de AI een andere vaardigheid: herstel. Hier verstoren de onderzoekers het startpunt van de AI opzettelijk—door het beeld te vervagen, ruis toe te voegen of delen van het gezicht te verbergen—en vragen de AI vervolgens om de volgende paar seconden video te genereren, ongeacht wat er gebeurt. Dit wordt Recovery-oriented Rollout Training (RRT) genoemd. Het is alsof je een turner leert een perfecte achterwaartse salto te doen, zelfs als hij op de eerste stap struikelt. De AI leert zijn eigen fouten te herstellen terwijl ze gebeuren, in plaats van alleen maar te hopen dat ze niet voorkomen.
Zodra de AI op beide banen heeft getraind, combineren de onderzoekers de twee vaardigheden. Ze nemen de snelle loper en de herstelexpert en voegen hen samen tot één superatleet. Deze nieuwe avatar kan video genereren in real-time en is tegelijkertijd robuust genoeg om urenlang te praten zonder zijn identiteit of zijn beheersing te verliezen. Om het nog sneller te maken, introduceerden ze een slimme truc genaamd ForeverCache. Normaal gesproken moet de AI, elke keer dat hij een nieuw deel van de video genereert, de hele geschiedenis van wat hij net heeft gemaakt opnieuw lezen, wat is als het elke keer dat je een nieuwe zin schrijft, een heel boek opnieuw lezen. ForeverCache is als een slim bladwijzer; het onthoudt de stabiele delen van het verhaal (de achtergrond, het gezicht van de persoon), zodat de AI ze niet elke keer opnieuw hoeft te berekenen. Het focust alleen op de nieuwe woorden die op dit moment worden geschreven.
De resultaten zijn indrukwekkend. Gebouwd op een massief 22-miljard parameter video-fundamentmodel, kan Avatar-Forever hoogwaardige video's (768 × 512 pixels) genereren met 27,2 frames per seconde op een enkele krachtige H100 graphics kaart. Dat is snel genoeg voor interactie in real-time. In tests slaagde het systeem erin om een digitale avatar meer dan 11 minuten natuurlijk te laten praten zonder dat het gezicht smolt, de stem afweek of de bewegingen robotachtig werden. Terwijl andere methoden na verloop van tijd begonnen te vertonen van "identiteitsdrift" (waarbij de persoon eruitziet als een ander persoon) of repetitieve, stijve gebaren, hield Avatar-Forever het karakter consistent en de beweging vloeiend. Het team maakte ook een volledig synthetische dataset om het model te trainen, wat betekent dat ze de trainingsvideo's zelf hebben gegenereerd met behulp van AI om perfecte kwaliteit en afstemming te garanderen, waardoor de rommeligheid van echte internetvideo's wordt vermeden.
Het artikel suggereert dat deze "split-track"-benadering een betere manier is om langdurige digitale mensen te bouwen dan de oude, verstrengelde methoden. Door de behoefte aan snelheid te scheiden van de behoefte aan stabiliteit, hebben de onderzoekers een praktisch pad gevonden naar het creëren van digitale mensen die ons onbepaald lang kunnen onderwijzen, of entertainen, zonder de digitale glitches die de illusie normaal gesproken verruïneren. Hoewel het systeem momenteel geoptimaliseerd is voor krachtige servers en nog niet voor thuiscomputers, opent het de deur naar een toekomst waarin onze digitale metgezellen zo lang als we ze nodig hebben bij ons kunnen zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.