Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
Questo articolo introduce Live Avatar, un framework algoritmo-sistema co-progettato che abilita la prima generazione in streaming pratica, in tempo reale e a lunghezza infinita di avatar guidati dall'audio da 14 miliardi di parametri, combinando una pipeline di diffusione causale distillata con la Timestep-forcing Pipeline Parallelism per raggiungere 45 FPS ed eliminare la deriva dell'identità a lungo termine.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di voler insegnare a un robot come raccontare una storia. Vuoi che parli, muova le labbra e cambi le espressioni facciali in perfetta sincronia con la tua voce, il tutto con l'aspetto di un vero essere umano. Questo è il mondo della generazione di avatar guidati dall'audio. Per molto tempo, gli scienziati hanno costruito "attori digitali" utilizzando un tipo di IA chiamata modello di diffusione. Pensa a un modello di diffusione come a uno scultore che parte da un blocco di rumore statico e lentamente scava via il rumore per rivelare una statua perfetta. Di solito, questo scultore lavora in un ordine molto rigido: deve finire la testa prima di poter iniziare il corpo, e deve farlo passo dopo passo, il che richiede molto tempo.
Il grande problema è che se chiedi a questo robot di raccontare una storia per un'ora, tende a confondersi. Potrebbe dimenticare l'aspetto del volto del personaggio di cinque minuti fa, o la sua voce potrebbe iniziare a sembrare quella di una persona completamente diversa. Questo si chiama "drift" (deriva). Inoltre, poiché lo scultore lavora molto lentamente, non puoi avere una conversazione in tempo reale con lui; nel momento in cui finisce una frase, hai già dimenticato ciò che hai detto. L'obiettivo per i ricercatori è stato costruire un attore digitale che sia abbastanza veloce da parlare con te dal vivo, abbastanza intelligente da mantenere la propria identità per ore e abbastanza dettagliato da apparire fotorealistico.
Entra in scena Live Avatar, un nuovo progetto che agisce come un maestro direttore d'orchestra per una massiccia orchestra di chip informatici. I ricercatori dietro questo lavoro, guidati da team dell'Università di Scienza e Tecnologia della Cina e di Alibaba, hanno capito come far parlare, muovere e trasmettere video in tempo reale a un enorme modello di IA da 14 miliardi di parametri (un modello "14B", che è enorme nel mondo dell'IA) senza perdere la ragione.
Di solito, creare un video così lungo e così veloce è una contraddizione. Puoi avere la velocità o puoi avere la qualità, ma non entrambe le cose. Live Avatar risolve questo problema cambiando il modo in cui l'IA "pensa" al tempo e alla memoria. Invece di cercare di ricordare ogni singolo dettaglio perfetto del passato (il che causa confusione e deriva nell'IA), il sistema memorizza una memoria "rumorosa". Immagina di cercare di ricordare una canzone intonando approssimativamente la melodia piuttosto che cercare di ricordare ogni singola nota perfettamente. Questa memoria "approssimativa" agisce come un filtro, mantenendo stabile il volto del personaggio pur permettendo alla bocca di muoversi naturalmente.
Il team ha anche inventato un modo intelligente per velocizzare le cose chiamato Timestep-forcing Pipeline Parallelism. Immagina una catena di montaggio in una fabbrica dove, invece di avere un singolo operaio che esegue ogni passaggio della costruzione di un'auto, hai una squadra di operai. In un normale' IA video, ogni operaio aspetta che il precedente finisca prima di poter iniziare. Live Avatar cambia le regole: ogni operaio sulla linea (o ogni chip informatico, noto come GPU) è assegnato a una fase specifica. Mentre l'Operaio A sta lucidando le ruote, l'Operaio B sta verniciando la portiera e l'Operaio C sta installando il motore, tutti nello stesso momento. Questo trasforma un processo lento e sequenziale in uno veloce e parallelo.
I risultati sono impressionanti. Su una configurazione con 5 potenti schede grafiche H100, Live Avatar può generare video a 45 fotogrammi al secondo (FPS), che è più veloce della velocità della visione umana. Impiega solo 1,21 secondi per iniziare a generare il primo fotogramma dopo che hai parlato. Cosa più importante, può continuare all'infinito. I ricercatori lo hanno testato facendo parlare l'avatar per oltre 10.000 secondi (quasi tre ore di fila), e il personaggio non ha subito derive, non ha avuto glitch e non ha perso la propria identità.
Questa non è solo una vittoria teorica; il team ha costruito un nuovo campo di prova chiamato GenBench per dimostrare che altri metodi falliscono durante le lunghe durate mentre il loro ha successo. Hanno scoperto che, mentre altri sistemi possono sembrare buoni per alcuni secondi, iniziano a degradare, cambiare colori o perdere il volto della persona dopo pochi minuti. Live Avatar, invece, rimane costante. Ciò suggerisce che combinando una strategia di memoria "rumorosa" con un sistema di catena di montaggio intelligente, possiamo finalmente avere esseri umani digitali pronti per conversazioni in tempo reale e infinite.
L'articolo esclude esplicitamente l'idea che sia necessario addestrare l'IA su ore di video per farla funzionare per ore. Al contrario, hanno dimostrato che l'addestramento su brevi clip (circa 3 secondi) è sufficiente, a patto di utilizzare il loro speciale trucco della "storia rumorosa". Sostengono anche contro la vecchia convinzione secondo cui bisogna scegliere tra un modello veloce e di bassa qualità e uno lento e di alta qualità. Con il loro metodo, si può avere un modello enorme e di alta qualità che gira in tempo reale.
Sebbene il sistema sia incredibilmente veloce, gli autori notano che c'è ancora un piccolo ritardo. Il tempo che intercorre tra quando parli e quando il video appare sullo schermo è di circa 3 secondi includendo il tempo di viaggio della rete. Questo è abbastanza veloce per molte interazioni, ma potrebbe non essere del tutto sufficiente per una conversazione fluida faccia a faccia dove ogni millisecondo conta. Tuttavia, per lo streaming, gli assistenti virtuali e lo storytelling digitale, questo è un enorme passo avanti, suggerendo che l'era degli avatar digitali infiniti e in tempo reale non è più solo un sogno.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.