← Ultimi articoli
💻 computer science

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

OmniMate è un framework unificato che consente la generazione di avatar audio-visivi in tempo reale, open-ended, di alta qualità e a bassa latenza, introducendo un Generation Progress Controller per la progressione adattiva della risposta e un Multi-Reference Conditioning Module per garantire la coerenza dell'identità cross-modale a lungo termine.

Autori originali: Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

Pubblicato 2026-07-29
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di parlare con un amico che vive dentro lo schermo di un computer. Vorresti che non solo parlasse, ma che muovesse le mani, sbattesse le palpebre e reagisse alla tua voce in tempo reale, proprio come una persona vera. Questo è il sogno degli "avatar interattivi". Per molto tempo, creare questi personaggi digitali è stato come girare un film: dovevi pianificare ogni battuta e ogni gesto prima di premere "play". Ma recentemente, gli scienziati hanno costruito i "modelli di diffusione", che sono come pennelli magici capaci di creare istantaneamente video e suoni di alta qualità a partire da un testo. Questa tecnologia è diventata così brava da poter far parlare e muovere un personaggio in sincronia con l'audio. Tuttavia, c'è un problema: questi modelli funzionano meglio quando sanno esattamente quanto durerà la conversazione. Se provi ad avere una conversazione fluida in cui il computer deve indovinare quando smettere di parlare e ricominciare ad ascoltare, il personaggio spesso si confonde, continua a parlare troppo a lungo o inizia a sembrare una persona diversa dopo pochi minuti. Questo articolo affronta esattamente questo problema: come creare un amico digitale che possa chiacchierare con te per sempre, senza perdere il suo volto o la sua voce, e senza restare indietro rispetto alle tue parole.

I ricercatori dietro questo progetto, un team della Xi'an Jiaotong University e di China Telecom, hanno costruito un nuovo sistema chiamato OmniMate. Pensa a OmniMate come a un super-intelligente burattinaio digitale capace di gestire una conversazione infinita in tempo reale. A differenza dei sistemi precedenti che potrebbero inciampare quando la conversazione si prolunga o quando l'utente interrompe, OmniMate è progettato per fluire naturalmente, passando istantaneamente dalle modalità di "parlare" a quelle di "ascoltare" mantenendo il personaggio con lo stesso aspetto e la stessa voce.

Il segreto del successo di OmniMate risiede in due astuzie intelligenti che usa per rimanere sul pezzo. Primo, utilizza qualcosa chiamato Generation Progress Controller (GPC). Immagina di leggere un libro di storie, ma di non sapere quante pagine manchino alla fine. Di solito, potresti continuare a leggere oltre la fine o fermarti troppo presto. Il GPC è come un contatore di pagine integrato che dice all'avatar esattamente quanto manca alla generazione della sua risposta. Fornisce al sistema una "barra di avanzamento" per ogni piccolo frammento di video e audio che crea. Questo permette all'avatar di sapere precisamente quando finire una frase e passare fluidamente a una posa di "ascolto", aspettando il tuo prossimo input. Senza questo, l'avatar potrebbe continuare a parlare dopo aver finito, o bloccarsi in modo goffo.

La seconda astuzia è il Multi-Reference Conditioning Module (MRCM). Hai mai notato che se guardi una foto di una persona da un'angolazione strana, questa potrebbe sembrare un po' diversa? Nei video lunghi, gli avatar digitali spesso soffrono di "deriva dell'identità", dove il loro volto cambia lentamente trasformandosi in qualcun altro, o la loro voce cambia tono. OmniMate risolve questo problema ricordando costantemente a se stesso chi è il personaggio. Inveve di guardare solo il primissimo fotogramma del video, mantiene una "banca di memoria" di diverse foto di riferimento e un campione della voce del personaggio. Mentre il video viene riprodotto, controlla costantemente questi riferimenti, come un pittore che guarda indietro verso un ritratto per assicurarsi che il naso e gli occhi siano corretti, garantendo che il personaggio appaia e suoni esattamente lo stesso che stia parlando per 10 secondi o per 10 minuti.

Il team ha testato OmniMate su un benchmark chiamato VerseBench, che simula conversazioni reali. I risultati sono stati impressionanti: il sistema può generare video e audio a una velocità di 27,64 fotogrammi al secondo (FPS), con un "tempo al primo fotogramma" (quanto tempo ci vuole per iniziare a mostrarti il video) di soli 3,49 secondi. Questo è abbastanza veloce da far sentire una conversazione reale e dal vivo. Nei test, OmniMate ha superato altri modelli di punta nel mantenere costante il volto e la voce del personaggio su periodi prolungati. Mentre altri sistemi potrebbero iniziare a sembrare sfocati o cambiare voce dopo un minuto, OmniMate è rimasto stabile anche in test della durata di 240 secondi.

Tuttavia, gli autori tengono presente che il sistema non è ancora perfetto. Se il sistema sbaglia la stima del tempo di risposta, l'avatar potrebbe interrompere una parola o ripetersi. Inoltre, se il personaggio deve fare qualcosa che cambia drasticamente il suo aspetto, come un grande cambio di costume, il sistema potrebbe faticare a mantenere la coerenza dell'identità. Ma in generale, OmniMate suggerisce un grande passo avanti: un modo per avere amici digitali che possano chiacchierare con noi in tempo reale, ricordare chi sono e reagire a noi senza i glitch goffi del passato. Trasforma i video statici e pre-pianificati di oggi in conversazioni dinamiche e vive per il domani.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →