← Ultimi articoli
💻 computer science

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer è un framework di post-training che abilita lo streaming in tempo reale di testo-in-audio-video a lungo formato combinando un generatore causale addestrato con strategie di forcing miste, la distillazione DMD per la stabilità a lungo orizzonte e un modello linguistico esterno per la pianificazione del parlato al fine di ottenere una generazione di avatar ad alta velocità, sincronizzata e coerente.

Autori originali: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

Pubblicato 2026-08-07
📖 3 min di lettura☕ Lettura da pausa caffè

Autori originali: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di insegnare a un robot come raccontare una storia. Vuoi che parli, muova le labbra e cambi le espressioni facciali, tutto contemporaneamente, proprio come una persona reale. Per molto tempo, i migliori robot potevano farlo solo per brevi clip, come un saluto di 5 secondi. Lavoravano come un regista che guarda l'intero copione prima di filmare una scena, guardando avanti per vedere cosa succederà dopo. Ma nel mondo reale, non abbiamo il tempo di aspettare che l'intera storia sia scritta prima di iniziare a parlare. Abbiamo bisogno che il robot parli ora, basandosi solo su ciò che ha detto finora, mantenendo al contempo il viso e la voce perfettamente sincronizzati. Questa è la sfida dello "streaming in tempo reale". Il problema è che se un robot commette un piccolo errore nel primo secondo, quell'errore può accumularsi nel tempo, facendo apparire il volto del robot strano o facendo sì che la sua voce si discosti dall'argomento verso la fine della conversazione. Gli scienziati hanno cercato di capire come far parlare questi avatar digitali per minuti interi senza perdere la testa o il ritmo.

Entra in scena Vorch-Streamer, un nuovo sistema che agisce come un narratore super organizzato in tempo reale. Invece di cercare di memorizzare l'intero copione prima di parlare, Vorch-Streamer utilizza una strategia intelligente in due parti per mantenere lo spettacolo attivo per oltre due minuti senza fermarsi. Immaginalo come una band che suona una lunga sessione di improvvisazione. Di solito, se un musicista suona una nota sbagliata, il resto della canzone potrebbe diventare disordinato. Ma Vorch-Streamer ha una speciale modalità "prova". Prima, pratica l'esecuzione di brevi segmenti venendo gentilmente corretto da un insegnante (un modello pre-addestrato che sa come farlo perfettamente). Poi, pratica l'esecuzione dell'intera canzone dall'inizio alla fine, ma questa volta, ascolta i propri errori precedenti e impara come correggerli al volo, il tutto mentre un "direttore d'orchestra" (un pianificatore IA) gli dice esattamente quali parole dire dopo.

Il risultato è un avatar digitale in grado di generare video e audio simultaneamente a 27,12 fotogrammi al secondo (FPS). Per dare un termine di paragone, un video standard viene riprodotto a 24 FPS, il che significa che questo robot è effettivamente più veloce del tempo reale! Può mantenere il suo volto con l'aspetto della stessa persona, le sue labbra che si muovono in perfetto tempo con le sue parole e la sua voce chiara e accurata per quasi due minuti consecutivi. I ricercatori hanno scoperto che senza un passaggio specifico di "pianificazione" per decidere cosa dire dopo, il robot si confonderebbe e inizierebbe a parlare in modo sconclusionato o a ripetersi. Aggiungendo questo pianificatore, il sistema risolve con successo l'enigma di come mantenere una lunga conversazione fluida senza dover vedere il futuro. Dimostra che puoi prendere un robot potente e lento che conosce tutto di una storia e trasformarlo in un interprete veloce e dal vivo che sa quel tanto che basta per far andare avanti lo spettacolo, un secondo alla volta.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →