← Ultimi articoli
🤖 AI

Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation

Il documento presenta Aero Realtime, un modello multimodale in streaming da 4B che raggiunge un'interazione input-output duplex e completamente allineata su una griglia temporale condivisa, consentendo una generazione proattiva a bassa latenza con un riutilizzo efficiente della KV-cache e un ritardo di elaborazione inferiore a 200ms.

Autori originali: Kaichen Zhang, Wei Huang, Keming Wu, Bo Li, Xiaojuan Qi

Pubblicato 2026-08-11
📖 5 min di lettura🧠 Approfondimento

Autori originali: Kaichen Zhang, Wei Huang, Keming Wu, Bo Li, Xiaojuan Qi

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di avere una conversazione con un amico che sta guardando un film con te. In una chat normale, aspetti che finisca una frase prima di parlare. Ma in una conversazione davvero naturale, potresti interromperlo con un rapido "Wow!" mentre sta ancora parlando, oppure potresti rimanere in silenzio mentre spiega un complesso punto della trama, per poi intervenire l'esatto secondo in cui comprendi qualcosa di nuovo. Questo è il santo graal dell'interazione "in tempo reale": la capacità di ascoltare e parlare contemporaneamente senza perdere il ritmo.

Per molto tempo, i computer sono stati terribili in questo. La maggior parte dei modelli AI lavora come un gioco di "patata bollente" molto educato, ma leggermente lento. Aspettano che tu finisca tutta la tua storia (l'input), la elaborano tutta in una volta e poi iniziano a parlare (l'output). Non possono davvero "ascoltare" mentre stanno "parlando". Se provi a dare loro nuove informazioni mentre sono a metà di una frase, si confondono o devono fermarsi e ricominciare da capo. Questo articolo affronta il problema della costruzione di un'IA che sia veramente "duplex" — capace di sentire nuove cose e dire nuove cose simultaneamente, proprio come fa un essere umano, il tutto mantenendo il passo con un flusso video in rapido movimento.

I ricercatori dietro questo articolo, provenienti dall'Università di Hong Kong e da altre istituzioni, hanno costruito un nuovo modello di IA chiamato Aero Realtime. Pensatelo come a un modello che non parla solo in frasi, ma in piccoli "battiti" ritmici di tempo. Invece di aspettare che un intero video finisca, Aero Realtime suddivide il tempo in minuscoli frammenti di 80 millisecondi. Per ogni singolo frammento di audio che sente, deve prendere una decisione in una frazione di secondo: "Dovrei dire una parola proprio ora, o dovrei stare in silenzio?".

Questo è un enorme cambiamento rispetto al modo in cui lavorano gli altri modelli. Di solito, un'IA deve finire la sua fase di "pensiero" prima di iniziare la sua fase di "parlato". Aero Realtime fa entrambe le cose contemporaneamente. Allinea il video, l'audio e le proprie parole su un unico timeline condiviso. Immaginate un nastro trasportatore dove ogni 80 millisecondi arriva un nuovo pezzo di video e audio. Allo stesso momento, l'IA decide se far cadere una parola sul nastro o far cadere un "token di silenzio" (un segnaposto per stare zitti). Questo permette all'IA di continuare ad ascoltare le nuove parti del video anche mentre è nel mezzo della generazione di una frase. Non interrompe mai il flusso per "recuperare".

L'articolo sostiene che i precedenti tentativi di rendere l'IA "proattiva" (pronta a parlare) fossero goffi. Alcuni sistemi usavano un metodo a "micro-turno", in cui l'IA si chiedeva costantemente: "Dovrei parlare ora?". Questo è come un conducente che si ferma a ogni singola intersezione per controllare la mappa prima di procedere. Altri usavano "cancelli" o interruttori esterni per decidere quando parlare, il che complicava il sistema e lo rendeva lento. Aero Realtime rifiuta questi metodi. Invece, impara il tempismo in modo naturale. Il modello è addestrato a trattare il "silenzio" come una parola valida, proprio come "ciao" o "gatto". Ciò significa che l'IA non ha bisogno di un interruttore separato per decidere quando parlare; la decisione di parlare o stare zitti è integrata direttamente nello stesso processo che sceglie le parole.

Per far sì che ciò funzionasse, il team ha dovuto risolvere alcuni complicati enigmi ingegneristici. Hanno creato un modo speciale per addestrare il modello utilizzando un mix di dati video in tempo reale e domande video standard. Hanno anche progettato un nuovo modo per eseguire il modello su computer che risparmia memoria e velocità. Invece di rileggere tutto il video ogni volta che arriva un nuovo fotogramma, il modello ricorda ciò che ha già elaborato e aggiunge solo la nuova "fetta" di informazione. Questo è come leggere un libro in cui non devi rileggere il primo capitolo ogni volta che giri pagina; semplicemente ricordi dove avevi interrotto e continui ad andare avanti.

I risultati sono impressionanti per un modello delle sue dimensioni. I ricercatori hanno testato Aero Realtime su uno stream video continuo di 20 minuti. Anche mentre il video veniva riprodotto, il modello è riuscito a mantenere il suo "lag" — il ritardo tra ciò che accade nel video e ciò che l'IA sta dicendo — a una mediana di 84 millisecondi. Questo è meno di un battito di ciglia. Anche al 95° percentile (il che significa che il 95% del tempo), il ritardo era di soli 173 millisecondi. Ciò significa che l'IA rimane entro i 200 millisecondi della linea temporale "reale", ascoltando e parlando efficacemente in tempo reale.

Tuttavia, l'articolo è attento a non sostenere di essere l'IA migliore del mondo nel comprendere i video. Quando testato su un benchmark standard chiamato OVOBench, il modello da 4 miliardi di parametri (relativamente piccolo) ha ottenuto buoni punteggi, ma non ha battuto i modelli più grandi e potenti da 7 miliardi di parametri, che sono progettati per compiti offline e non in tempo reale. Gli autori suggeriscono che questo divario esista perché il modello ha dovuto imparare un modo completamente nuovo di interagire (lo stile "duplex") e non aveva la stessa quantità di dati di addestramento specifici per questo esatto tipo di conversazione in tempo reale di quanto non avessero i modelli più vecchi per le domande tradizionali.

In breve, Aero Realtime dimostra che è possibile costruire un'IA che non si limita ad aspettare il proprio turno per parlare, ma può davvero conversare in tempo reale, ascoltando e parlando simultaneamente senza sforzo. È un passo verso un'IA che sembra meno un robot in attesa di istruzioni e più un amico che sta prestando davvero attenzione al mondo insieme a te. Sebbene non sia ancora l'esperto di video più intelligente nella stanza, è il primo a padroneggiare davvero l'arte di tenere il passo con il flusso del tempo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →