Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation
El artículo presenta Aero Realtime, un modelo multimodal de transmisión de 4B que logra una interacción de entrada-salida dúplex totalmente alineada en una rejilla temporal compartida, permitiendo una generación proactiva de baja latencia con reutilización eficiente de la caché KV y un retraso de procesamiento inferior a 200 ms.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando tener una conversación con un amigo que también está viendo una película contigo. En un chat normal, esperas a que termine una frase antes de hablar. Pero en una conversación verdaderamente natural, podrías interrumpirlo con un rápido "¡Guau!" mientras todavía está hablando, o podrías quedarte en silencio mientras explica un punto complejo de la trama, solo para intervenir en el segundo exacto en que comprendes algo nuevo. Este es el santo grial de la interacción en "tiempo real": la capacidad de escuchar y hablar al mismo tiempo sin perder el ritmo.
Durante mucho tiempo, las computadoras han sido terribles en esto. La mayoría de los modelos de IA funcionan como un juego de "la papa caliente" muy educado, pero ligeramente lento. Esperan a que termines toda tu historia (la entrada), la procesan toda a la vez, y luego comienzan a hablar (la salida). No pueden realmente "escuchar" mientras están "hablando". Si intentas introducir nueva información mientras están a mitad de una frase, se confunden o tienen que detenerse y reiniciar. Este artículo aborda el problema de construir una IA que sea verdaderamente "dúplex": capaz de oír cosas nuevas y decir cosas nuevas simultáneamente, tal como lo hace un humano, todo mientras sigue el ritmo de una transmisión de video de movimiento rápido.
Los investigadores detrás de este artículo, de la Universidad de Hong Kong y otras instituciones, han construido un nuevo modelo de IA llamado Aero Realtime. Piensa en él como un modelo que no solo habla en frases, sino en pequeños y rítmicos "pulsos" de tiempo. En lugar de esperar a que un video termine, Aero Realtime descompone el tiempo en diminutos fragmentos de 80 milisegundos. Por cada fragmento de audio que escucha, tiene que tomar una decisión en una fracción de segundo: "¿Debería decir una palabra justo ahora, o debería quedarme en silencio?".
Este es un cambio enorme respecto a cómo funcionan otros modelos. Usualmente, una IA tiene que terminar su fase de "pensamiento" antes de comenzar su fase de "habla". Aero Realtime hace ambas cosas a la vez. Alinea el video, el audio y sus propias palabras en una línea de tiempo única y compartida. Imagina una cinta transportadora donde cada 80 milisegundos llega una nueva pieza de video y audio. En ese mismo instante, la IA decide si deja caer una palabra sobre la cinta o si deja un "token de silencio" (un marcador de posición para estar callado). Esto permite que la IA siga escuchando nuevas partes del video incluso mientras está en medio de la generación de una oración. Nunca detiene el flujo para "ponerse al día".
El artículo argumenta que los intentos previos de hacer que la IA fuera "proactiva" (lista para hablar) eran torpes. Algunos sistemas utilizaban un método de "micro-turno", donde la IA se detenía constantemente para preguntarse a sí misma: "¿Debería hablar ahora?". Esto es como un conductor que se detiene en cada intersección para revisar un mapa antes de avanzar. Otros utilizaron "puertas" o interruptores externos para decidir cuándo hablar, lo que complicaba el sistema y lo hacía lento. Aero Realtime rechaza estos métodos. En su lugar, aprende el ritmo de forma natural. El modelo es entrenado para tratar el "silencio" como una palabra válida, igual que "hola" o "gato". Esto significa que la IA no necesita un interruptor separado para decidir cuándo hablar; la decisión de hablar o quedarse callado está integrada directamente en el mismo proceso que elige las palabras.
Para que esto funcionara, el equipo tuvo que resolver acertijos de ingeniería complicados. Crearon una forma especial de entrenar el modelo utilizando una mezcla de datos de video en tiempo real y preguntas de video estándar. También diseñaron una nueva forma de ejecutar el modelo en computadoras que ahorra memoria y velocidad. En lugar de volver a leer todo el video cada vez que llega un nuevo fotograma, el modelo recuerda lo que ya procesó y solo añade la nueva "rebanada" de información. Esto es como leer un libro donde no tienes que volver a leer el primer capítulo cada vez que pasas la página; simplemente recuerdas dónde te quedaste y sigas adelante.
Los resultados son impresionantes para un modelo de su tamaño. Los investigadores probaron Aero Realtime en una transmisión de video continua de 20 minutos. Incluso mientras el video se reproducía, el modelo logró mantener su "lag" —el retraso entre lo que sucede en el video y lo que la IA dice— en una mediana de 84 milisegundos. Eso es menos que un parpadeo. Incluso en el percentil 95 (lo que significa que el 95% del tiempo), el retraso fue de solo 173 milisegundos. Esto significa que la IA se mantiene dentro de los 200 milisegundos de la línea de tiempo "real", escuchando y hablando efectivamente en tiempo real.
Sin embargo, el artículo tiene cuidado de no afirmar que este es el mejor IA del mundo en cuanto a comprensión de video. Cuando fue probado en un benchmark estándar llamado OVOBench, el modelo de 4 mil millones de parámetros (que es relativamente pequeño) obtuvo una buena puntuación, pero no superó a los modelos de 7 mil millones de parámetros más grandes y potentes que están diseñados para tareas de procesamiento fuera de línea (offline) y no en tiempo real. Los autores sugieren que esta brecha existe porque el modelo tuvo que aprender una forma completamente nueva de interactuar (el estilo "dúplex") y no tuvo tanta información de entrenamiento específica para este tipo exacto de conversación en tiempo real como los modelos antiguos la tuvieron para las preguntas tradicionales.
En resumen, Aero Realtime demuestra que es posible construir una IA que no solo espera su turno para hablar, sino que puede conversar verdaderamente en tiempo real, escuchando y hablando simultáneamente sin despeinarse. Es un paso hacia una IA que se siente menos como un robot esperando instrucciones y más como un amigo que realmente está prestando atención al mundo contigo. Aunque aún no es el experto en video más inteligente de la sala, es el primero en dominar verdaderamente el arte de seguir el ritmo del tiempo.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.