← Últimos artículos
💻 computer science

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

OmniMate es un marco unificado que permite la generación de avatares audiovisuales de transmisión en tiempo real, de alta calidad y baja latencia, con un final abierto, mediante la introducción de un Controlador de Progreso de Generación para la progresión de respuesta adaptativa y un Módulo de Condicionamiento de Referencia Múltiple para asegurar la consistencia de identidad transmodal a largo plazo.

Autores originales: Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

Publicado 2026-07-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás hablando con un amigo que vive dentro de la pantalla de una computadora. Quieres que no solo hable, sino que mueva las manos, parpadee y reaccione a tu voz en tiempo real, tal como una persona real. Este es el sueño de los "avatares interactivos". Durante mucho tiempo, crear estos personajes digitales era como filmar una película: tenías que planificar cada línea y cada gesto antes de poder presionar "play". Pero recientemente, los científicos han construido "modelos de difusión", que son como pinceles mágicos que pueden crear instantáneamente videos y sonidos de alta calidad a partir de texto. Esta tecnología se ha vuelto tan buena que ahora puede hacer que un personaje hable y se mueva en sincronía con el audio. Sin embargo, hay un inconveniente: estos modelos suelen funcionar mejor cuando saben exactamente cuánto durará la conversación. Si intentas tener una charla fluida donde la computadora tiene que adivinar cuándo dejar de hablar y empezar a escuchar de nuevo, el personaje suele confundirse, sigue hablando demasiado tiempo o empieza a parecer una persona diferente después de unos minutos. Este artículo aborda exactamente ese problema: cómo crear un amigo digital que pueda charlar contigo para siempre, sin perder su rostro o su voz, y sin quedarse atrás de tus palabras.

Los investigadores detrás de este proyecto, un equipo de la Universidad de Xi'an Jiaotong y China Telecom, han construido un nuevo sistema llamado OmniMate. Piensa en OmniMate como un titiritero digital súper inteligente que puede manejar una conversación interminable en tiempo real. A diferencia de sistemas anteriores que podrían tropezar cuando la conversación se vuelve larga o cuando el usuario interrumpe, OmniMate está diseñado para fluir naturalmente, cambiando instantáneamente entre los modos de "hablar" y "escuchar" mientras mantiene al personaje viéndose y sonando exactamente igual.

El secreto del éxito de OmniMate reside en dos trucos ingeniosos que utiliza para mantenerse alerta. Primero, utiliza algo llamado Controlador de Progreso de Generación (GPC). Imagina que estás leyendo un libro de cuentos, pero no sabes cuántas páginas quedan. Normalmente, podrías seguir leyendo más allá del final o detenerte demasiado pronto. El GPC es como un contador de páginas integrado que le dice al avatar exactamente cuánto le queda por generar de su respuesta. Le da al sistema una "barra de progreso" para cada pequeño fragmento de video y audio que crea. Esto permite que el avatar sepa precisamente cuándo terminar una frase y cambiar suavemente de nuevo a una pose de "escucha", esperando tu siguiente entrada. Sin esto, el avatar podría seguir hablando después de haber terminado, o congelarse de manera incómoda.

El segundo truque es el Módulo de Condicionamiento de Referencia Múltiple (MRCM). ¿Alguna vez has notado que si miras una foto de una persona desde un ángulo extraño, puede que se vea un poco diferente? En videos largos, los avatares digitales suelen sufrir de "deriva de identidad", donde su rostro se transforma lentamente en el de otra persona, o su voz cambia de tono. OmniMate resuelve esto recordándole constantemente quién es el personaje. En lugar de mirar solo el primer fotograma del video, mantiene un "banco de memoria" de varias fotos de referencia y una muestra de la voz del personaje. Mientras el video se reproduce, consulta constantemente estas referencias, como un pintor que mira de reojo un retrato para asegurarse de que la nariz y los ojos sigan siendo correctos, garantizando que el personaje se vea y suene igual ya sea que esté hablando durante 10 segundos o 10 minutos.

El equipo probó OmniMate en un benchmark llamado VerseBench, que simula conversaciones reales. Los resultados fueron impresionantes: el sistema puede generar video y audio a una velocidad de 27.64 fotogramas por segundo (FPS), con un "tiempo hasta el primer fotograma" (cuánto tarda en mostrarte el video) de solo 3.49 segundos. Esto es lo suficientemente rápido como para sentirse como una conversación real y en vivo. En las pruebas, OmniMate superó a otros modelos destacados en mantener la consistencia del rostro y la voz del personaje durante periodos largos. Mientras que otros sistemas podrían empezar a verse borrosos o cambiar su voz después de un minuto, OmniMate se mantuvo estable incluso en pruebas que duraron hasta 240 segundos.

Sin embargo, los autores advierten cuidadosamente que el sistema aún no es perfecto. Si el sistema adivina incorrectamente la cantidad de tiempo para una respuesta, el avatar podría cortar una palabra o repetirse a sí mismo. Además, si el personaje necesita hacer algo que cambie drásticamente su apariencia, como un gran cambio de vestuario, el sistema podría tener dificultades para mantener la consistencia de la identidad. Pero, en general, OmniMate sugiere un gran paso adelante: una forma de tener amigos digitales que puedan charlar con nosotros en tiempo real, recordar quiénes son y reaccionar a nosotros sin los fallos incómodos del pasado. Transforma los videos estáticos y pre-planificados de hoy en conversaciones dinámicas y vivas para el mañana.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →