← Últimos artículos
💻 computer science

Video = World + Event Stream

El artículo presenta Wan-Streamer v0.3, un modelo de interacción audiovisual en tiempo real que plantea el video como una combinación de un "mundo" persistente y un "flujo de eventos" dinámico para permitir la predicción de baja latencia de cambios ambientales y comportamientos de agentes con propósito general.

Autores originales: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zh
Publicado 2026-07-20
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo una película, pero en lugar de simplemente sentarte a observar, estás dentro de la escena, hablando con los personajes y ellos te responden de vuelta instantáneamente. Este es el emocionante mundo de la inteligencia artificial en tiempo real, donde las computadoras intentan comprendernos y respondernos tan rápido como lo haría un amigo humano. Para lograr esto, la IA necesita hacer malabares con tres cosas a la vez: lo que ve (video), lo que oye (audio) y lo que dice o hace (texto y acciones). Durante mucho tiempo, hacer que la IA hiciera todo esto sin retrasos fue como intentar correr un maratón cargando una mochila pesada; era lento y torpe. La gran pregunta que los investigadores se han estado haciendo es: ¿Cómo podemos enseñar a una IA a entender el "escenario" en el que está y la "acción" que ocurre en él, para que pueda reaccionar de forma natural e instantánea?

Entra en escena Wan-Streamer v0.3, una nueva creación del Equipo Wan de Alibaba Group. Piensa en este artículo como una receta ingeniosa para un actor digital súper rápido y súper inteligente. Los autores se dieron cuenta de que, en lugar de tratar un video como un gran y confuso caos de píxeles cambiantes, podemos descomponerlo en dos partes simples: un Mundo y un Flujo de Eventos. El "Mundo" es lo estable: la habitación en la que te encuentras, los muebles, el rostro de la persona y el ruido de fondo. No cambia mucho. El "Flujo de Eventos" es todo lo que cambia: la persona caminando, hablando, saludando o el coche pasando de largo. Al enseñar a la IA que un video es solo un "Mundo" más un "flujo de eventos", descubrieron una forma de hacer que la IA sea mucho más inteligente y rápida al predecir qué sucede después.

La Gran Idea: El Escenario y la Obra

El artículo propone una nueva forma de ver el video. Imagina un teatro. El Mundo es la escenografía: el telón de fondo pintado, la iluminación, la utilería y el vestuario del actor. Una vez que comienza la obra, estas cosas permanecen casi iguales. El Flujo de Eventos es la obra en sí: el actor cruzando el escenario, gritando una línea, dejando caer un objeto o dándose la vuelta.

En el pasado, los modelos de IA intentaban aprender toda la obra y toda la escenografía al mismo tiempo, lo cual era difícil. Wan-Streamer v0.3 sugiere un truco más simple: enseña a la IA la escenografía una vez, y luego enfócate solo en la obra.

Los investigadores entrenaron su modelo con una cantidad masiva de videos del mundo real. No solo le pidieron a la IA que adivinara el siguiente fotograma; le enseñaron a mirar un "Mundo" (como una calle suburbana soleada o un gallinero) y luego predecir el "Flujo de Eventos" (como un robot corriendo por la calle o una mujer alimentando pollos). El modelo aprendió que si un robot está en una acera, podría correr hacia un coche, abrir la puerta y alejarse conduciendo. Si una mujer está en un gallinero, podría caminar hacia un cubo y recoger alimento. Al aprender estos patrones, la IA construye un "conocimiento del mundo" sobre cómo las cosas se mueven y cambian de manera plausible.

El Truco de Magia: Hablar y Actuar al Mismo Tiempo

Entonces, ¿qué hace esto realmente? El equipo probó esta idea en una interacción audiovisual de tiempo real y dúplex completo. "Dúplex completo" es una forma elegante de decir que la IA puede hablar y escuchar al mismo tiempo, tal como en una conversación real, sin esperar a que termines.

En esta nueva versión (v0.3), el agente de IA no es solo una cabeza parlante. Ahora puede realizar comportamientos de forma libre.

  • Forma antigua: La IA podría simplemente asentir o mirarte mientras habla.
  • Nueva forma: La IA puede decir: "(toma una taza de café y toma un sorbo) Gracias por el recordatorio", o "(frunce el ceño ligeramente) ¿A qué te referías con eso?".

El artículo explica que la IA escribe su respuesta en un formato especial de "juego de roles". Mezcla palabras habladas con acciones escritas entre paréntesis. Debido a que la IA ha aprendido el "Mundo" (el entorno y el personaje), sabe que si dice "(toma una taza)", el generador de video realmente mostrará al personaje tomando una taza que encaja con la escena. Esto sucede en tiempo real, y el habla, la acción y el video se mantienen perfectamente sincronizados.

La Velocidad: Lo suficientemente Rápido para Parecer Real

Una de las partes más impresionantes de este artículo es que no sacrificaron la velocidad por esta nueva inteligencia. Los autores demuestran que Wan-Streamer v0.3 mantiene el mismo rendimiento ultrarrápido que su versión anterior (v0.2).

  • Calidad de Video: Sigue produciendo video a una resolución de 640×368.
  • Fluidez: Funciona a 25 FPS (fotogramas por segundo), lo cual es lo suficientemente fluido para parecer natural.
  • Velocidad: La IA tarda unos 200 milisegundos en pensar y generar una respuesta por sí misma. Cuando sumas el tiempo que tarda el internet en enviar y recibir los datos (un presupuesto de 350 milisegundos), el tiempo total que esperas por una respuesta es de unos 550 milisegundos.

Para poner esto en perspectiva, 550 milisegundos es menos de un segundo. Es lo suficientemente rápido como para que la conversación se sienta como un chat real con un amigo, no como un robot esperando una barra de carga.

Lo Que Esto Significa (y Lo Que No)

El artículo sugiere que, al separar el "Mundo" de los "Eventos", podemos crear una IA que sea más flexible. Puede ser entrenada con cualquier tipo de video y luego especializada para diferentes trabajos, como un robot navegando por una habitación o un personaje en un videojuego. Los autores demuestran que este enfoque funciona para su caso de prueba específico: un personaje digital que habla y actúa en tiempo real.

Sin embargo, el artículo es cuidadoso al notar que esta es una demostración específica. Han demostrado que el modelo puede hacer esto, y han medido la velocidad y la calidad. No han pretendido haber resuelto todos los problemas de la IA, ni han enumerado cada posible uso futuro. Simplemente presentan una nueva forma de pensar sobre la generación de video que hace que la IA sea más inteligente sobre cómo funciona el mundo, manteniendo al mismo tiempo la rapidez necesaria para charlar contigo ahora mismo.

En resumen, Wan-Streamer v0.3 es como darle a un actor digital un guion que dice: "Aquí está el escenario, aquí está tu vestuario y aquí está la historia. Ahora, ve, actúa, habla y muévete, y hazlo todo antes de que pueda siquiera parpadear". Y gracias a este nuevo truco de "Mundo + Evento", parece que está haciendo exactamente eso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →