← Últimos artículos
🤖 machine learning

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1 es un modelo de generación de video interactivo en tiempo real que permite a los usuarios controlar personajes digitales mediante comandos de voz para producir videos de longitud infinita y alta calidad a 540p y hasta 42 FPS en GPUs de consumo sin degradación visual.

Autores originales: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zh
Publicado 2026-07-22
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo una película donde los personajes no pueden oírte, sin importar cuánto grites a la pantalla. No puedes decirles que saluden con la mano, que pongan cara de sorpresa o que cambien la escena; simplemente tienes que sentarte y esperar a que el director termine de editar todo antes de ver el resultado. Así es como funciona la mayoría de la generación de video por IA hoy en día: escribes una petición, esperas mucho tiempo y obtienes un clip terminado. Pero, ¿qué pasaría si pudieras hablar con el personaje mientras está siendo creado? ¿Qué pasaría si pudieras decir: "¡Oye, levanta el pulgar!", y ellos lo hicieran al instante, justo en medio de la conversación? Este es el sueño de la generación de video interactiva en tiempo real. Es un campo que intenta cerrar la brecha entre las películas estáticas y pre-realizadas y la naturaleza fluida e instantánea de una conversación en vivo. Para lograr esto, los científicos están construyendo modelos que no solo "pintan" una imagen completa a la vez, sino que en su lugar "transmiten" el video fotograma a fotograma, reaccionando a tu voz a medida que ocurre, de forma muy similar a un actor humano que improvisa una escena basándose en las instrucciones inmediatas del director.

Entra Vidu S1, un nuevo modelo que actúa como un actor digital superrápido y superresponsivo que nunca pierde el ritmo. Los investigadores detrás de este proyecto querían resolver el problema de la generación de video "offline", donde tienes que esperar minutos o incluso horas para obtener un resultado. En su lugar, construyeron un sistema que te permite controlar a un personaje digital con tu voz en tiempo real. Piensa en ello como un personaje de un videojuego que no solo sigue un guion preescrito, sino que escucha tus comandos de voz y reacciona instantáneamente, ya sea que le pidas que salude, se siente o haga una forma de corazón con sus manos. Lo genial de esto es que no solo funciona para unos pocos segundos; el artículo sugiere que Vidu S1 puede mantener esto durante un tiempo "infinito" sin que el rostro del personaje se vea borroso o sus movimientos se vuelvan extraños y erráticos, un problema que suele ocurrir cuando la IA intenta crear videos largos.

El equipo detrás de Vidu S1 no solo construyó el cerebro; también construyeron un motor supereficiente para hacerlo funcionar rápido. Utilizaron trucos especiales (que llaman "TurboDiffusion" y "TurboServe") para comprimir la generación de video en tarjetas gráficas regulares que podrías encontrar en una configuración de un jugador (gamer). ¿El resultado? El modelo puede escupir video a una resolución de 540p a una velocidad de 42 FPS (fotogramas por segundo). Para ponerlo en perspectiva, el video estándar se reproduce a 30 FPS, por lo que esto es en realidad más rápido que el tiempo real, lo que significa que la IA puede seguir el ritmo de una conversación en vivo sin retrasos. Los investigadores probaron esto haciendo que los usuarios subieran fotos de sí mismos, personajes de anime o incluso mascotas, y luego les dieran instrucciones de voz. El modelo generó con éxito videos donde los personajes seguían las órdenes, como levantar una pierna o dar un pulgar hacia arriba, manteniendo el rostro exactamente igual a la foto que subiste.

Uno de los mayores obstáculos que aborda el artículo es el problema de la "deriva" (drift). Imagina que intentas dibujar un retrato de una persona, pero cada vez que añades un nuevo detalle, toda la imagen comienza a deformarse y retorcerse lentamente hasta que la persona parece un monstruo. Muchos modelos de video por IA sufren de esto cuando intentan hacer videos largos; cuanto más largo es el video, más se distorsiona el rostro del personaje o el fondo. Vidu S1 utiliza un ingenioso sistema de memoria llamado "TwinCache" para prevenir esto. Es como tener un bibliotecario que guarda un "boceto tosco" de los últimos segundos para mantener el movimiento fluido, mientras también mantiene una "versión final pulida" para asegurar que el rostro del personaje se mantenga nítido y reconocible. Esto permite que el video siga rodando para siempre sin que el personaje se desmorone.

El artículo también señala que, aunque existen otros modelos, la mayoría son demasiado lentos para ser interactivos, no pueden entender comandos de voz directamente o colapsan después de un corto tiempo. Vidu S1 está diseñado específicamente para ser lo opuesto: toma tu voz como un comando directo, genera el video instantáneamente y se mantiene estable durante todo el tiempo que quieras hablar. En sus pruebas, el modelo fue comparado con otros sistemas de alto nivel, y resultó superior en cuanto a qué tan bien seguía las instrucciones y qué tan naturales eran los movimientos. Los investigadores dicen que con esta tecnología, nos acercamos a un futuro donde puedes tener una conversación en vivo y personalizada con un personaje digital que se ve y se mueve igual que una persona real, todo generado sobre la marcha directamente en tu computadora.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →