← Últimos artículos
💻 computer science

4Director: Controlling Video World Models with Rigid 3D Geometry

El artículo presenta 4Director, un modelo de mundo de video que logra un control preciso de la cámara y de los objetos condicionando la generación en geometría rígida 4D explícita y un Adaptador de Movimiento, validado por un nuevo conjunto de datos y una métrica de evaluación para superar a los métodos existentes en calidad visual y consistencia de movimiento.

Autores originales: Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

Publicado 2026-10-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde una computadora puede observar una sola fotografía y luego imaginar una película desarrollándose a partir de ese momento estático. Esta es la promesa de los modelos de mundo de video, un campo de la inteligencia artificial que avanza rápidamente donde las máquinas aprenden a predecir cómo cambiará una escena con el tiempo. Durante años, los investigadores han enseñado a estos sistemas a generar imágenes en movimiento mostrándoles miles de horas de video, con la esperanza de que la computadora aprenda las reglas de la física y el movimiento por sí misma. Sin embargo, un obstáculo significativo ha persistido: si bien estas computadoras se están volviendo mejores en la creación de movimientos realistas, son notoriamente difíciles de dirigir. Si un usuario quiere que un objeto específico dé la vuelta o que una cámara se deslice alrededor de una esquina, la computadora a menudo ignora la instrucción o crea un resultado que parece plausible pero es geométricamente erróneo. El objeto podría encogerse en lugar de alejarse, o podría convertirse en una mancha fantasmal a medida que la cámara se mueve. El desafío central ha sido cerrar la brecha entre la intención tridimensional clara de un humano y la tendencia de la computadora a adivinar basándose en patrones bidimensionales planos.

Un equipo de investigadores de Stability AI y la Universidad de Illinois Urbana-Champaign ha presentado un nuevo enfoque llamado 4Director para resolver este problema. En lugar de pedirle a la computadora que adivine la trayectoria de un objeto, 4Director le entrega a la computadora un mapa tridimensional completo de la escena antes de que comience siquiera la generación del video. En este sistema, cada objeto en una fotografía inicial se reconstruye como un modelo 3D sólido, de forma muy similar a como un escultor crea una figura de arcilla que tiene frente, espalda y lados, incluso si la foto original solo mostraba el frente. El fondo también es elevado a una nube de puntos en el espacio. Una vez que este mundo digital se construye, el usuario puede dibujar una trayectoria para la cámara y una trayectoria para el objeto, tal como un director de cine planifica una toma. La computadora mueve entonces estos modelos 3D sólidos a lo largo de las trayectorias prescritas con una rigidez perfecta, asegurando que si un objeto gira, lo haga como una unidad completa, y si la cámara se mueve, el fondo se desplace correctamente.

La innovación reside en cómo este esqueleto rígido se utiliza para guiar el video final. El sistema primero renderiza un mapa de profundidad simple en blanco y negro de la escena, mostrando solo la distancia de cada superficie respecto a la cámara a medida que los objetos se mueven a lo largo de sus trayectorias. Este mapa de profundidad actúa como un andamio estricto, definiendo exactamente dónde debe estar cada píxel en términos de espacio y tiempo. Un módulo de entrenamiento especializado, que los investigadores llaman Motion Adapter, toma entonces este esqueleto rígido y rellena los detalles faltantes. Este aprende a pintar las textidades de la superficie, la iluminación y los movimientos sutiles y no rígidos —como el balanceo del brazo de una persona o el aleteo de una bandera— sobre la estructura 3D fija. Esto asegura que el video final siga las instrucciones exactas del usuario para la posición y orientación, manteniendo al mismo tiempo la apariencia de una escena natural y viva.

Para enseñar a este sistema cómo trabajar, los investigadores tuvieron que crear un nuevo conjunto de datos masivo porque ninguna colección de videos existente venía con los mapas 3D necesarios. Construyeron una canalización automatizada que tomó más de 20,000 clips de video y los sometió a ingeniería inversa, convirtiendo cada uno en una escena 3D rígida con una trayectoria de cámara y trayectorias de objetos. Este conjunto de datos, llamado RealCOD-Rigid, permitió al Motion Adapter aprender la diferencia entre el movimiento rígido de un objeto sólido y el movimiento flexible de los detalles del mundo real. Los resultados muestran una mejora notable respecto a los métodos anteriores. En las pruebas, 4Director fue capaz de mantener los objetos consistentes y reconocibles incluso cuando daban la vuelta completa o se movían fuera de la vista de la cámara y regresaban, una tarea en la que otros sistemas a menudo fallaban al perder la identidad del objeto o difuminarlo en el fondo.

Los investigadores también desarrollaron una nueva forma de medir el éxito, reconociendo que simplemente verificar si un objeto está en el lugar correcto no es suficiente si el objeto mismo ha cambiado en otra cosa. Su nueva métrica verifica tanto la posición como la identidad del objeto, asegurando que un auto que gira una esquina siga pareciendo el mismo auto. Al compararse con otras herramientas líderes de generación de video, 4Director produjo consistentemente videos con una calidad visual mucho mayor y un control mucho más preciso tanto de la cámara como de los objetos dentro de la escena. El sistema demuestra que, al darle a la computadora una comprensión tridimensional clara del mundo antes de comenzar a generar el video, es posible lograr un nivel de control que antes estaba fuera de alcance, permitiendo a los usuarios dirigir el flujo de una escena con la precisión de un cineasta profesional.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →