← Últimos artículos
💻 computer science

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

VideoCoCo introduce un marco de doble motor agéntico que aprovecha el código ejecutable de Blender como una cadena de pensamiento a nivel de proceso para generar videos físicamente consistentes, primero creando un borrador espaciotemporal determinista y luego refinándolo en un resultado fotorealista, superando significativamente a las líneas base existentes en los bancos de pruebas de consistencia física.

Autores originales: Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou
Publicado 2026-07-31
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou, Zhengrong Yue, Yaxin Luo, Xiaotong Li, Yuzhu Wang, Junyan Ye, Jinjing Zhao, Zehui Chen, Lin Chen, Renye Yan, Feng Zhao, Pheng-Ann Heng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina intentar enseñarle a un robot cómo hornear un pastel solo susurrándole: "Hazlo delicioso". El robot podría entender la palabra "delicioso", pero sin una receta, no tiene idea de si debe mezclar los huevos antes que la harina, cuánto tiempo hornearlo o por qué el pastel no debería convertirse en un ladrillo. Este es el problema actual en el mundo de la generación de video por Inteligencia Artificial. Los científicos están construyendo modelos que pueden convertir descripciones de texto en imágenes en movimiento, pero estos "soñadores" de IA a menudo luchan contra las leyes de la física. Podrían hacer que una pelota flote hacia arriba en lugar de caer, o que un vaso se rompa antes de tocar el suelo, porque la IA está adivinando la secuencia de eventos en lugar de comprender realmente cómo funciona el mundo.

Para solucionar esto, los investigadores buscan una forma de hacer que la IA "piense" antes de actuar, un concepto conocido como Cadena de Pensamiento (Chain-of-Thought). En lugar de saltar directamente a la imagen final, se anima a la IA a crear un plan intermedio. Piensa en ello como un arquitecto dibujando planos antes de construir una casa, o un chef escribiendo una receta antes de cocinar. La gran pregunta es: ¿qué tipo de plano es mejor? ¿Es una lista de palabras? ¿Unos pocos bocetos rudimentarios? ¿O algo más preciso? Este es el rompecabezas que el artículo VideoCoCo se propone resolver, con el objetivo de que los videos generados por IA no solo se vean bonitos, sino que realmente obedezcan las reglas de la realidad.


La Magia del "Código como CoT": Un Equipo de Ensueño de Dos Motores

Conoce a VideoCoCo, un nuevo sistema que actúa como un director superinteligente y un talentoso artista trabajando juntos para crear videos que no rompan las leyes de la física. Los investigadores se dieron cuenta de que cuando la IA intenta adivinar cómo evoluciona una escena solo a partir de un texto, a menudo acierta mal en la "historia". Así que le dieron a la IA una nueva herramienta: código ejecutable.

Piensa en el proceso de esta manera:

  1. El Director (El Agente de Codificación): Cuando le das a la IA un comando como "una mantequilla derritiéndose en una sartén caliente", el Director no solo imagina la escena. En su lugar, escribe un programa de Blender (un conjunto de instrucciones informáticas). Este código es como una receta estricta e inquebrantable. Le dice explícitamente a la computadora: "Coloca un bloque de mantequilla aquí. Enciende el calor. Haz que la mantequilla se ablande, se deforme y se extienda exactamente en 5 segundos". Debido a que es código, debe ejecutarse exactamente como está escrito. No es una suposición; es una simulación.
  2. El Sandbox (El Motor de Simulación): La computadora ejecuta este código en un patio de juegos seguro y aislado llamado "sandbox" (caja de arena). El resultado aún no es una película hermosa; es un borrador determinista. Imagina una animación de baja calidad hecha de arcilla blanca. Parece un boceto tosco hecho de plastilina, pero es perfectamente preciso en su movimiento. La mantequilla se derrite exactamente como la física dicta que debería hacerlo, porque el código la obligó a suceder.
  3. El Artista (El Motor de Video Generativo): Ahora, el segundo motor entra en escena. Este es el artista que toma ese boceto tosco de arcilla blanca y pinta sobre él para que parezca una película real de alta definición. Debido a que el artista ya tiene la versión perfecta de "plastilina" para copiar, no tiene que adivinar cómo debería moverse la mantequilla. Solo se concentra en hacer que se vea brillante, dorada y deliciosa.

Por qué este enfoque cambia las reglas del juego

El artículo argumenta que los métodos anteriores intentaban hacer demasiado a la vez. Algunos modelos de IA intentaban escribir un plan de texto (como "la mantequilla se derrite"), pero el texto es vago. Otros intentaban adivinar el siguiente fotograma de un video, pero eso es como intentar pintar una obra maestra mirando una foto borrosa de la anterior.

VideoCoCo dice: "Deja de adivinar la física. Solo simúlala".

Al usar el código como la "Cadena de Pensamiento", el sistema separa la lógica del movimiento de la belleza de la imagen. El código se encarga del "qué sucede y cuándo", mientras que el editor de video se encarga del "cómo se ve". Este es un cambio enorme porque convierte un juego de adivinanzas en un proceso de dos pasos donde el primer paso es 100% confiable.

La prueba está en el pudín (y en la física)

Los investigadores probaron su sistema en dos desafíos importantes: PhyGenBench y VBench-2.0. Estos son como exámenes para la IA, que prueban específicamente si los videos siguen las reglas del mundo real como la gravedad, el calor y cómo se comportan los materiales.

  • Los Resultados: Antes de VideoCoCo, la IA base (llamada OmniWeaving) obtuvo un promedio de 0.475 en la prueba de física. Después de añadir el sistema "Code-as-CoT", la puntuación saltó a 0.558. En la otra prueba (VBench-2.0), la puntuación se disparó del 52.18% al 77.88%.
  • El Momento de Revelación: Las mayores mejoras ocurrieron en áreas donde la IA suele fallar más: la dinámica térmica (como el calor y el derretimiento) y la dinámica de materiales (cómo las cosas se rompen o fluyen). Esto demuestra que el borrador de código realmente estaba enseñando a la IA cómo funciona la física, no solo haciendo que el video se viera más bonito.

Lo que el artículo descarta

Es importante notar lo que VideoCoCo no es. El artículo argumenta explícitamente contra la idea de que simplemente podemos entrenar una IA más grande para que "aprenda" la física a partir de millones de videos. Descubrieron que sin un plan explícito y ejecutable (el código), la IA sigue teniendo dificultades para acertar la secuencia de eventos. También muestran que tener simplemente un plan de texto tosco o unos pocos fotogramas clave no es suficiente; el plan necesita ser código ejecutable que la computadora pueda ejecutar realmente para crear un borrador.

El inconveniente y el futuro

Aunque los resultados son impresionantes, el artículo es honesto sobre las limitaciones. El sistema es actualmente un poco más lento porque tiene que escribir código, ejecutar una simulación y luego pintar el video. Es como tener un arquitecto brillante y un pintor, pero toma un poco más de tiempo que simplemente tomar una foto. Además, el sistema está limitado por la complejidad que el simulador de Blender pueda manejar; las cosas súper complejas como el movimiento caótico del agua podrían seguir siendo difíciles de simular perfectamente por ahora.

Sin embargo, los autores sugieren que este enfoque de "Code-as-CoT" es una nueva y poderosa forma de pensar sobre la IA. En lugar de esperar que la IA entienda el mundo mágicamente, podemos darle una herramienta para construir un modelo del mundo primero, y luego dejar que cree el arte basándose en ese cimiento sólido. Es un recordatorio de que, a veces, la mejor manera de crear algo hermoso es, primero, construir algo que funcione.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →