← Últimos artículos
🤖 AI

VGI-Bench: Probing Visual Intelligence in Video Generation Models

Este artículo presenta VGI-Bench, un banco de pruebas exhaustivo que comprende 27 tareas y 810 instancias diseñado para evaluar rigurosamente las capacidades de razonamiento visual de los modelos de generación de video, revelando que incluso sistemas de vanguardia como Seedance 2.0 alcanzan solo un 51.0% de precisión y tienen dificultades con la autocorrección fiable durante el proceso de generación.

Autores originales: Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie
Publicado 2026-08-27
📖 4 min de lectura☕ Lectura para el café

Autores originales: Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina una computadora que no solo observa el mundo, sino que puede imaginar cómo este cambia. Durante años, la inteligencia artificial ha sido entrenada para reconocer imágenes estáticas: un gato sentado en un tapete, un coche estacionado en una calle. Más recientemente, estos sistemas han aprendido a generar videos, creando imágenes en movimiento que parecen sorprendentemente reales. Los científicos ahora se preguntan si estos generadores de video están haciendo algo más profundo que simplemente imitar el movimiento. Se preguntan si las máquinas están comenzando a comprender las reglas del mundo físico —la gravedad, la causa y el efecto, y cómo interactúan los objetos— para poder "pensar" a través de una secuencia de eventos antes de mostrar el resultado. Esta pregunta se encuentra en el corazón de un nuevo esfuerzo por medir si la IA de creación de video puede razonar verdaderamente, o si simplemente está adivinando cómo se ve un final plausible.

Un equipo de investigadores ha construido un nuevo campo de pruebas llamado VGI-Bench para responder a esta pregunta. En lugar de pedirle a la IA que resuelva acertijos abstractos dibujados con líneas simples, le proporcionaron fotos realistas de escenas cotidianas y le pidieron que generara videos que siguieran reglas lógicas específicas. Las tareas fueron diseñadas para ser desafiantes pero posibles, requiriendo que la máquina simulara un proceso paso a paso. Por ejemplo, se le podría mostrar a una IA la foto de un coche de juguete al inicio de un laberinto y pedirle que genere un video de este conduciendo hasta la salida sin chocar contra las paredes. Otra tarea podría mostrar una caja de cartón plana y desplegada, y pedirle a la IA que la anime plegándose a sí misma para formar una figura 3D. Los investigadores no solo miraron la imagen final; examinaron minuciosamente todo el video para ver si la máquina siguió las reglas en cada momento, buscando cosas como objetos atravesando paredes, coches teletransportándose o artículos desapareciendo y reapareciendo.

Cuando probaron los modelos de generación de video más avanzados disponibles hoy en día, los resultados fueron una mezcla de promesa y limitación. El sistema con mejor desempeño, un modelo llamado Seedance 2.0, logró resolver solo cerca de la mitad de las tareas correctamente bajo estas estrictas condiciones. Aunque la IA a menudo lograba captar la idea general, frecuentemente fallaba al mantener una historia consistente. En muchos videos, la física se rompía: una taza situada sobre una computadora portátil inclinada no rodaba hacia afuera, o un coche atravesaba directamente una pared sólida. Las máquinas también tuvieron dificultades con las reglas, a veces saltándose pasos necesarios o cambiando la identidad de un objeto a mitad del video. Incluso cuando el resultado final parecía correcto, el camino para llegar allí estaba lleno de movimientos imposibles, lo que sugiere que los modelos son buenos prediciendo un estado final, pero malos simulando el trayecto para llegar a él.

Los investigadores profundizaron para entender por qué ocurrían estos fallos. Descubrieron que el estilo de la imagen de entrada importaba enormemente; cuando la IA recibía una foto realista, funcionaba mejor que cuando se le daba un dibujo de líneas simples, lo que indica que los modelos están entrenados con imágenes del mundo real y tienen dificultades cuando el estilo visual cambia. También observaron cómo la IA "piensa" mientras crea un video, paso a paso. Descubrieron que los modelos no corrigen realmente sus errores sobre la marcha. Si la IA comete un error en las etapas iniciales de la generación de un video, tiende a mantener ese error, refinando la idea equivocada en lugar de corregirla. La máquina se encierra en una hipótesis tempranamente y luego la pule, incluso si esa hipótesis viola las leyes de la física o las reglas de la tarea.

Este estudio sugiere que, si bien los modelos de generación de video se están convirtiendo en herramientas poderosas para la creación de contenido visual, aún no han desarrollado el tipo de razonamiento fiable y paso a paso que los humanos usamos para navegar por el mundo. Pueden simular apariencias y movimientos simples, pero carecen de una comprensión profunda y consistente de cómo funcionan realmente las cosas a través del tiempo. El nuevo punto de referencia proporciona una forma clara de medir esta brecha, mostrando que los sistemas actuales están lejos de ser verdaderos razonadores visuales. Al resaltar exactamente dónde fallan estos modelos —ya sea al rastrear objetos, seguir reglas o corregir errores—, la investigación ofrece una hoja de ruta para construir la próxima generación de inteligencia artificial que pueda verdaderamente imaginar el futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →