← Últimos artículos
💬 NLP

Which Way Does Time Flow? A Psychophysics-Grounded Evaluation for Vision-Language Models

El artículo presenta AoT-PsyPhyBENCH, un nuevo benchmark validado psícofísicamente que revela que, a pesar de su éxito en otras tareas, los modelos de visión y lenguaje actuales carecen de la capacidad humana para inferir la dirección del tiempo en videos, mostrando un rendimiento cercano al azar en procesos físicamente irreversibles y acciones causales.

Autores originales: Shiho Matta, Lis Kanashiro Pereira, Peitao Han, Fei Cheng, Shigeru Kitazawa

Publicado 2026-03-27
📖 4 min de lectura☕ Lectura para el café

Autores originales: Shiho Matta, Lis Kanashiro Pereira, Peitao Han, Fei Cheng, Shigeru Kitazawa

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un amigo muy inteligente, un robot llamado Modelo de Visión-Lenguaje (VLM). Este robot es increíble: puede describir fotos, escribir poemas sobre paisajes y responder preguntas complejas. Es como un erudito que ha leído todos los libros del mundo.

Pero, hay un problema. Este robot no sabe cómo funciona el tiempo.

El Experimento: ¿Hacia dónde fluye el tiempo?

Los autores de este estudio decidieron poner a prueba a estos robots con un juego muy sencillo, algo que cualquier niño de 5 años podría entender: ver un video corto y decir si se está reproduciendo hacia adelante o hacia atrás.

Imagina dos situaciones:

  1. Hacia adelante: Un huevo cae de una mesa, se rompe y se hace pedazos. (Esto es normal).
  2. Hacia atrás: Los pedazos de huevo se juntan mágicamente, vuelan hacia arriba y se convierten en un huevo entero en la mesa. (Esto es imposible en la vida real).

Los humanos hacemos esto casi sin pensar. Nuestro cerebro tiene un "sentido común" físico: sabemos que la gravedad tira hacia abajo, que el humo se dispersa y que las cosas no se reparan solas. A esto los científicos lo llaman la Flecha del Tiempo.

Lo que descubrieron (La mala noticia)

Los investigadores crearon un banco de pruebas llamado AoT-PsyPhyBENCH (suena a ciencia ficción, pero es solo un examen de videos). Pusieron a prueba a los robots más famosos e inteligentes de hoy (como GPT-4, Gemini, etc.).

El resultado fue decepcionante:

  • Los humanos: Acertaron casi el 90% de las veces. Si veían un video de una explosión en cámara lenta hacia atrás, decían inmediatamente: "¡Eso va al revés!".
  • Los robots: La mayoría acertó solo el 50%. ¡Eso es lo mismo que lanzar una moneda al aire! Estaban adivinando.

Incluso los modelos más avanzados, que pueden "pensar" paso a paso (como si hicieran un razonamiento lógico), fallaron. Fue como si un genio de las matemáticas no supiera que el agua no fluye hacia arriba.

¿Por qué fallan? La analogía del "Libro de Recetas"

Aquí es donde entra la explicación creativa:

Imagina que los robots han leído millones de libros de cocina. Saben perfectamente que una receta dice: "Primero rompes el huevo, luego lo bates, luego lo cocinas".

  • El problema: El robot memorizó la lista de ingredientes y el orden de las palabras, pero no entendió la física detrás de la acción.
  • Cuando ven un video de un huevo rompiéndose, el robot piensa: "¡Ah! Esto coincide con la palabra 'huevo' y 'romperse' en mi base de datos".
  • Pero si ven el video al revés (el huevo saltando y uniéndose), el robot sigue pensando: "Hmm, veo un huevo y veo movimiento. Probablemente sea hacia adelante".

Les falta lo que los humanos llamamos sesgos inductivos. Es decir, esas reglas no escritas que aprendemos al interactuar con el mundo: "Si suelto algo, cae", "Si rompo algo, no se repara solo". Los robots solo ven patrones visuales, no la lógica causal del universo.

¿Funcionó "pensar más"?

Los investigadores probaron cosas para ayudar a los robots:

  1. Darles ejemplos: "Mira, este video va hacia adelante, y este otro va hacia atrás". (No funcionó, los robots se confundieron más).
  2. Pedirles que piensen: "Dime paso a paso por qué crees que va hacia atrás". (Peor aún. Al intentar razonar, los robots se convencieron más de sus errores, como si un estudiante que no sabe matemáticas escribiera un ensayo muy largo para justificar una respuesta incorrecta).
  3. Entrenarlos más: Les enseñaron miles de videos. (Siguió sin funcionar bien).

La Conclusión

El mensaje principal de este estudio es: Los robots actuales son excelentes imitadores, pero no son entendidos.

Pueden describir lo que ven con mucha belleza, pero no tienen la intuición física que nos permite saber que el tiempo solo fluye en una dirección. Para que la Inteligencia Artificial sea realmente inteligente, no basta con que lea más libros o vea más videos; necesita "vivir" la física del mundo para entender por qué las cosas suceden en un orden y no en otro.

En resumen: Si le preguntas a un humano si un video de una explosión al revés es real, te dirá "No". Si le preguntas a un robot de última generación, probablemente te diga "No estoy seguro" o "Sí, parece real", porque le falta la magia de entender cómo funciona el tiempo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →