← Últimos artículos
🤖 AI

Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models

Este artículo presenta el conjunto de datos de Comportamiento Social Complejo (CSB) para evaluar una década de Modelos de Lenguaje-Visión, revelando que, si bien los Modelos de Lenguaje de Gran Escala Multimodales (MLLM) han alcanzado una precisión de nivel humano en escenas sociales complejas al haber eliminado en gran medida la mayoría de los tipos de error, todavía difieren ocasionalmente de los humanos en la dependencia espacial.

Autores originales: Shravan Murlidaran, Miguel P. Eckstein

Publicado 2026-07-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Shravan Murlidaran, Miguel P. Eckstein

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo una película sobre los últimos diez años de la IA, específicamente sobre los modelos "Visión-Lenguaje": robots que miran imágenes e intentan describir lo que está sucediendo. Durante mucho tiempo, estos robots fueron como estudiantes que sacaban notas excelentes en cada examen de fichas de estudio simples y aburridas, pero se quedaban paralizados cuando se les pedía describir una escena caótica y emocional de una película real.

Este artículo es la boleta de calificaciones de esa década (2017–2025), y revela una transformación dramática. Los investigadores no se limitaron a mirar las pruebas viejas y fáciles; construyeron un desafío nuevo y mucho más difícil llamado el conjunto de datos de Comportamiento Social Complejo (CSB, por sus siglas en inglés). Piensa en las pruebas antiguas (como el famoso conjunto de datos MS-COCO) como fotos de una cocina tranquila o una persona sentada en un banco. El nuevo conjunto de datos CSB es como una captura de una escena dramática de una película: personas discutiendo, abrazándose o interactuando de formas complejas.

La gran revelación: De la "habitación aburrida" al "blockbuster"
El estudio encontró que los robots antiguos (llamados pre-MLLMs) eran terribles en las escenas nuevas y complejas. Si les mostrabas un fotograma de una discusión tensa, podrían describir los muebles pero omitirían por completo el hecho de que dos personas estaban peleando. Su precisión en estas escenas complejas era tan baja que era incluso peor que las descripciones dadas por los humanos con menos habilidad.

Sin embargo, la nueva generación de robots (llamados MLLMs, como GPT-4o1 y Gemini) cambió las reglas del juego. No solo mejoraron; cerraron la brecha por completo. En las escenas de películas complejas, estos nuevos modelos funcionaron tan bien como los mejores descriptores humanos. Finalmente aprendieron a leer la habitación, no solo los objetos que hay en ella.

El problema de la "alucinación" y el "punto ciego"
Para entender por qué fallaban los robots antiguos, los investigadores actuaron como detectives, desglosando los errores en cinco categorías específicas:

  1. Detección: Omitir un objeto por completo (como no ver una linterna en una mano).
  2. Reconocimiento: Ver un objeto pero llamarlo incorrectamente (llamar a una puerta un espejo).
  3. Comprensión de la escena: Ver el objeto pero olvidar mencionarlo en la historia.
  4. Alucinación: Inventar objetos que no están ahí (como describir un frisbee que no existe).
  5. Dependencia Espacial: Este es el extraño. Significa que el robot y el humano están mirando partes diferentes de la imagen para escribir su historia.

El estudio mostró que los robots antiguos cometían errores masivos en las primeras cuatro categorías en escenas complejas. Omitían cosas, identificaban mal las cosas e inventaban cosas. ¿Pero los nuevos MLLM? Casi eliminaron por completo los errores de detección, reconocimiento y alucinación. Ahora son increíblemente precisos al detectar y nombrar cosas.

El único fallo: El "Qué" frente al "Dónde"
Aquí está el truco: aunque los nuevos robots son perfectos en el qué ven, todavía a veces discrepan con los humanos sobre dónde están mirando. Los investigadores usaron un truco de "enmascaramiento" —cubriendo un tercio de la imagen a la vez— para ver qué partes de la imagen eran más importantes para escribir la descripción.

Encontraron que incluso los mejores modelos nuevos a veces dependen de regiones de la imagen diferentes a las de los humanos. Por ejemplo, un humano podría enfocarse en la cara enojada de una persona para describir una pelea, mientras que el robot se enfoca en la pared del fondo. El artículo sugiere que esto es un "error de dependencia espacial". Es el único tipo de error importante que no se ha solucionado por completo, aunque es el que tiene el menor impacto en qué tan buena suena la descripción final.

Lo que el artículo descarta
Los investigadores fueron cuidadosos al descartar algunas excusas.

  • No fue solo memorización: Algunos podrían pensar que los nuevos robots lo hicieron bien en las escenas de películas porque habían visto esos fotogramas exactos durante su entrenamiento. Los autores probaron esto usando un conjunto de datos secreto y propio de imágenes que los robots nunca habían visto antes. Los nuevos modelos siguieron funcionando al nivel de un humano, demostrando que realmente aprendieron a entender interacciones complejas, no solo memorizaron imágenes.
  • No fue solo "suficiente" en las pruebas simples: El artículo argumenta que si solo pruebas a la IA con conjuntos de datos simples (como las fotos de la cocina), te pierdes toda la historia. El progreso parece modesto en las pruebas simples, pero en las escenas sociales complejas, el salto de los modelos viejos a los nuevos es masivo.

¿Qué tan seguros están?
Los autores están muy seguros de estos números. Probaron 200 imágenes (100 complejas, 100 simples) y realizaron 10,000 "remuestreos" estadísticos para asegurarse de que sus resultados no fueran solo cuestión de suerte. Encontraron que la caída de errores en los nuevos modelos fue estadísticamente significativa.

Sin embargo, son cuidadosos al no decir que el problema está "solucionado" para siempre. Señalan que, aunque los robots ahora son tan buenos como los mejores humanos describiendo escenas, todavía tienen ese rasgo peculiar sobre dónde miran. El artículo sugiere que esto podría deberse a que es genuinamente difícil que una imagen en 2D transmita el razonamiento en 3D necesario para entender cómo las personas se mueven e interactúan en el espacio.

La conclusión
En términos simples: hace diez años, la IA era como un estudiante que podía nombrar cada objeto en una naturaleza muerta pero no podía entender un drama. Hoy, gracias a estos nuevos modelos, la IA puede ver una escena compleja de una película y decirte exactamente qué está pasando, con una precisión que rivaliza con los mejores observadores humanos. Lo único que queda por arreglar es descubrir exactamente a qué parte de la escena está prestando atención la IA, porque a veces, está mirando el fondo mientras nosotros estamos mirando el drama.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →