← Últimos artículos
🤖 machine learning

VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs

El benchmark VRIQ revela que los actuales Modelos de Lenguaje y Visión desempeñan un desempeño deficiente en tareas de razonamiento visual, debido principalmente a limitaciones de percepción más que a déficits de razonamiento, con una precisión que oscila entre el 28% en acertijos abstractos y el 45% en imágenes naturales.

Autores originales: Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis

Publicado 2026-02-06
📖 4 min de lectura☕ Lectura para el café

Autores originales: Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un equipo de robots increíblemente inteligentes que pueden leer libros y mirar imágenes. Quieres saber si son verdaderamente "inteligentes" o si solo son muy buenos adivinando. Para averiguarlo, los autores de este artículo construyeron una prueba especial llamada VRIQ (IQ de Razonamiento Visual).

Piensa en VRIQ como una gigante "caja de rompecabezas" digital diseñada para engañar a estos robots. La caja contiene dos tipos de acertijos:

  1. Acertijos Abstractos: Estos son como las clásicas tarjetas de las pruebas de CI con formas, líneas y patrones extraños. Aquí no hay objetos del mundo real, solo símbolos.
  2. Acertijos Naturales: Estos utilizan fotos reales de cosas cotidianas, como manzanas, coches o personas, pero plantean las mismas preguntas de lógica complicadas.

La Gran Sorpresa: Los Robots Están "Ciegos"

Cuando los investigadores probaron los modelos de IA más inteligentes disponibles (incluyendo los famosos de OpenAI y Google), encontraron algo impactante.

  • En los Acertijos Abstractos: Los robots se desempeñaron casi tan mal como si estuvieran adivinando al azar. Su puntuación media fue de alrededor del 28% (donde el 25% es pura suerte). Es como un estudiante que se ha memorizado el diccionario pero no puede leer ni una sola frase.
  • En los Acertijos Naturales: Les fue un poco mejor (alrededor del 45%), pero aún estaban lejos de la perfección.

El artículo revela que el problema no es que los robots sean malos pensando (razonando). El problema es que son malos viendo (percepción).

El Trabajo de Detective: ¿Por qué Fallaron?

Para averiguar exactamente dónde estaban fallando los robots, los investigadores actuaron como detectives. No se limitaron a preguntar: "¿Cuál es la respuesta?". Dividieron cada acertijo en pasos diminutos utilizando "preguntas de sondeo".

Imagina a un robot fallando un acertijo en el que tiene que encontrar la forma extraña. Los investigadores preguntaron:

  • Sondeo de Percepción: "¿Cuántos círculos rojos ves?"
  • Sondeo de Razonamiento: "Si hay 3 círculos rojos y la regla es 'quitar uno', ¿qué queda?"

Los Resultados de la Investigación:

  • El 56% de las veces: El robot falló porque no pudo ver lo básico (por ejemplo, no pudo contar los círculos o distinguir hacia qué dirección apuntaba una forma).
  • El 43% de las veces: El robot no pudo ver lo básico y además no pudo comprender la lógica.
  • Solo el 1% de las veces: El robot vio todo perfectamente, pero simplemente falló en la lógica.

La Metáfora: Es como darle a un chef una receta para un pastel. El chef (la IA) conoce la lógica de la repostería a la perfección. Pero si el chef tiene los ojos vendados y no puede ver que solo hay 2 huevos en lugar de 4, el pastel fallará. El fallo no fue la lógica de la cocina; fue la incapacidad de ver los ingredientes.

El Giro de las "Herramientas"

Los investigadores intentaron una cosa más. Le dieron a un modelo de IA específico (el o3 de OpenAI) un conjunto de herramientas digitales, como una lupa, unas tijeras (para recortar imágenes) y una calculadora. Este modelo tenía permitido "pensar con imágenes" manipulando activamente la imagen antes de responder.

El Resultado: Este robot que usa herramientas se disparó. Saltó de una puntuación del 28% a más del 50% en acertijos abstractos e incluso al 80-100% en acertijos naturales. Esto demuestra que si le das al robot mejores "ojos" (herramientas para ver con claridad), su "cerebro" (razonamiento) funciona mucho mejor.

La Conclusión

El artículo concluye que los modelos de IA actuales no están fallando por falta de inteligencia o lógica. Están fallando porque luchan por percibir con precisión el mundo visual. No pueden contar objetos de forma fiable, entender la profundidad 3D o distinguir hacia qué dirección está rotado algo.

Para que la IA sea verdaderamente inteligente en el razonamiento visual, no solo necesitamos cerebros más grandes; necesitamos darles mejores ojos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →