← Últimos artículos
💬 NLP

Do AI Models Perform Human-like Abstract Reasoning Across Modalities?

Este artículo demuestra que evaluar el razonamiento abstracto de la IA únicamente mediante la precisión es engañoso, ya que sobreestima las capacidades en tareas basadas en texto donde los modelos dependen de atajos superficiales y las subestima en tareas visuales donde los modelos a menudo captan las abstracciones pretendidas a pesar de no aplicarlas correctamente.

Autores originales: Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

Publicado 2026-02-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un profesor dándole un acertijo a un estudiante. El acertijo muestra algunos ejemplos de cómo cambia un patrón (como "mueve el bloque rojo a la izquierda") y luego le pide al estudiante que aplique esa misma regla a una nueva imagen no vista.

Durante mucho tiempo, hemos estado probando a la IA con estos acertijos usando una "tarjeta de puntuación" que solo cuenta cuántas veces la IA acierta la respuesta final. Si la IA obtiene la imagen correcta, le damos un A+.

Este artículo plantea una pregunta más profunda: ¿Realmente entendió la IA la regla, o simplemente tuvo suerte al detectar un truco extraño?

Aquí está la historia de lo que los investigadores descubrieron, explicada de forma sencilla:

1. Las dos formas de hacer el examen

Los investigadores probaron los mejores modelos de IA (como o3 de OpenAI, Claude y Gemini) de dos maneras diferentes:

  • El Modo Texto: Le dieron el acertijo a la IA como una lista de números y palabras (por ejemplo, "La cuadrícula 1 tiene un cuadrado rojo en 2,2...").
  • El Modo Visual: Le mostraron a la IA una imagen real del acertijo, tal como la vería un humano.

2. La sorpresa del "Texto": Puntuaciones altas, comprensión superficial

Cuando la IA realizó la prueba en Modo Texto, le fue increíblemente bien. De hecho, la mejor IA (o3) obtuvo una puntuación más alta que el humano promedio.

Pero aquí está el truco: Los investigadores le pidieron a la IA que explicara cómo resolvió el acertijo.

  • Los humanos usualmente lo explicaron usando el concepto real, como "Elimina los objetos de arriba y de abajo".
  • La IA a menudo dio explicaciones que eran técnicamente correctas para los ejemplos específicos mostrados, pero que perdían la visión general.

La Analogía: Imagina a un estudiante tomando un examen de matemáticas. El profesor pregunta: "¿Cuánto es 2 + 2?". El estudiante responde "4". El profesor pregunta: "¿Cómo llegaste a eso?". El estudiante dice: "Miré el reloj y las manecillas estaban en el 4, así que supuse que era 4". La respuesta fue correcta, pero el razonamiento fue un "atajo". La IA estaba haciendo esto constantemente. Estaba detectando patrones accidentales en los números (como "el color rojo siempre es el número 3, así que eliminaré el número 3") en lugar de entender el concepto de "objetos".

El Veredicto: En el modo de texto, las altas puntuaciones de la IA sobreestimaron su verdadera inteligencia. Era buena adivinando, pero no siempre era buena razonando.

3. La sorpresa "Visual": Puntuaciones bajas, genio oculto

Cuando los investigadores cambiaron al Modo Visual (mostrando imágenes), las puntuaciones de la IA se desplomaron. Eran capaces de fallar la respuesta final mucho más a menudo que los humanos.

Sin embargo, los investigadores revisaron las explicaciones de la IA nuevamente.
Descubrieron algo sorprendente: ¡Incluso cuando la IA obtenía la imagen final de forma incorrecta, su explicación de la regla era a menudo correcta!

La Analogía: Imagina a un arquitecto brillante que puede describir perfectamente cómo construir una casa ("Pon los ladrillos en círculo, luego añade un techo"). Pero, cuando intenta colocar los ladrillos, sigue soltándolos o poniéndolos en el lugar equivero porque es torpe de manos.
La IA en el modo visual era como este arquitecto. Entendía el concepto abstracto (la "regla") perfectamente, pero tenía dificultades para "ver" la imagen con la claridad suficiente para aplicarla correctamente. No podía distinguir exactamente qué tan grande era la cuadrícula o dónde estaban los objetos.

El Veredicto: En el modo visual, las bajas puntuaciones de la IA subestimaron su verdadera inteligencia. Entendía la lógica perfectamente, pero fallaba en la parte de la "percepción".

4. El efecto de la "Herramienta"

Los investigadores también le dieron a la IA una "calculadora" (código Python) para ayudarla.

  • En Modo Texto: La calculadora no ayudó mucho. La IA ya era buena en la lógica pero mala en los atajos.
  • En Modo Visual: La calculadora ayudó mucho. Cuando la IA pudo usar código para "mirar" la imagen y contar píxeles, sus puntuaciones subieron. Esto demostró que la IA no era "estúpida" en la lógica; solo necesitaba ayuda para ver la imagen.

La gran conclusión

Si solo miras la puntuación final (el "A+"), podrías pensar que la IA es un genio en modo de texto pero un fracaso en modo visual.

Pero cuando observas cómo piensan:

  • En Texto: A menudo están "haciendo trampa" con atajos ingeniosos que no funcionan en el mundo real.
  • En Visual: Son genios "torpes" que entienden las reglas pero no pueden ejecutarlas del todo bien.

El artículo concluye que para saber realmente si la IA se está volviendo "humana", no podemos limitarnos a comprobar si la respuesta es correcta. Tenemos que comprobar si el razonamiento también es correcto. De lo contrario, estamos sobreestimando sus habilidades de texto o subestimando su potencial visual.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →