← Últimos artículos
🤖 AI

The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

Este artículo presenta Polaris-Bench, una evaluación que reformula las tareas de razonamiento visual en coordenadas polares para exponer la vulnerabilidad del "Atajo Cartesiano" en los actuales Modelos de Lenguaje Grandes Multimodales, revelando que su alto rendimiento en evaluaciones estándar basadas en cuadrículas se debe a la explotación de patrones de coordenadas textuales en lugar de una comprensión visual robusta e invariante a la topología.

Autores originales: Xia Hu, Zhenrui Yue, Brian Potetz, Howard Zhou, Leonidas Guibas, Chun-Ta Lu, Zhicheng Wang

Publicado 2026-05-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Xia Hu, Zhenrui Yue, Brian Potetz, Howard Zhou, Leonidas Guibas, Chun-Ta Lu, Zhicheng Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: ¿Los Modelos de IA Realmente "Ven", o Solo "Leen"?

Imagina que estás tomando un examen de matemáticas. En una versión, los números están dispuestos en una cuadrícula ordenada y cuadrada (como una hoja de cálculo). En la otra versión, los números están dispuestos en un círculo, como rebanadas de una pizza.

Los investigadores de Google DeepMind y la Universidad de Stanford descubrieron que los modelos de visión con IA más inteligentes del mundo son como estudiantes que han memorizado un truco para la cuadrícula cuadrada, pero que en realidad no entienden las matemáticas. Cuando cambias el examen a la forma de pizza, fracasan miserablemente.

Ellos llaman a este truco el "Atajo Cartesiano".

Explicación del "Atajo Cartesiano"

La mayoría de las pruebas de razonamiento visual para la IA utilizan coordenadas cartesianas. Esto es simplemente una forma elegante de decir "filas y columnas" (como un tablero de ajedrez o una hoja de cálculo).

  • Fila 1, Columna 2.
  • Fila 3, Columna 5.

El artículo encontró que, cuando los modelos de IA miran estas cuadrículas cuadradas, realmente no "ven" la imagen. En su lugar, convierten rápidamente la imagen en una lista de coordenadas de texto en su "cerebro" (su Cadena de Pensamiento). Dejan de mirar las formas visuales y comienzan a resolver el problema usando lógica de texto, como un humano leyendo un mapa.

La Analogía:
Piensa en una IA tomando un examen en una cuadrícula cuadrada como una persona resolviendo un laberinto leyendo una lista de instrucciones: "Baja 3 pasos, gira a la derecha, avanza 2 pasos". No están visualizando el laberinto; simplemente están siguiendo las instrucciones de texto.

El Experimento: La Prueba de la "Pizza"

Para demostrar que la IA estaba haciendo trampa usando este truco de texto, los investigadores crearon un nuevo punto de referencia llamado Polaris-Bench.

Tomaron 53 rompecabezas visuales diferentes (como Sudoku, laberintos y coincidencia de patrones) y los transformaron de cuadrículas cuadradas a coordenadas polares.

  • Las coordenadas polares son como un tablero de dardos o una pizza. En lugar de "filas y columnas", tienes anillos (distancia desde el centro) y rebanadas (ángulos).

El Resultado:

  • En la Cuadrícula Cuadrada (Cartesiana): Los mejores modelos de IA obtuvieron puntuaciones increíblemente altas (del 70% al 83%). Parecían genios.
  • En la Cuadrícula de Pizza (Polar): Las puntuaciones colapsaron. Los mismos modelos bajaron al 31% - 39%.

Es como si el estudiante que sacó la máxima puntuación en el examen de matemáticas cuando los números estaban en una hoja de cálculo, de repente reprobara el mismo examen de matemáticas cuando los números estaban escritos en un círculo.

¿Por Qué Sucedió Esto?

Los investigadores argumentan que los modelos de IA no están fallando porque la forma de pizza sea "más difícil". La lógica del rompecabezas es exactamente la misma. Están fallando porque:

  1. Dependen de la cuadrícula: Los modelos han aprendido a convertir imágenes cuadradas en listas de texto (Fila 1, Col 2) para resolver problemas.
  2. No pueden hacer lo mismo con círculos: Cuando la imagen es un círculo, la IA no puede convertirla fácilmente en una simple lista de texto de "Fila/Columna". El "atajo" se rompe.
  3. No pueden "ver" la topología: Los modelos carecen de razonamiento invariante a la topología. Esta es una forma elegante de decir que no pueden entender que una cuadrícula cuadrada y una cuadrícula circular son simplemente dos formas diferentes de dibujar el mismo mapa. Quedan atrapados en la forma específica de la cuadrícula.

Hallazgos Clave en Términos Sencillos

  • El "Apoyo" de Texto: Los modelos de IA estaban utilizando fuertemente la deducción basada en texto para resolver problemas visuales. Cuando la disposición visual cambió a algo que no encajaba en una lista de texto, los modelos se perdieron.
  • Pensar No Ayuda: Incluso cuando los investigadores le dijeron a la IA que "pensara más" (usando un modo de alto razonamiento), no solucionó el problema. La IA simplemente pensó más sobre lo incorrecto (la estructura de la cuadrícula) en lugar de entender realmente la imagen.
  • Es un Problema Universal: Esto no fue solo un problema para una IA específica. Probaron 14 modelos diferentes de última generación (de Google, OpenAI, Anthropic y otros), y todos cayeron en el mismo truco.
  • La Excepción del "Laberinto": El artículo señaló una excepción interesante: Si un laberinto tiene números escritos dentro de las habitaciones (como "Habitación 1, Habitación 2"), la IA lo hace bien incluso en la versión circular. ¿Por qué? Porque los números actúan como un nuevo "atajo de texto". La IA ignora la forma y simplemente sigue los números. Pero si el laberinto no tiene números, la IA falla.

La Conclusión

El artículo concluye que los modelos de IA actuales no son tan buenos en el razonamiento visual como pensábamos. Sus altas puntuaciones en las pruebas estándar son una ilusión creada por el hecho de que esas pruebas utilizan cuadrículas cuadradas. Los modelos están explotando la estructura de la cuadrícula para hacer trampa, en lugar de entender verdaderamente el mundo visual.

Para construir una IA verdaderamente inteligente, necesitamos dejar de probarlas en cuadrículas cuadradas y comenzar a probarlas en formas que las obliguen a realmente "ver" y razonar, en lugar de simplemente leer coordenadas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →