From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning
El estudio presenta \textsc{MazeBench}, un benchmark que demuestra que, aunque modelos multimodales avanzados logran altas tasas de acierto en laberintos visuales, lo hacen mediante una búsqueda exhaustiva en el espacio de tokens tras convertir la imagen a texto, en lugar de emplear una planificación espacial genuina similar a la humana.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
¡Claro que sí! Imagina que este artículo es como una investigación policial sobre cómo los "superhéroes" de la inteligencia artificial (las IAs multimodales) intentan resolver un laberinto.
Aquí tienes la historia de "De los Píxeles al Caos: ¿Planifican de verdad o solo adivinan?", explicada de forma sencilla:
🕵️♂️ La Misión: El Laberinto de los 110
El autor, Alberto, creó un nuevo examen llamado MAZEBENCH. Imagina que le das a una IA una foto de un laberinto (desde uno pequeño de 5x5 hasta uno gigante de 20x20) y le dices: "Encuentra el camino más corto desde el inicio hasta el tesoro".
Un humano ve la foto, mira con los ojos, traza la ruta mentalmente en segundos y listo. ¡Problema resuelto!
🤖 Lo que descubrieron: ¡Es una trampa!
Los resultados fueron sorprendentes. IAs muy potentes como GPT-5.4 resolvieron el 91% de los laberintos. ¡Parece genial, ¿verdad?
Pero aquí está el truco:
No están "viendo" el laberinto como nosotros. No están usando su "intuición espacial". En su lugar, están haciendo algo mucho más tonto y costoso:
- Traducen la foto a texto: Primero, la IA mira la imagen y la convierte en una tabla de texto (como una hoja de cálculo llena de
#para paredes y.para caminos). - Adivinan a lo bruto: Una vez que tienen el texto, empiezan a probar caminos uno por uno, escribiendo en su "diario de pensamiento": "Pruebo ir arriba... ¡chocó! Pruebo abajo... ¡chocó! Pruebo derecha...".
Es como si, en lugar de mirar un mapa y ver el camino, alguien te obligara a caminar por el laberinto a ciegas, tropezando con cada pared, escribiendo en un cuaderno cada paso que das, hasta que encuentras la salida.
💸 El precio de la "inteligencia"
Aquí viene la parte más divertida (y cara):
- El humano: Ve el laberinto y lo resuelve en 2 segundos. Cero esfuerzo.
- La IA (GPT-5.4): Resuelve el mismo laberinto, pero escribe 2,900 palabras de "pensamiento" para hacerlo.
- Otras IAs (como Gemini): Escriben 15,000 palabras para el mismo trabajo.
Es como si para comprar un café, tú lo hicieras en 1 minuto, pero la IA tuviera que escribir un libro de 500 páginas sobre la historia del café, el cultivo del grano y la química del agua, solo para decirte "aquí está tu café".
🧱 El problema de los "Ojos" (La prueba de la verdad)
El autor hizo un experimento genial con una IA llamada Claude.
- Con la foto: Claude fallaba casi siempre (6% de aciertos).
- Sin la foto, solo con el texto: Le dieron a Claude la tabla de texto perfecta (sin la foto) y le dijeron: "Ahora, resuelve el laberinto".
- Resultado: ¡Saltó al 80% de aciertos!
¿Qué significa esto?
Que el cerebro de Claude para "pensar" y buscar caminos es muy bueno. Su problema es que sus "ojos" son malos. Cuando intenta traducir la foto a texto, comete errores (dice que una pared está donde no hay, o que el laberinto es más grande de lo que es). Al trabajar sobre un mapa falso, aunque piense mucho, termina en el callejón sin salida.
🚫 ¿Pueden dejar de hacerlo así?
El autor les pidió a las IAs: "Por favor, no conviertas la foto en texto. Mira la imagen y usa tu intuición visual como un humano".
¿Qué pasó?
Las IAs ignoran la orden. Siguen convirtiendo la foto en texto y haciendo su lista de pasos. Es como si les dijeras a un perro que no ladre, pero él sigue ladrando porque es su única forma de comunicarse. No pueden "pensar" visualmente; solo saben "pensar" en palabras.
🏁 La conclusión final
El mensaje principal del artículo es una advertencia para todos:
Que una IA tenga una nota alta (90% de aciertos) no significa que sea inteligente como un humano.
Simplemente significa que es muy buena en dos cosas:
- Traducir imágenes a texto (a veces).
- Escribir millones de palabras para probar todas las rutas posibles hasta que una funcione.
Si el laberinto es demasiado grande, la IA se queda sin espacio en su "cuaderno" (límite de tokens) y se rinde, aunque un humano lo hubiera resuelto en un parpadeo.
En resumen: Las IAs actuales no son arquitectos que ven el plano; son escribanos muy rápidos que prueban cada puerta hasta encontrar la correcta, gastando una fortuna en tinta (tokens) en el proceso. ¡Y eso no es lo mismo que "entender"!
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.