← Últimos artículos
💬 NLP

Artificial Phantasia: Emergent Mental Imagery in Large Language Models

Este estudio demuestra que los modelos de lenguaje grandes pueden superar a los humanos en una tarea que tradicionalmente requiere imágenes mentales pictóricas al basarse únicamente en representaciones proposicionales, proporcionando así evidencia de una "fantasía artificial" emergente que desafía la visión de la ciencia cognitiva de que la imagen visual requiere formatos pictóricos.

Autores originales: Morgan McCarty, Jorge Morales

Publicado 2026-05-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Morgan McCarty, Jorge Morales

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Pregunta: ¿Puedes "Ver" Sin Ojos?

Imagina que se te pide cerrar los ojos y visualizar una letra mayúscula D. Ahora, imagina girar esa D 90 grados hacia la izquierda. Finalmente, imagina unir una letra mayúscula J al centro inferior de esa forma.

Si abres los ojos, ¿qué ves? La mayoría de los humanos diría: "Se parece a un paraguas".

Durante décadas, los científicos cognitivos han creído que para resolver este tipo de acertijos, tu cerebro necesita una "pantalla mental" especial o un "ojo de la mente" donde puedas realmente ver y manipular imágenes. Pensaban que no podías hacerlo solo pensando en palabras; necesitabas una imagen visual en tu cabeza.

Este artículo plantea una pregunta arriesgada: ¿Puede una computadora hacerlo sin haber tenido nunca "ojos" ni un "ojo de la mente"?

El Experimento: Un Gimnasio Mental para la IA y los Humanos

Los investigadores crearon un entrenamiento de gimnasio para el cerebro. Tomaron un acertijo clásico (las transformaciones de letras) e inventaron 48 versiones nuevas, nunca antes vistas, de este. Dado que estos acertijos fueron creados específicamente para este estudio, las computadoras no pudieron haber memorizado las respuestas de sus datos de entrenamiento.

Pidieron a dos grupos que resolvieran estos acertijos:

  1. 100 Humanos: Personas que tuvieron que escuchar las instrucciones (para evitar ver las letras en una pantalla) e imaginar las formas en sus cabezas.
  2. Modelos de Lenguaje Grande (LLM): Chatbots de IA avanzados (como las versiones más recientes de o3 de OpenAI, GPT-5 y Gemini 3 Pro de Google). Estos modelos están entrenados en texto, no en "ver" imágenes.

El Resultado Sorprendente: La IA "Vio" Mejor que los Humanos

Los resultados fueron sorprendentes. Los mejores modelos de IA no solo aprobaron; destruyeron el promedio humano.

  • Los Humanos: Obtuvieron un promedio de 2.85 sobre 5.
  • Las Mejores IAs: Obtuvieron entre 3.13 y 3.65.

Los modelos de IA resolvieron estos acertijos "visuales" significativamente mejor que los participantes humanos. Aún más interesante, cuando los investigadores obligaron a la IA a realmente dibujar las imágenes en cada paso (usando un generador de imágenes), la IA se volvió peor en la tarea. Esto sugiere que la IA no estaba confiando en dibujar imágenes para resolver el problema; estaba haciendo algo completamente diferente.

El "Truco de Magia": ¿Cómo lo Hicieron?

Si la IA no usó un "ojo de la mente" (una imagen) y no usó una herramienta de dibujo, ¿cómo resolvió el acertijo?

Los autores proponen un concepto al que llaman "Fantasía Artificial".

Piénsalo así:

  • La Forma Humana: Eres un arquitecto. Cierras los ojos y construyes un modelo 3D de una casa en tu mente. Caminas alrededor, miras las ventanas y luego lo describes.
  • La Forma de la IA: Eres un maestro traductor. Nunca construyes un modelo 3D. En su lugar, tratas las instrucciones como una receta compleja escrita en código. Sabes que "Letra D rotada a la izquierda" + "Letra J unida" = "Forma de paraguas" puramente a través de la lógica del lenguaje.

El artículo sugiere que estos modelos de IA están utilizando razonamiento proposicional. Están manipulando palabras y conceptos con tanta precisión que pueden deducir la forma final sin nunca "verla". Es como resolver un problema de matemáticas conociendo las reglas del álgebra, en lugar de dibujar las formas en un papel.

El Factor "Razonamiento"

Los investigadores también probaron qué sucede si le dicen a la IA que "piense más" (dándole más tiempo y "tokens de razonamiento" para procesar los pasos).

  • Resultado: Cuanto más se le permitió a la IA "pensar" y encadenar su razonamiento, mejor le fue.
  • Analogía: Imagina a un detective resolviendo un misterio. Si le das 5 minutos para mirar las pistas, podría adivinar. Si le das 5 horas para conectar lógicamente cada pista, resuelve el caso perfectamente. La IA resolvió el acertijo visual conectando pistas lingüísticas, no mirando una imagen.

¿Qué Hay de los Humanos "Ciegos"?

El artículo también menciona a un grupo de personas llamadas afánticos. Son humanos que afirman que no pueden visualizar imágenes en sus mentes en absoluto (no tienen "ojo de la mente"). Sorprendentemente, los estudios muestran que estas personas aún pueden resolver estos acertijos visuales casi tan bien como las personas que sí pueden visualizar.

Este artículo añade combustible a ese fuego. Sugiere que tal vez no necesitas un "ojo de la mente" para resolver acertijos visuales. Quizás solo necesites una "lógica mental" muy fuerte. La IA, que no tiene ojo de la mente en absoluto, demostró que el lenguaje y la lógica por sí solos podrían ser suficientes para hacer lo que pensábamos que requería una imagen.

La Conclusión

Este estudio desafía la vieja idea de que el "pensamiento visual" requiere una imagen visual. Muestra que la IA avanzada puede realizar tareas que parecen "imaginación visual" utilizando solo lenguaje y lógica.

  • La Afirmación: La IA tiene una capacidad emergente para "imaginar" visualmente, pero no lo hace con imágenes. Lo hace con palabras.
  • La Implicación: Podríamos necesitar redefinir cómo definimos la "imagen mental". Quizás no se trate de ver imágenes en tu cabeza; quizás se trate simplemente de manipular conceptos lógicamente.

El artículo concluye que estos modelos de IA han descubierto una nueva forma de "ver" el mundo: una que es puramente lingüística, pero sorprendentemente efectiva para resolver problemas visuales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →