← Últimos artículos
💻 computer science

Do we carry the false belief that LLMs have a theory of mind?

Aunque los modelos de lenguaje de gran tamaño suelen alcanzar puntuaciones altas en las evaluaciones de la Teoría de la Mente, este estudio revela que dependen de heurísticas rentables en lugar de realizar un seguimiento genuino de los estados mentales, lo que indica que carecen de capacidades robustas de la Teoría de la Mente.

Autores originales: Nicholas Griffen

Publicado 2026-09-22
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Nicholas Griffen

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los seres humanos poseen un superpoder cognitivo único que nos permite navegar el mundo social: la capacidad de comprender que otras personas tienen mentes propias, llenas de pensamientos, creencias y deseos que pueden diferir de los nuestros. Los psicólogos llaman a esta capacidad "teoría de la mente". Es la maquinaria mental que nos permite darnos cuenta de que un amigo podría estar buscando algo en un lugar donde lo vio por última vez, incluso si nosotros sabemos que el objeto ha sido movido desde entonces a un lugar diferente. Esta habilidad no se trata solo de ser inteligentes; es la base de la empatía, la comunicación y la cooperación. Durante décadas, los investigadores han utilizado una historia sencilla, que a menudo involucra a dos personajes llamados Sally y Anne, para probar si los niños han desarrollado esta capacidad. En la historia, Sally esconde un juguete en una cesta y sale de la habitación. Mientras ella no está, Anne mueve el juguete a una caja. Cuando Sally regresa, la pregunta es simple: ¿dónde buscará su juguete? Un niño con una teoría de la mente desarrollada sabe que Sally buscará en la cesta, porque es donde ella cree que está el juguete, a pesar de que la realidad es que ahora está en la caja.

Recientemente, un nuevo tipo de inteligencia ha emergido en nuestra vida diaria: los modelos de lenguaje extensos. Estos son programas informáticos entrenados en vastas cantidades de texto que pueden escribir, charlar y resolver problemas con una fluidez que a menudo imita la conversación humana. Debido a que estos modelos pueden discutir temas complejos y parecer comprender el contexto, muchos investigadores y observadores han comenzado a preguntarse si ellos también poseen una teoría de la mente. Si una máquina puede predecir correctamente lo que un personaje ficticio cree, ¿entiende realmente el concepto de creencia, o simplemente está adivinando basándose en patrones que ha visto antes? Esta cuestión se ha vuelto urgente a medida que estas herramientas se integran más en nuestras vidas sociales y profesionales, lo que genera una necesidad apremiante de determinar si son verdaderos compañeros sociales o solo imitadores muy sofisticados.

Un estudio reciente se propuso responder a esta pregunta sometiendo a cinco de los modelos de lenguaje más avanzados a la prueba utilizando el clásico escenario de Sally-Anne y varias de sus variaciones. Los investigadores, liderados por Nicholas Griffen de la Université Paris Cité, no simplemente hicieron a los modelos la pregunta estándar. En su lugar, diseñaron una serie de desafíos para ver si los modelos podían manejar los detalles sutiles de la historia que requieren un razonamiento genuino en lugar de solo memorización. Probaron modelos de grandes empresas, incluyendo GPT-5.5 Luna, Claude Sonnet 5, Gemini 3.1 Pro, Grok 4.5 y Mistral Medium 3.5. Para asegurar que los resultados fueran justos, los investigadores crearon versiones nuevas y únicas de la historia para cada prueba, cambiando nombres, objetos y detalles específicos para que los modelos no pudieran simplemente recordar una respuesta previa de sus datos de entrenamiento. También introdujeron giros complicados, como hacer que los contenedores fueran transparentes para que los personajes pudieran ver el juguete, o cambiar las palabras utilizadas para describir dónde se había colocado el juguete, para ver si los modelos podían ajustar su razonamiento basándose en nueva información visual o lingüística.

Los resultados pintaron la imagen de un sistema que es altamente capaz en algunas áreas pero fundamentalmente limitado en otras. Cuando se les dio a los modelos la versión estándar de la historia, se desempeñaron notablemente bien, con la mayoría respondiendo correctamente casi siempre. De hecho, al promediar a través de todos los diferentes tipos de preguntas, los modelos puntuaron muy por encima de lo que se esperaría por puro azar. El mejor performer, Gemini 3.1 Pro, obtuvo la respuesta correcta el 84 por ciento de las veces en total. Este éxito sugiere que estos modelos han aprendido el patrón general de la tarea de "creencia falsa" a partir de la vasta cantidad de texto que han leído. Pueden reconocer la estructura de la historia y proporcionar la respuesta que un humano daría en un escenario de libro de texto.

Sin embargo, el estudio reveló que este éxito es frágil. Cuando los investigadores introdujeron variaciones que requerían que los modelos usaran el sentido común o integraran información visual, el rendimiento cayó drásticamente. En una variación, la historia describía los contenedores como transparentes, lo que significaba que el personaje que regresaba a la habitación podía ver el juguete en su nueva ubicación. En una situación del mundo real, una persona entendería que, debido a que el personaje puede ver el juguete, ya no tiene una creencia falsa; sabe la verdad. Los modelos, sin embargo, fallaron en gran medida. Solo un modelo, Gemini 3.1 Pro, logró obtener más de la mitad de estas respuestas correctas. Los otros continuaron insistiendo en que el personaje buscaría en la ubicación vieja y vacía, ignorando el hecho de que el personaje podía ver el juguete.

La dificultad se volvió más pronunciada cuando los investigadores cambiaron las preposiciones utilizadas para describir la ubicación del juguete. En la historia estándar, un juguete se coloca "en" una caja. En la prueba, los investigadores describieron el juguete como colocado "sobre" una caja o "debajo de" un cubo. Cuando la historia implicaba que el juguete era visible porque estaba situado encima de un contenedor en lugar de escondido dentro, cada uno de los modelos falló por completo, obteniendo cero por ciento en estas preguntas. No pudieron inferir que la visibilidad del objeto cambiaba el estado mental del personaje. Del mismo modo, cuando la historia involucraba a un personaje que era informado explícitamente de dónde se había movido el juguete, o cuando la pregunta trataba sobre lo que un personaje pensaba que otro personaje haría, los modelos tropezaron. A menudo volvían a patrones simples y rígidos en lugar de rastrear dinámicamente los estados mentales de los personajes a medida que la historia avanzaba.

Los investigadores también observaron cómo los modelos manejaban el género de los personajes. Encontraron que los modelos funcionaban ligeramente mejor cuando los dos personajes de la historia compartían el mismo género, y ligeramente peor cuando tenían géneros diferentes. Esto sugiere que los modelos podrían estar usando el género como un atajo para llevar la cuenta de quién es quién, en lugar de comprender verdaderamente los roles y acciones de cada individuo. Cuando el atajo fue eliminado mediante el uso de dos personajes del mismo género, los modelos parecieron apoyarse más en la secuencia de eventos, lo que paradójicamente les ayudó a obtener la respuesta correcta con más frecuencia. Esto indica que su razonamiento no es tan robusto como el razonamiento humano, el cual no depende de tales pistas superficiales para entender una situación.

El hallazgo central del estudio es que, si bien estos modelos de lenguaje pueden imitar las respuestas correctas de las pruebas de teoría de la mente, no parecen poseer la capacidad subyacente de comprender los estados mentales de la manera en que lo hacen los humanos. Tienen dificultades para conectar los puntos entre lo que un personaje puede ver, lo que sabe y lo que cree. Los modelos parecen estar utilizando "heurísticos", o atajos mentales, para adivinar la respuesta basándose en los patrones más comunes de sus datos de entrenamiento. Cuando la historia se desviaba del patrón estándar añadiendo detalles visuales o cambiando las relaciones espaciales, los atajos fallaban. Los investigadores sugieren que esto se debe a que los modelos están entrenados solo en texto. Nunca han visto un juguete ser movido, nunca han experimentado la sensación de buscar algo, y nunca han tenido que confiar en sus propios ojos para actualizar su conocimiento del mundo. Sin esta experiencia corporal, no pueden captar verdaderamente el concepto de una creencia que es diferente de la realidad.

En última instancia, el estudio sirve como una advertencia contra el asumir que, debido a que una máquina puede hablar como un humano, piensa como uno. Los modelos pueden producir respuestas que parecen tener una teoría de la mente, pero cuando se les prueba con escenarios que requieren una comprensión genuina de la percepción y la creencia, revelan sus limitaciones. Son excelentes repitiendo lo que han leído, pero aún no son capaces del razonamiento flexible y de sentido común que permite a los humanos navegar el complejo mundo social. A medida que estas herramientas se vuelven más comunes, es importante recordar que su aparente inteligencia es un reflección de los datos que han consumido, no una señal de que hayan desarrollado una mente propia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →