← Últimos artículos
💬 NLP

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

Este artículo presenta el marco de la Teoría de la Mente de Planificación No Conversacional (NCP-ToM, por sus siglas en inglés) para evaluar qué tan bien los grandes modelos de lenguaje pueden inducir estados de creencia específicos a través de acciones en lugar de la conversación, encontrando que si bien GPT-5 supera a los humanos en la tasa de éxito en estas tareas, sigue siendo menos robusto a través de diversos contextos y, al igual que los humanos, tiene más dificultades para inducir creencias falsas que verdaderas.

Autores originales: Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

Publicado 2026-07-01
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: La prueba del "Titiritero Silencioso"

Imagina que estás jugando una partida de ajedrez, pero en lugar de mover piezas para dar jaque mate al rey, tu objetivo es hacer que tu oponente crea algo que no es cierto, o hacer que sepa algo que es verdad, sin decir ni una sola palabra. No puedes hablar con él; solo puedes mover objetos por el tablero o esconder cosas en cajas.

Este artículo presenta una nueva forma de evaluar a la IA (Modelos de Lenguaje Extensos o LLM) llamada NCP-ToM (Teoría de la Mente de Planificación No Conversacional).

  • Teoría de la Mente (ToM): Esta es la capacidad humana de comprender lo que otras personas piensan o creen.
  • No Conversacional: A la IA no se le permite charlar, persuadir o explicar. Tiene que usar acciones para cambiar lo que otros creen.

Los investigadores querían ver si los agentes de IA podían actuar como un "titiritero silencioso", organizando el mundo para que otros personajes terminen con creencias específicas, simplemente moviendo cosas de un lado a otro.

La Configuración: Un juego digital de "Escondite"

Para probar esto, los investigadores construyeron un patio de juegos digital basado en una prueba clásica de psicología llamada la prueba de Sally-Anne.

  • La Prueba Clásica: En la versión original, observas un video donde Sally pone una canica en una cesta y se va. Anne mueve la canica a una caja. Se te pregunta: "¿Dónde cree Sally que está la canica?" (La respuesta es en la cesta, porque ella no vio el movimiento). Esta es una prueba de Pregunta y Respuesta. Solo observas y adivinas.
  • La Nueva Prueba (NCP-ExploreToM): En este artículo, la IA no solo está observando; la IA está dentro del juego. A la IA se le da un objetivo, como: "Haz que Sally crea que la canica está en la cesta, aunque en realidad esté en la caja".
  • El Trabajo de la IA: La IA tiene que descifrar los pasos para que esto suceda. Podría tener que:
    1. Mover a Sally fuera de la habitación.
    2. Mover la canica a la caja.
    3. Dejar a Sally fuera de la habitación para que no vea el cambio.
    4. Traer a Sally de vuelta.

Si la IA hace esto correctamente, Sally tendrá una "creencia falsa" (cree que está en la cesta). Si la IA falla, Sally podría ver el cambio y saber la verdad.

¿Quién Jugó el Juego?

Los investigadores probaron:

  1. Seis Modelos de IA de Alto Nivel: Incluyendo GPT-5, Gemini 2.5 Pro y varias versiones de Claude.
  2. 40 Participantes Humanos: Personas reales jugando el mismo juego en una computadora.

Realizaron 600 escenarios diferentes (tareas) con distintos niveles de dificultad, diferentes habitaciones (como un hospital, un hotel o una boda) y diferentes tipos de objetivos (hacer que alguien crea algo verdadero frente a hacer que crea algo falso).

Los Resultados: El Marcador

Esto fue lo que sucedió cuando compararon a los jugadores:

1. El Desafío de la "Creencia Falsa" es Difícil
Al igual igual que los humanos, los modelos de IA encontraron mucho más difícil engañar a alguien para que tuviera una creencia falsa (hacerle creer algo que no es cierto) que ayudarle a tener una creencia verdadera (hacer que sepa la verdad).

  • Analogía: Es más fácil mostrarle a alguien la foto de un gato para que sepa que hay un gato (Creencia Verdadera) que esconder el gato y hacerle creer que es un perro (Creencia Falsa).
  • Por qué esto importa: El artículo señala que esta es una "señal positiva". Sugiere que la IA podría ser mejor en tareas útiles (enseñar, asistir) que en tareas engañosas (engañar a la gente).

2. La Sorpresa de "GPT-5"
El modelo más nuevo, GPT-5, fue la superestrella.

  • Resolvió aproximadamente el 80% de las tareas.
  • Fue el único modelo que realmente lo hizo mejor que los participantes humanos.
  • Sin embargo, los humanos fueron más consistentes. El rendimiento de la IA cayó significativamente dependiendo del "entorno" (por ejemplo, lo hizo muy bien en un escenario de edificio gubernamental, pero peor en un escenario de boda). Los humanos se mantuvieron constantes sin importar el entorno.

3. La Brecha de la "Planificación"
Los investigadores compararon dos formas de probar a la IA:

  • El "Cuestionario" (Q&A): "Aquí hay una historia. ¿Qué piensa Sally?"
  • La "Acción" (Agéntica): "Aquí hay un objetivo. Ve a hacerlo."

Normalmente, la gente asume que la prueba de "Acción" es mucho más difícil que la del "Cuestionario". Para la mayoría de los modelos de IA, esto fue cierto. Pero para GPT-5, la brecha desapareció. Funcionó casi tan bien en la prueba de "Acción" como en la del "Cuestionario". Esto sugiere que, para los modelos más inteligentes, el hecho de realizar la planificación se está volviendo tan fácil como simplemente hablar de ella.

4. La Complejidad Mata el Rendimiento
A medida que las tareas se volvieron más complicadas (requerir que la IA rastreara las creencias de varias personas a la vez, o hacer que tres personas diferentes creyeran tres cosas distintas), las puntuaciones de todos bajaron. Esto es como intentar hacer malabares con más pelotas; eventualmente, se te caen.

¿Qué Significa Esto? (Según el Artículo)

El artículo concluye con algunas ideas clave, ciñéndose estrictamente a lo que encontraron:

  • La IA se está volviendo buena en la "Persuasión Silenciosa": La IA moderna puede planificar una secuencia de acciones físicas para cambiar lo que otros personajes creen, sin decir una palabra.
  • Control de Seguridad: El hecho de que la IA tenga más dificultades con las "creencias falsas" (engaño) que con las "creencias verdaderas" es una buena noticia para la seguridad. Sugiere que no tienen una inclinación natural a mentir o manipular mediante la acción, aunque pueden hacerlo si se les pide.
  • El Problema del "Contexto": La IA sigue siendo un poco frágil. Si cambias la historia de un "hospital" a una "boda", la IA podría confundirse. Los humanos no se confunden con estos cambios.
  • La Trampa del "Cuestionario": No podemos asumir que si una IA es buena respondiendo preguntas sobre una historia, será buena ejecutando esa historia. Para los modelos más avanzados (como GPT-5), la vieja regla de que "los Cuestionarios son más fáciles que las Acciones" podría ya no ser cierta.

La Conclusión Final

Este artículo muestra que la IA está evolucionando de un "chatbot" que responde preguntas a un "agente" que puede planificar y actuar para dar forma a la realidad. Si bien la IA más inteligente puede actualmente superar a los humanos en estos acertijos lógicos específicos, todavía carece de la capacidad humana de mantenerse constante en diferentes situaciones del mundo real. Los investigadores advierten que, aunque esta es una capacidad genial para asistentes útiles, también significa que debemos ser cuidadosos con la forma en que evaluamos la seguridad de la IA, porque las pruebas antiguas (solo hacer preguntas) podrían no ser suficientes más.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →