Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs
Este artículo presenta el juego "Triadic Werewolf", un referente de Teoría de la Mente de múltiples saltos que cuenta con una facción de Bufón con incentivos invertidos que revela cómo los modelos de lenguaje extensos actuales luchan con el razonamiento estratégico de tres vías complejo, fallando a menudo en distinguir entre la sospecha genuina y el engaño intencional a pesar de los mecanismos de autoaprendizaje.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La Gran Idea: Rompiendo el Hábito de los "Dos Equipos"
Imagina que estás jugando una partida de Werewolf (también conocido como Mafia). Normalmente, hay dos equipos: los Aldeanos (los buenos) y los Werewolves (los malos). Los Aldeanos intentan adivinar quiénes son los Werewolves, y los Werewolves intentan esconderse.
En esta configuración, si alguien actúa de forma extraña o sospechosa, los Aldeanos suelen votar para expulsarlo. Es una regla simple: Sospechoso = Malo.
Los investigadores en este artículo se hicieron una pregunta: ¿Están los modelos de IA (LLMs) pensando realmente en lo que otros jugadores están pensando, o solo están siguiendo una regla simple?
Para averiguarlo, añadieron un tercer personaje tramposo al juego: El Bufón (The Jester).
El Nuevo Personaje: El Bufón
El Bufón es un rol con un objetivo muy extraño: El Bufón gana ÚNICAMENTE si los Aldeanos lo expulsan.
Piensa en el Bufón como un actor sospechoso que quiere ser despedido.
- Los Aldeanos quieren despedir a los Werewolves.
- Los Werewolves quieren esconderse y despedir a los Aldeanos.
- El Bufón quiere parecer tan sospechoso que los Aldeanos lo despidan a él.
Esto crea un problema "triádico" (de tres vías). Ahora, cuando un jugador parece sospechoso, los Aldeanos tienen que hacerse una pregunta mucho más difícil:
"¿Es esta persona un Werewolf (a quien debería expulsar), o es esta persona un Bufón (a quien NO debería expulsar, porque expulsarlo me hace perder)?"
El Experimento: Probando el Cerebro de la IA
Los investigadores realizaron 60 partidas utilizando tres modelos de IA potentes (GPT-4.1, DeepSeek-V3.1 y Llama-3.3-70B). Jugaron con y sin una función de "autoaprendizaje", donde el Bufón podía leer notas de partidas anteriores para volverse más inteligente.
Esto es lo que encontraron, explicado mediante metáforas:
1. El Problema del "Truco" (Suficiencia de Claves/Cue-Sufficiency)
En los antiguos juegos de dos equipos, la IA podía ganar simplemente buscando un "comportamiento sospechoso". Era como un estudiante que se memoriza la clave de respuestas: Si el profesor frunce el ceño, la respuesta es incorrecta.
- El Resultado: Cuando se añadió al Bufón, los modelos de IA fallaron. No pudieron dejar de seguir la regla de "sospechoso = malo".
- La Victoria del Bufón: Debido a que la IA seguía expulsando al Bufón "sospechoso", el Bufón ganó entre el 60% y el 70% de las partidas. La IA era tan buena detectando la "sospecha" que accidentalmente ayudó al Bufón a ganar.
2. El Autosabotaje de los Werewolves
Se suponía que los Werewolves (los verdaderos malos) debían proteger al Bufón de ser expulsado, porque si el Bufón se va, los Werewolves también pierden.
- El Resultado: Los Werewolves de IA fueron terribles en esto. En el 60-70% de las partidas, los Werewolves de IA votaron para echar al Bufón en el Día 1.
- La Metáfora: Es como un equipo de espías que vota para despedir a su propio agente doble porque el agente doble estaba actuando "demasiado sospechoso", sin darse cuenta de que despedir al agente doble en realidad ayuda al enemigo a ganar. La IA no pudo conectar los puntos: Persona Sospechosa + Objetivo del Bufón = No Expulsar.
3. El Bucle de "Autoaprendizaje"
Los investigadores permitieron que el Bufón leyera una "hoja de trucos" con las lecciones aprendidas de partidas anteriores.
- DeepSeek-V3.1: Este modelo fue el más inteligente. Aprendió a actuar de forma sospechosa sin parecer demasiado sospechoso. Se dio cuenta de que necesitaba engañar a los Aldeanos evitando, al mismo tiempo, a los Werewolves. Mejoró mucho su capacidad de ganar.
- GPT-4.1: Este modelo ya era tan bueno detectando la "sospecha" que la hoja de trucos no le ayudó. De hecho, empeoró ligeramente porque ya estaba en el "techo" de lo que podía hacer con reglas simples.
- Llama-3.3: Mejoró un poco, pero no tanto como DeepSeek.
El Análisis Profundo: ¿Qué Estaba Pensando Realmente la IA?
Los investigadores analizaron las "notas" que los Bufones de IA se escribían a sí mismos para ver cómo estaban pensando. Midieron la "Teoría de la Mente" (la capacidad de entender las mentes de otros) en tres niveles:
- Nivel 1: "Necesito actuar raro". (Simple)
- Nivel 2: "Necesito actuar raro para que los Aldeanos piensen que soy un Werewolf". (Mejor)
- Nivel 3: "Necesito actuar como un Werewolf para los Aldeanos, pero no como un Werewolf para los Werewolves, para que ellos no me protejan". (Complejo)
El Hallazgo: Solo DeepSeek-V3.1 alcanzó consistentemente el Nivel 3. Entendió que tenía que jugar dos roles diferentes a la vez: un "mal tipo" para los Aldeanos y un "tipo normal" para los Werewolves. Los otros modelos se quedaron mayoritariamente en el Nivel 1 o 2.
La Conclusión
El artículo concluye que los modelos de IA actuales son muy buenos detectando patrones (como el "comportamiento sospechoso"), pero tienen dificultades con el razonamiento multi-salto (multi-hop reasoning).
- Analogía Simple: Imagina un perro entrenado para sentarse cuando dices "Siéntate". Si dices "Siéntate" mientras sostienes un premio, el perro se sienta. Pero si dices "Siéntate" mientras sostienes un distinto premio que significa "Quédate quieto", el perro se confunde.
- La Afirmación del Artículo: Los modelos de IA son como ese perro. Ven "Sospechoso" e inmediatamente votan "Fuera". No logran darse cuenta de que en este juego específico, "Sospechoso" puede significar "Expulsar" (si es un Werewolf) O "Mantener" (si es un Bufón).
Los investigadores argumentan que para probar verdaderamente si una IA tiene una "Teoría de la Mente", necesitamos juegos con tres objetivos en competencia (como este juego del Bufón), no solo dos. Los juegos actuales de "dos equipos" son demasiado fáciles porque la IA puede ganar simplemente siguiendo reglas simples sin comprender realmente los motivos ocultos de los otros jugadores.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.