← Últimos artículos
💻 computer science

"Don't Say It!": Constraints, Compliance, and Communication when Language Models Play Taboo

Este artículo evalúa cómo los modelos de lenguaje de pesos abiertos navegan las demandas contrapuestas de las restricciones léxicas y la efectividad comunicativa en el juego de Tabú, revelando que, si bien las estrategias de intervención afectan el cumplimiento de las reglas y la calidad de la descripción, los modelos aún luchan significamente con la fundamentación léxica restringida en comparación con los humanos.

Autores originales: Sara Candussio, Francesca Padovani, Daniel Scalena, Malvina Nissim

Publicado 2026-07-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Sara Candussio, Francesca Padovani, Daniel Scalena, Malvina Nissim

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás jugando a un juego de fiesta llamado Taboo. Tienes una tarjeta con una palabra secreta en la parte superior (como "Pizza") y una lista de cinco palabras que no tienes permitido decir (como "Queso", "Italia", "Masa", "Rebanada" o "Entrega"). Tu objetivo es describir "Pizza" a tus amigos para que adivinen la palabra, sin usar ninguna de esas palabras prohibidas.

Este papel es como un experimento científico donde investigadores enseñaron a dos "jugadores" de IA diferentes cómo jugar a este juego. Querían ver:

  1. ¿Puede la IA seguir las reglas (no decir las palabras prohibidas)?
  2. ¿Puede la IA seguir describiendo bien la palabra para que alguien la adivine?
  3. ¿Cómo se compara la IA con un jugador humano?

Aquí hay un desglose de lo que hicieron y lo que encontraron, usando algunas metáforas sencillas.

Las tres formas en que intentaron evitar que la IA hiciera trampa

Los investigadores probaron tres métodos diferentes para obligar a la IA a obedecer las reglas, algo así como tres formas diferentes de evitar que un niño se coma una galleta antes de la cena:

  1. El método de "Pedir por favor" (Prompting):
    Simplemente le dijeron a la IA: "Por favor, describe esta palabra, pero no uses estas palabras específicas". Es como decirle a un niño: "Por favor, no te comas la galleta".

    • Resultado: La IA fue bastante buena escuchando, pero a veces todavía se le escapaba alguna palabra prohibida o una palabra que sonaba muy similar (como decir "quesoso" cuando "queso" estaba prohibido).
  2. El método de las "Esposas Digitales" (Generación con restricciones):
    Programaron la IA de modo que, en el momento en que intentara escribir una letra o palabra prohibida, el sistema la bloqueara físicamente. Es como poner un candado en el frasco de las galletas para que el niño literalmente no pueda abrirlo.

    • Resultado: Esto funcionó casi perfectamente. La IA nunca dijo las palabras prohibidas. Sin embargo, debido a que tenía tanto miedo de romper las reglas, a veces se volvía demasiado vaga, haciendo que fuera más difícil para el que adivinaba la respuesta.
  3. El método de la "Cirugía Cerebral" (SAEs/Manipulación interna):
    Este fue el más complejo. En lugar de bloquear palabras, intentaron retocar los "pensamientos" internos de la IA (su red neuronal) para hacer que el concepto de la palabra prohibida desapareciera de su mente mientras pensaba. Es como intentar convencer al niño de que: "En realidad, las galletas no existen en este momento", para que ni siquiera las piense.

    • Resultado: Fue un éxito agridulce. La IA todavía lograba decir algunas palabras prohibidas (la "cirugía" no era perfecta), ¡pero las descripciones que daba eran en realidad muy creativas y fáciles de adivinar! Parece que cuando solo bloqueas las palabras, la IA se vuelve torpe, pero cuando retocas su "mente", encuentra soluciones ingeniosas.

La gran sorpresa: la IA es terrible adivinando

Los investigadores invirtieron el juego. Hicieron que la IA intentara adivinar la palabra basándose en descripciones escritas por humanos u otras IA.

  • La ventaja humana: Cuando los humanos jugaban, eran excelentes adivinando. Podían ver una descripción como "Es redondo, rojo y le pones sobre la pasta" e instantáneamente pensar: "¡Tomate!".
  • La dificultad de la IA: La IA fue sorprendentemente mala en esto. Incluso cuando se le daba una descripción perfecta, la IA a menudo no podía adivinar la palabra. Era como tener a un estudiante que puede memorizar un libro de texto perfectamente pero falla al entender la historia cuando alguien se la cuenta.
    • El documento señala que la IA necesitó realizar de 5 a 10 intentos solo para llegar a ser tan buena adivinando como un humano que lo logra al primer intento.

La conclusión principal

El papel concluye que, para la IA, seguir las reglas y ser un buen comunicador son dos habilidades diferentes que a menudo luchan entre sí.

  • Si obligas a la IA a ser estricta con las reglas, se convierte en una descriptera aburrida y vaga.
  • Si dejas que sea creativa, podría romper las reglas accidentalmente.
  • Y sin importar lo buena que sea describiendo, todavía es muy mala en la parte de "adivinar".

Los investigadores sugieren que esto sucede porque los humanos tenemos una forma especial e intuitiva de conectar palabras en nuestros cerebros (como una red de asociaciones) que los modelos de IA actuales simplemente no tienen todavía. La IA puede seguir instrucciones, pero aún no ha aprendido la "intuición humana" necesaria para jugar a Taboo perfectamente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →