← Últimos artigos
💻 computer science

"Don't Say It!": Constraints, Compliance, and Communication when Language Models Play Taboo

Este artigo avalia como modelos de linguagem de pesos abertos navegam pelas demandas conflitantes de restrições lexicais e eficácia comunicativa no jogo Tabu, revelando que, embora as estratégias de intervenção afetem a conformidade com as regras e a qualidade da descrição, os modelos ainda apresentam dificuldades significativas com o ancoramento lexical restrito em comparação aos humanos.

Autores originais: Sara Candussio, Francesca Padovani, Daniel Scalena, Malvina Nissim

Publicado 2026-07-02
📖 4 min de leitura☕ Leitura rápida

Autores originais: Sara Candussio, Francesca Padovani, Daniel Scalena, Malvina Nissim

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está jogando um jogo de festa chamado Taboo. Você tem uma carta com uma palavra secreta no topo (como "Pizza") e uma lista de cinco palavras que você não pode dizer (como "Queijo", "Itália", "Massa", "Fatia" ou "Entrega"). Seu objetivo é descrever "Pizza" para seus amigos para que eles adivinhem, sem usar nenhuma dessas palavras proibidas.

Este papel é como um experimento científico onde pesquisadores ensinaram dois diferentes "jogadores" de IA a jogar este jogo. Eles queriam ver:

  1. A IA consegue seguir as regras (não dizer as palavras proibidas)?
  2. A IA ainda consegue descrever bem a palavra para que alguém a adivinhe?
  3. Como a IA se compara a um jogador humano?

Aqui está uma divisão do que eles fizeram e do que descobriram, usando algumas metáforas simples.

As Três Maneiras que Tentaram Impedir a IA de Trapacear

Os pesquisadores tentaram três métodos diferentes para forçar a IA a obedecer às regras, kind of como três maneiras diferentes de impedir uma criança de comer um biscoito antes do jantar:

  1. O Método "Pedir Gentilmente" (Prompting):
    Eles simplesmente disseram à IA: "Por favor, descreva esta palavra, mas não use estas palavras específicas". É como dizer a uma criança: "Por favor, não coma o biscoito".
  • Resultado: A IA foi muito boa em ouvir, mas às vezes ela ainda escorregava e usava uma palavra proibida ou uma palavra que soava muito parecida (como dizer "Queijoso" quando "Queijo" estava proibido).
  1. O Método das "Algemas Digitais" (Geração com Restrição):
    Eles programaram a IA de modo que, no momento em que ela tentasse digitar uma letra ou palavra proibida, o sistema a bloqueasse fisicamente. É como colocar um cadeado no pote de biscoitos para que a criança literalmente não consiga abri-lo.
  • Resultado: Isso funcionou quase perfeitamente. A IA nunca disse as palavras proibidas. No entanto, porque estava com tanto medo de quebrar as regras, ela às vezes tornava-se muito vaga, tornando mais difícil para quem estava adivinhando descobrir a resposta.
  1. O Método da "Cirurgia Cerebral" (SAEs/Manipulação Interna):
    Este foi o mais complexo. Em vez de bloquear palavras, eles tentaram ajustar os "pensamentos" internos da IA (sua rede neural) para fazer o conceito da palavra proibida desaparecer de sua mente enquanto ela pensava. É como tentar convencer a criança: "Na verdade, biscoitos não existem agora", para que ela nem sequer pense neles.
  • Resultado: Foi um misto de resultados. A IA ainda conseguiu dizer algumas palavras proibidas (a "cirurgia" não foi perfeita), mas as descrições que ela deu foram, na verdade, muito criativas e fáceis de adivinhar! Parece que quando você apenas bloqueia as palavras, a IA fica desajeitada, mas quando você ajusta a "mente" dela, ela encontra contornos inteligentes.

A Grande Surpresa: A IA é Terrível em Adivinhar

Os pesquisadores inverteram o jogo. Eles fizeram a IA tentar adivinhar a palavra baseada em descrições escritas por humanos ou outras IAs.

  • A Vantagem Humana: Quando os humanos jogavam, eram ótimos em adivinhar. Eles podiam olhar para uma descrição como "É redondo, vermelho e você coloca sobre a massa" e instantaneamente pensar: "Tomate!".
  • A Dificuldade da IA: A IA foi surpreendentemente ruim nisso. Mesmo quando recebida uma descrição perfeita, a IA muitas vezes não conseguia adivinhar a palavra. Era como ter um aluno que consegue memorizar um livro didático perfeitamente, mas falha em entender a história quando alguém a conta para ele.
    • O artigo observa que a IA precisou fazer de 5 a 10 palpites apenas para ficar tão boa em adivinhar quanto um humano, que consegue na primeira tentativa.

A Principal Conclusão

O artigo conclui que, para a IA, seguir regras e ser um bom comunicador são duas habilidades diferentes que frequentemente lutam entre si.

  • Se você forçar a IA a ser rigorosa com as regras, ela se torna uma descritora chata e vaga.
  • Se você deixá-la ser criativa, ela pode acidentalmente quebrar as regras.
  • E não importa o quão boa ela seja em descrever, ela ainda é muito ruim na parte de "adivinhar".

Os pesquisadores sugerem que isso acontece porque os humanos têm uma maneira especial e intuitiva de conectar palavras em nossos cérebros (como uma teia de associações) que os modelos de IA atuais simplesmente ainda não possuem. A IA consegue seguir instruções, mas ainda não aprendeu a "intuição humana" necessária para jogar Taboo perfeitamente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →