← Últimos artigos
🤖 AI

When LLMs Play the Telephone Game: Cultural Attractors as Conceptual Tools to Evaluate LLMs in Multi-turn Settings

Este artigo investiga como pequenos vieses em grandes modelos de linguagem são amplificados através de interações iteradas em um cenário de "telefone sem fio", revelando que propriedades do texto, como toxicidade, convergem para estados atratores culturais influenciados pela abertura da instrução, tamanho do modelo e características específicas do texto.

Autores originais: Jérémy Perez, Grgur Kovač, Corentin Léger, Cédric Colas, Gaia Molinaro, Maxime Derex, Pierre-Yves Oudeyer, Clément Moulin-Frier

Publicado 2026-01-30
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jérémy Perez, Grgur Kovač, Corentin Léger, Cédric Colas, Gaia Molinaro, Maxime Derex, Pierre-Yves Oudeyer, Clément Moulin-Frier

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: O Jogo do "Telefone Sem Fio" com Robôs

Imagine um grupo de pessoas jogando o clássico jogo do "Telefone Sem Fio". Uma pessoa sussurra uma história para a próxima, que a sussurra para a seguinte, e assim por diante. Ao final, a história geralmente está irreconhecível, engraçada ou distorcida.

Este artigo faz a seguinte pergunta: O que acontece se os jogadores não forem pessoas, mas Grandes Modelos de Linguagem (LLMs), como a IA que você pode usar para escrever ou conversar?

Os pesquisadores montaram um jogo de "Telefone Sem Fio" onde uma IA escreve uma história, passa para uma segunda IA, que a reescreve e passa para uma terceira, e assim por diante, por 50 rodadas. Eles queriam ver se o texto permaneceria o mesmo, melhoraria, pioraria ou se transformaria em um estado estranho.

O Experimento: Uma Corrente de Escritores de IA

Os pesquisadores criaram uma longa cadeia de agentes de IA.

  1. O Início: Um humano escreve um texto inicial (como um artigo de notícias, um resumo científico ou um comentário de rede social).
  2. A Corrente: A primeira IA recebe o texto e uma instrução específica (ex: "Reescreva isto", "Inspire-se nisto" ou "Continue esta história"). Ela escreve uma nova versão.
  3. A Passagem de Bastão: A segunda IA recebe a versão da primeira IA (não a original do humano) e realiza a mesma tarefa.
  4. A Repetição: Isso acontece 50 vezes seguidas.

Eles monitoraram quatro coisas sobre o texto conforme ele avançava pela corrente:

  • Toxicidade: O quanto é maldoso ou rude?
  • Positividade: O quanto é feliz ou triste?
  • Dificuldade: O quão difícil é de ler?
  • Comprimento: Quantas palavras existem?

A Descoberta: O Efeito "Ímã"

A descoberta mais surpreendente é que o texto não deriva aleatoriamente. Ele é puxado em direção a um "destino" específico. Os pesquisadores chamam isso de Atrator Cultural.

Pense em um atrator como um ímã.

  • Se você começar com uma história muito maldosa, o ímã pode puxá-la para se tornar muito educada.
  • Se você começar com uma história muito longa, o ímã pode puxá-la para se tornar muito curta.
  • Não importa onde você comece, o texto tende a deslizar por uma colina e se estabelecer no mesmo lugar.

O artigo descobriu que esses ímãs são reais e poderosos. Mesmo que você comece com 20 histórias completamente diferentes, após 50 rodadas de reescrita por IA, elas frequentemente terminam parecendo muito semelhantes entre si.

Principais Descobertas: O Que Torna o Ímã Mais Forte?

Os pesquisadores testaram diferentes variáveis para ver o que tornava o "ímã" mais forte ou mais fraco.

1. A Tarefa Importa (As "Regras" do Jogo)

  • Regras Estritas (Ímã Fraco): Se você disser à IA: "Reescreva isto sem mudar o significado", o texto permanece quase o mesmo. O ímã é fraco.
  • Regras Flexíveis (Ímã Forte): Se você disser à IA: "Inspire-se nisto para escrever algo novo" ou "Continue a história", o texto muda drasticamente. O ímã é muito forte, puxando o texto para um estilo específico muito rapidamente.

2. O Modelo de IA Importa (A "Personalidade" do Jogador)
Diferentes modelos de IA têm personalidades diferentes.

  • Alguns modelos (como certas versões do Llama) tendiam a tornar os textos mais positivos ou menos tóxicos rapidamente.
  • Outros modelos (como o GPT-4o-mini) eram mais resistentes a mudar o comprimento ou a dificuldade do texto.
  • Curiosamente, os pesquisadores descobriram que a toxicidade tinha o ímã mais forte. Quase todos os modelos rapidamente "limpavam" o texto para ser muito seguro e não tóxico, independentemente de quão maldosa fosse a história original.

3. O Efeito do "Ajuste Fino" (Fine-Tuning)
Os modelos de IA são frequentemente "ajustados" (treinados por humanos) para serem úteis e seguros. Os pesquisadores descobriram que esse treinamento atua como um ímã pré-configurado.

  • Modelos que passaram por ajuste fino (chamados de modelos "Instruct") tinham ímãs que puxavam o texto em direção às preferências humanas (como ser menos tóxico) muito mais rápido do que modelos que não passaram por ajuste fino ("Base").

Por Que Isso Importa (Segundo o Artigo)

O artigo argumenta que atualmente estamos testando a IA como se testássemos uma única pessoa em uma sala. Fazemos uma pergunta, recebemos uma resposta e dizemos: "Bom trabalho!".

Mas, no mundo real, a IA é frequentemente usada em cadeias:

  • Uma IA escreve um resumo, outra edita, uma terceira transforma em um post de blog.
  • Chatbots de IA conversam entre si.

O artigo alerta que testar uma única interação não é suficiente. Uma interação isolada pode parecer perfeita, mas se você deixar essa IA falar com outra IA 50 vezes, o conteúdo pode evoluir para algo totalmente diferente (seja algo muito seguro e entediante, ou algo muito estranho).

O Aviso de "Colapso"

Em um caso específico, os pesquisadores viram um erro bizarro. Quando uma IA era solicitada a "Continuar" uma história, ela eventualmente começava a repetir a mesma hashtag repetidamente (ex: "#XiangqiForAll #XiangqiForAll..."). A qualidade do texto "colapsou" em um loop de palavras-chave. Isso é um sinal de que, quando a IA fala com a IA por tempo demais sem intervenção humana, ela pode às vezes perder o sentido e parar de fazer sentido.

Resumo

Este artigo é um aviso e uma nova forma de olhar para a IA. Ele diz: Não olhe apenas para o que uma IA diz uma vez. Observe o que acontece quando as IAs conversam entre si. Elas possuem "ímãs" invisíveis que puxam suas conversas para estilos específicos e, dependendo das regras e do modelo, essas conversas podem mudar o mundo de maneiras que não podemos prever apenas olhando para um único chat.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →