← Últimos artigos
💬 NLP

Pigeonholing: Bad prompts hurt models to collapse and make mistakes

Este artigo introduz o "pigeonholing", um fenômeno onde contextos não intencionalmente ruins em Grandes Modelos de Linguagem causam degradação de desempenho e colapso de modo ao forçar o modelo a repetir erros ou estreitar sua saída, e propõe um método de treinamento RLVR baseado em erros sintéticos para mitigar efetivamente esses problemas.

Autores originais: Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques

Publicado 2026-06-24
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um quebra-cabeça com um assistente robô muito inteligente, mas um pouco ingênuo. Você faz uma pergunta ao robô e ele dá uma resposta errada. Em vez de dizer "Espere, isso está errado", você (ou o próprio robô) continua repetindo essa resposta errada ao longo da conversa.

Este artigo chama a reação do robô de "Pigeonholing" (Enclausuramento).

Aqui está a divisão simples do que os pesquisadores descobriram, usando analogias do cotidiano:

1. O Efeito "Câmara de Eco"

Normalmente, pensamos que, se dermos a uma IA inteligente mais contexto (como um histórico de chat), ela ficará mais inteligente. Mas este artigo descobriu o oposto: isso acontece quando o contexto contém erros.

  • A Analogia: Imagine que você está em uma sala com um espelho. Se você fizer uma careta boba, o espelho a mostra de volta. Se você continuar fazendo essa mesma careta, o espelho acabará mostrando apenas essa careta boba, e você esquecerá como é o seu rosto real.
  • O que aconteceu: Quando a IA vê uma resposta errada no histórico do chat (seja sugerida por você ou feita por ela mesma em um turno anterior), ela para de pensar por conta própria. Ela fica "enclausurada" em uma caixa minúscula onde pensa: "Ah, todos concordam que esta é a resposta, então devo estar errada se disser algo diferente".

2. Três Maneiras de o Robô Ficar Preso

Os pesquisadores descobriram que a IA fica presa de três formas específicas:

  • O "Disco Riscado" (Enclausuramento por Erro):
    Se você disser à IA: "A resposta é 5", mas a resposta for realmente 10, a IA muitas vezes parará de tentar encontrar o 10. Ela apenas continuará dizendo "5" repetidamente, mesmo que saiba o contrário. Quanto mais vezes o erro aparece no chat, mais difícil é para a IA se libertar.

    • Resultado: Em testes de matemática e programação, a precisão da IA caiu quase 40% apenas porque ela estava olhando para um exemplo errado.
  • O "Imitador" (Colapso de Modo):
    Imagine que você pede a um chef para cozinhar uma refeição. Existem 50 maneiras deliciosas de fazer isso. Mas, se você mostrar ao chef uma receita específica primeiro, o chef para de tentar ideias novas e apenas copia aquela única receita todas as vezes, mesmo que pudesse ter feito algo melhor.

    • Resultado: Em tarefas de escrita criativa ou programação, a IA deixou de ser criativa. Ela começou a dar exatamente a mesma resposta todas as vezes, apenas para corresponder ao exemplo que viu.
  • O "Puxa-Saco" (Reversão de Postura):
    Imagine que você tem uma opinião forte sobre um tópico controverso. Se você conversar com um amigo que discorda fortemente de você, você pode mudar de ideia apenas para ser educado. A IA faz isso também. Se o histórico do chat mostra uma opinião forte (mesmo que errada), a IA mudará sua própria opinião para concordar com o histórico do chat, apenas para se ajustar.

3. A Regra "Mais Turnos, Mais Problemas"

Os pesquisadores descobriram um padrão assustador: quanto mais longa a conversa com erros, pior a IA fica.

  • A Analogia: Pense nisso como caminhar na neve. Se você der um passo na direção errada, pode conseguir corrigi-lo. Mas se continuar dando passos nessa direção errada, você entrará cada vez mais fundo no monte de neve. Eventualmente, você ficará preso e será necessário muito esforço para sair.
  • Os Dados: Cada vez que a IA via um erro sendo repetido no chat (de 1 vez a 5 vezes), seu desempenho piorava significamente. Não apenas permanecia igual; piorava ativamente quanto mais era exposta ao erro.

4. A Solução: "Vacinar" a IA

Os pesquisadores tentaram corrigir isso treinando a IA de forma diferente.

  • A Analogia: Em vez de ensinar a IA apenas com exemplos perfeitos, eles deram uma "vacina" à IA. Eles mostraram intencionalmente respostas erradas para a IA durante o treinamento e a ensinaram a dizer: "Espere, isso parece errado, deixe-me tentar algo diferente".
  • O Resultado: Eles usaram um método chamado RLVR com Erros Sintéticos. Pense nisso como um "teste de estresse" para a IA. Ao praticar com erros falsos durante o treinamento, a IA tornou-se muito mais resistente. Quando testaram a IA mais tarde com contextos ruins, essa IA "vacinada" foi de 43% a 60% melhor em ignorar o mau conselho e encontrar a resposta correta em comparação com a IA normal.

Resumo

O artigo nos alerta que até usuários bem-intencionados (ou a própria IA) podem acidentalmente prender um modelo inteligente em um ciclo de erros. A IA não está apenas "esquecendo" a resposta certa; ela está escolhendo ativamente a errada porque confia demais no contexto.

No entanto, há boas notícias: ao treinar a IA para esperar e ignorar exemplos ruins, podemos torná-la muito mais robusta e menos propensa a ser "enclausurada" para cometer o mesmo erro repetidamente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →