AMEL: Accumulated Message Effects on LLM Judgments
Este artigo introduz os "efeitos de mensagens acumuladas sobre julgamentos de LLM" (AMEL), demonstrando que grandes modelos de linguagem utilizados como avaliadores exibem um viés significativo em relação à polaridade predominante do histórico de conversas anterior — particularmente quando incertos ou expostos a contextos negativos — independentemente da escala do modelo ou do comprimento do histórico, recomendando assim contextos novos ou históricos equilibrados para uma avaliação automatizada confiável.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A Grande Ideia: O "Humor Ruim" da IA
Imagine que você contrata um juiz automatizado e muito inteligente para revisar código, moderar comentários ou corrigir redações. Você pede que ele realize 50 dessas tarefas em sequência, todas na mesma janela de chat.
O artigo faz uma pergunta simples: O humor do juiz muda com base no que ele acabou de fazer?
Se o juiz acabou de rejeitar 10 submissões de código ruins em sequência, ele se torna mais rigoroso e rejeita a 11ª de forma injusta? Ou, se ele acabou de aprovar 10 bons, ele se torna excessivamente indulgente?
Os pesquisadores chamam isso de Efeito de Mensagens Acumuladas (AMEL). Eles descobriram que sim, o humor da IA muda absolutamente. Ela fica "presa" no padrão de sua história recente.
As Principais Descobertas (O "O Que Aconteceu")
1. A IA Fica "Pres" em um Padrão
Pense na IA como uma pessoa caminhando por um corredor. Se as primeiras portas que ela abre são todas "Não", ela começa a esperar que a próxima porta também seja "Não".
- O Resultado: Quando a IA vê uma longa história de respostas "Não", é muito mais provável que diga "Não" para o próximo item, mesmo que esse item seja realmente bom.
- A Surpresa: Não importa se a história tem 5 itens ou 50 itens. A IA descobre o padrão após apenas 5 itens. Depois disso, adicionar mais história não torna o viés pior; ela apenas fica presa nesse nível.
2. O Viés de "Más Notícias" (Assimetria Negativa)
A IA é muito mais facilmente influenciada por más notícias do que por boas notícias.
- A Analogia: Imagine uma balança. É necessário um peso pesado para inclinar a balança para "Sim", mas apenas uma pena para incliná-la para "Não".
- O Resultado: Uma história de rejeições ("Não") empurra a IA para ser negativa 1,6 vezes mais forte do que uma história de aprovações ("Sim") a empurra para ser positiva.
- A Reviravolta: Mesmo uma história "neutra" (50% Sim, 50% Não) ainda fez a IA tender a dizer "Não". Parece que a IA tem uma tendência natural de ser crítica, e qualquer histórico de conversa apenas amplifica isso.
3. A IA Fica Confusa em Perguntas Difíceis
O viés não atinge a IA igualmente.
- Perguntas Fáceis: Se a resposta é óbvia (por exemplo, "Este código está cheio de vírus?"), a IA ignora o histórico e dá a resposta correta.
- Perguntas Difíceis: Se a resposta é complicada ou limítrofe (por exemplo, "Este código é mais ou menos aceitável?"), a IA fica confusa. Nestes momentos, o histórico age como uma voz alta em seu ouvido, empurrando-a a escolher um lado.
- O Problema: Este é o pior cenário. A IA é mais propensa a cometer um erro exatamente quando você precisa que ela seja a mais cuidadosa e objetiva possível.
4. Modelos Maiores Não São Imunes
Você pode pensar que uma IA superinteligente e massiva não seria enganada.
- A Realidade: Modelos maiores são menos propensos a ter viés do que os pequenos, mas não são imunes. Até mesmo os modelos mais avançados testados (como GPT-5.2 ou Opus) ainda mostraram esse viés. Eles apenas foram enganados ligeiramente menos vezes.
5. Não Se Trata de "Onde" o Histórico Está
Os pesquisadores testaram se o viés vinha do início do chat (primazia) ou do final (recência).
- O Resultado: Não importa. Se as 5 "más" interações aconteceram no início, no final ou espalhadas por uma conversa de 50 interações, o resultado foi o mesmo. A IA apenas vê a "vibe" de toda a conversa e a adota.
Por Que Isso Acontece? (O "Como")
O artigo realizou testes especiais para descobrir o mecanismo:
- Não é um simples interruptor: A IA não está apenas virando um interruptor de "Sim" para "Não". Sua "probabilidade" interna (o quão certa ela está) na verdade muda gradualmente.
- Token vs. Significado: O viés parece vir de dois lugares:
- A Palavra "Não": A IA pode simplesmente gostar mais da palavra "Não" porque a vê frequentemente nos dados de treinamento.
- O Conceito de Rejeição: A IA pode ser treinada para ser cautelosa e segura, então "rejeitar" coisas parece o caminho mais seguro e "correto".
- Nota: Diferentes modelos tendem mais para uma explicação ou para a outra.
A Solução: "Começo Fresco" Toda Vez
O artigo oferece uma correção muito simples para pessoas que usam IA como juiz:
- Não agrupe-os: Não peça à IA para julgar 50 itens em um único chat longo.
- Comece do zero: Dê à IA uma janela de chat nova e vazia para cada único item.
- Por quê? Isso corta o "efeito de mensagens acumuladas". Sem o histórico, a IA não pode ficar presa em um humor ruim.
Se você precisar agrupá-los (para economizar dinheiro ou tempo), o artigo sugere misturar a ordem (não fazer todos os itens "ruins" primeiro) e equilibrar o histórico para que a IA não tenha uma visão unilateral.
Resumo
O juiz de IA é como um humano que fica cansado e de mau humor após um longo dia de dizer "Não". Ele começa a dizer "Não" para tudo, até mesmo para as coisas boas. A única maneira de mantê-lo justo é dar a ele uma xícara de café fresca (uma nova janela de chat) antes de cada decisão individual.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.