← Últimos artigos
💬 NLP

Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks

Este artigo revela que juízes baseados em LLM exibem inconsistência intra-avaliador significativa entre diferentes execuções, minando a confiabilidade de suas pontuações, e investiga se tais avaliações ainda podem ser efetivamente utilizadas por meio de diretrizes específicas.

Autores originais: Rajarshi Haldar, Julia Hockenmaier

Publicado 2026-04-29
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Rajarshi Haldar, Julia Hockenmaier

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: O Juiz "Montanha-Russa"

Imagine que você contrata um famoso crítico gastronômico para revisar um novo restaurante. Você pede que ele prove o mesmo prato três vezes seguidas, sentado à mesma mesa, com o mesmo guardanapo à sua frente.

  • Prova 1: Ele dá uma classificação de 5 estrelas, chamando-o de "uma obra-prima".
  • Prova 2: Ele dá uma classificação de 2 estrelas, chamando-o de "insosso e cozido demais".
  • Prova 3: Ele dá uma classificação de 4 estrelas, dizendo que é "aceitável, mas precisa de mais sal".

Se isso acontecesse, você não confiaria naquele crítico. Você perceberia que o julgamento dele é como uma roleta: gira e cai em um número diferente a cada vez, mesmo que a comida (a entrada) nunca tenha mudado.

Isso é exatamente o que os pesquisadores descobriram quando pediram que Modelos de Linguagem Grandes (LLMs) atuassem como juízes para outros textos gerados por IA. Eles descobriram que esses juízes de IA estão sofrendo de "Roleta de Classificação".

O Problema: O Juiz de IA Não Consegue Concordar Consigo Mesmo

No mundo da IA, frequentemente usamos uma IA para avaliar o trabalho de outra IA. Isso é chamado de "LLM-como-Juiz". É popular porque é mais rápido e barato do que contratar humanos.

No entanto, os pesquisadores realizaram um teste simples:

  1. Eles pegaram um trecho de texto (como um resumo de notícias ou uma conversa de chat).
  2. Pediram que o mesmo juiz de IA o avaliasse três vezes usando exatamente as mesmas instruções.
  3. Verificaram se a IA deu a mesma pontuação a cada vez.

O Resultado: Os juízes de IA estavam completamente descoordenados.

  • Em uma tarefa chamada SummaC (verificar se um resumo é factualmente verdadeiro), o melhor juiz de IA concordou consigo mesmo apenas cerca de 79% das vezes.
  • Em uma tarefa chamada MT-Bench (classificar conversas de chatbots), a concordância caiu ainda mais. Um juiz de IA deu exatamente a mesma resposta três vezes seguidas em apenas 61% dos casos.

É como se o humor do juiz mudasse cada vez que você faz uma pergunta, mesmo que a pergunta e a resposta não tenham mudado.

O "Truque de Mágica" que Sai pela Culatra

Você pode pensar: "Ok, vamos apenas dizer à IA para parar de ser aleatória. Vamos desligar a parte de 'rolar dados' do cérebro dela para que ela sempre dê a mesma resposta".

Os pesquisadores tentaram isso. Eles configuraram a IA para ser 100% determinística (sem aleatoriedade).

  • Ela se tornou consistente? Sim.
  • Ela se tornou um juiz melhor? Não.

Na verdade, quando forçaram a IA a parar de rolar os dados, suas classificações ficaram piores em comparação com juízes humanos. É como forçar um chef a usar exatamente a mesma receita toda vez; ele pode parar de cometer erros, mas também para de ser criativo ou adaptável, e a comida acaba tendo um sabor pior.

O artigo sugere que existe um compromisso: para obter uma boa nota que corresponda à opinião humana, a IA precisa de um pouco de "aleatoriedade" (variabilidade). Mas essa mesma aleatoriedade torna a IA inconsistente consigo mesma.

A Comparação Humana: Os Humanos São Melhores?

Os pesquisadores também analisaram juízes humanos para ver se esse é um problema exclusivo da IA.

  • Especialistas Humanos: Quando especialistas avaliaram o mesmo texto, concordaram razoavelmente bem entre si, mas não perfeitamente.
  • Trabalhadores de Multidão: Quando pessoas comuns (trabalhadores de multidão) avaliaram o texto, muitas vezes discordaram umas das outras e dos especialistas.
  • A Surpresa: Em alguns casos, os juízes de IA foram na verdade mais consistentes consigo mesmos do que os humanos foram entre si. No entanto, como as pontuações da IA eram tão voláteis, é difícil dizer se a IA está realmente "certa" ou apenas "sortuda".

Por Que Isso Importa? (A Analogia da "Régua Quebrada")

Imagine que você está tentando medir a altura de uma árvore.

  • O Jeito Antigo: Você usa uma régua que está levemente torta. Não é perfeita, mas é estável.
  • O Jeito Novo (Juiz LLM): Você usa uma régua feita de borracha. Às vezes ela estica, às vezes encolhe. Mesmo que você meça a mesma árvore três vezes, você obtém três números diferentes.

Se você usar uma régua de borracha, não pode confiar na medição. O artigo argumenta que usar um LLM como juiz é atualmente como usar uma régua de borracha.

  • Se você rodar o teste uma vez, obtém uma pontuação.
  • Se rodar novamente, obtém uma pontuação diferente.
  • Se rodar uma terceira vez, obtém uma terceira pontuação.

Como a pontuação muda a cada vez, não sabemos se a IA é realmente boa em julgar a qualidade ou se está apenas chutando.

O Que Eles Encontraram em Diferentes Tarefas?

Os pesquisadores testaram três tipos diferentes de "jogos" que a IA teve que jogar:

  1. Verdadeiro ou Falso (SummaC): O resumo é factualmente correto? (Escolha binária).
    • Resultado: Os juízes de IA foram inconsistentes, mas modelos maiores e mais recentes foram ligeiramente melhores.
  2. A Avaliação de 1 a 5 Estrelas (SummEval): Avalie o resumo em "Coerência", "Fluência", etc.
    • Resultado: A IA foi muito inconsistente, especialmente em "Fluência" (quão suave o texto soa). Curiosamente, a IA às vezes foi melhor em julgar a fluência do que os humanos foram em concordar entre si.
  3. A Batalha Real (MT-Bench): Qual dos dois chatbots deu uma resposta melhor?
    • Resultado: Esta foi a tarefa mais difícil. Os juízes de IA foram extremamente voláteis aqui, frequentemente mudando de ideia sobre qual chatbot era melhor.

A Conclusão: Como Consertar a Roleta

O artigo oferece algumas dicas práticas para pessoas que querem usar juízes de IA:

  1. Não confie em uma única execução: Se você pedir a uma IA para avaliar algo, não aceite apenas a primeira resposta. Peça que ela avalie três vezes e tire a média ou a votação majoritária. Isso suaviza o efeito da "roleta" e fornece uma pontuação mais próxima do que um humano diria.
  2. Não desligue a aleatoriedade: Embora a aleatoriedade cause inconsistência, desligá-la completamente torna a IA pior em corresponder às opiniões humanas. Você precisa de um pouco de caos para obter a resposta certa.
  3. Verifique sua própria consistência: Antes de confiar em um juiz de IA, você deve verificar se ele concorda consigo mesmo. Se ele não consegue concordar consigo mesmo, provavelmente não consegue concordar com você, também.

Resumo

O artigo revela que os juízes de IA são atualmente inconfiáveis porque dão respostas diferentes para a mesma pergunta toda vez que são questionados. Eles são como uma roleta em vez de uma balança estável. Embora modelos de IA mais novos sejam ligeiramente mais consistentes, eles ainda lutam para ser confiáveis. A melhor solução no momento é pedir à IA para jogar o jogo várias vezes e calcular a média dos resultados, em vez de confiar em um único "giro" da roda.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →