← Últimos artigos
💬 NLP

Does the Judge Prefer English? Evaluating Language-Switching Invariance in LLM-as-a-Judge

Este artigo introduz o Judge-LS, um protocolo de meta-avaliação demonstrando que, embora os sistemas de LLM-como-Juiz exibam instabilidade de preferência significativa e quedas de precisão ao avaliar conteúdo em chinês ou com troca de idiomas em comparação ao inglês, eles não favorecem sistematicamente o inglês em detrimento de respostas em chinês equivalentes por tradução.

Autores originais: Shaojie Yin

Publicado 2026-06-15✓ Author reviewed
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Shaojie Yin

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um árbitro automatizado e muito inteligente (uma IA) cujo trabalho é observar duas pessoas respondendo a uma pergunta e decidir quem fez um trabalho melhor. É assim que muitos sistemas de IA modernos são testados hoje: uma IA atua como juiz para outras IAs.

Este artigo faz uma pergunta simples, mas complicada: o árbitro se importa com o idioma em que as respostas são ditas ou ele se importa apenas com a qualidade das respostas?

Pense nisso como uma competição de culinária. Se dois chefs fazem exatamente a mesma sopa deliciosa, mas um chef a apresenta em um restaurante francês chique e o outro em uma lanchonete casual, o juiz dá uma pontuação mais alta apenas porque a apresentação parece mais "chique"? Ou o juiz prova a sopa e percebe que elas são idênticas?

O Experimento: O Teste do "Tradutor de Idiomas"

Os pesquisadores pegaram um conjunto padrão de 419 perguntas e respostas (um benchmark chamado LLMBar) e os passaram por quatro diferentes juízes de IA. Eles fizeram isso em três "figurinos" diferentes:

  1. Inglês: A versão original.
  2. Chinês: As mesmas perguntas e respostas, mas traduzidas perfeitamente para o chinês.
  3. Code-Switching (Alternância de Código): Uma mistura de inglês e chinês (como dizer "Please send the email to the manager", misturando idiomas naturalmente).

Eles também realizaram um teste especial de "desempate". Pegaram uma resposta perfeita em inglês e sua tradução perfeita para o chinês e pediram ao juiz para compará-las. Como o conteúdo é idêntico, o juiz deve dizer: "É um empate!"

O Que Eles Descobriram

Os resultados foram um pouco surpreendentes e mostraram que os árbitros não são tão neutros quanto desejaríamos.

  • O Viés do "Sotaque Inglês": Todos os juízes tiveram o melhor desempenho quando as respostas estavam em inglês. Quando as respostas estavam em chinês ou em uma mistura de idiomas, os juízes cometiam mais erros. É como se o árbitro ficasse um pouco confuso ou menos aguçado quando os competidores falam um dialeto diferente, mesmo que a lógica seja a mesma.
  • O Problema do "Vai e Vem": Em cerca de 11% a 14% dos casos, o juiz mudou de ideia apenas porque o idioma mudou.
    • Analogia: Imagine que o Juiz A diz: "O Chef 1 venceu!" quando o menu está em inglês. Mas se você entregar o mesmo menu traduzido para o chinês, o Juiz A subitamente diz: "Na verdade, o Chef 2 venceu!", mesmo que a comida não tenha mudado nada. Isso é chamado de "inversão de preferência" (preference flip).
  • Não é Apenas "Inglês é Melhor": Você pode pensar que os juízes apenas amam o inglês e odeiam todo o resto. Mas o teste de "desempate" mostrou algo mais complexo. Quando os juízes realmente escolheram um vencedor entre uma resposta em inglês e sua tradução para o chinês, eles na verdade escolheram o chinês com mais frequência do que o inglês!
    • A Conclusão: O problema não é que os juízes preferem cegamente o inglês. O problema é que eles são instáveis. Eles são facilmente influenciados pela forma como a informação é apresentada, seja o idioma, a ordem das respostas ou uma mistura de ambos.

Por Que Isso Importa

Se você está construindo um sistema de IA para ajudar pessoas na China, ou para lidar com conversas de idiomas mistos, você não pode confiar apenas em um juiz treinado em inglês para ser justo.

  • O Juiz "Frágil": Um bom juiz deve ser como uma balança sólida. Se você colocar o mesmo peso, ela deve dar a mesma leitura, quer você descreva o peso em quilogramas ou em libras. Esses juízes de IA são mais como uma balança bamba; a leitura muda dependendo de como você a segura.
  • O Custo da Confusão: Como os juízes mudam suas decisões com frequência (cerca de 1 em cada 10 vezes), eles poderiam acidentalmente classificar uma IA pior como a vencedora apenas porque o teste foi escrito em um idioma diferente.

A Solução Proposta

Os autores sugerem um novo "check-up de saúde" leve chamado Judge-LS. Antes de confiar em um juiz de IA para classificar modelos em um mundo multilíngue, você deve realizar este teste simples:

  1. Traduza o teste para o idioma alvo.
  2. Execute o juiz novamente.
  3. Verifique se o juiz muda de ideia.

Se o juiz mudar de ideia com muita frequência, ele não está pronto para o trabalho. É como contratar um árbitro que fica confuso com um sotaque diferente; você precisa de um árbitro que julgue o jogo, não o idioma.

Em resumo: O artigo prova que os juízes de IA são atualmente sensíveis a mudanças de idioma. Eles não são apenas "amantes do inglês"; eles são "observadores instáveis" que precisam ser testados quanto à consistência antes de confiarmos neles para decidir qual é a melhor IA.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →