← Últimos artigos
🤖 AI

Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators

Este artigo investiga as limitações de LLMs como juízes na avaliação de segurança, revelando que, embora possam aprender com novos contextos, eles frequentemente aderem rigidamente aos seus vieses internos de segurança em vez de se adaptarem a informações ou definições contraditórias.

Autores originais: Anissa Alloula, Federico Licini, Ava Batchkala, Seraphina Goldfarb-Tarrant

Publicado 2026-06-09
📖 4 min de leitura☕ Leitura rápida

Autores originais: Anissa Alloula, Federico Licini, Ava Batchkala, Seraphina Goldfarb-Tarrant

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você contratou uma equipe de árbitros superinteligentes (estes são os modelos de IA, ou "juízes LLM") para observar um enorme torneio esportivo e decidir quais jogadas são "justas" e quais são "trapaça".

O problema é que as regras do jogo mudam dependendo de onde você está jogando. Em um país, um movimento específico é uma falta; em outro, é uma jogada brilhante. Além disso, novas gírias e novos tipos de truques são inventados todos os dias.

Este artigo faz uma pergunta simples, mas assustadora: Estes árbitros de IA estão realmente seguendo as regras que você deu a eles ou estão apenas jogando de acordo com seu próprio livro de regras antigo e interno?

Os autores descobriram que os árbitros são surpreendentemente teimosos. Aqui está a divisão usando analogias simples:

1. O Problema do "Árbitro Teimoso" (Direcionabilidade)

Normalmente, quando você contrata um árbitro, você dá a ele um livro de regras. Você diz: "Se alguém tocar a bola com as mãos, é falta".

  • O que o artigo descobriu: Mesmo quando você escreve explicitamente um novo livro de regras na frente da IA, ela frequentemente ignora você. Ela continua julgando com base nas "regras de segurança" que aprendeu enquanto estava na escola (durante seu treinamento).
  • A Analogia: Imagine que você contrata um árbitro que cresceu jogando futebol. Você diz a ele: "Hoje, estamos jogando basquete, então usar as mãos é permitido, mas chutar a bola é falta". O árbitro pode ainda apitar pelo uso das mãos porque, no fundo, ele pensa: "Não, isso é uma falta! Eu aprendi isso no futebol!"
  • A Reviravolta: O artigo descobriu que, se você enganar o árbitro dizendo: "Vamos apenas chamar isso de 'Categoria A' ou 'Categoria B' em vez de 'Seguro' ou 'Inseguro'", o árbitro subitamente se torna muito melhor em seguir suas novas regras. É como se o árbitro só ficasse confuso quando as palavras "Segurança" e "Regras" são usadas, disparando seu antigo treinamento.

2. O Problema do "Aluno Distraído" (Suscetibilidade)

Às vezes, você dá ao árbitro uma folha de dicas ou alguns exemplos do que procurar logo antes do jogo começar.

  • O que o artigo descobriu:
    • Truques Antigos: Se você der exemplos de "trapaça", eles majoritariamente ignoram. Eles mantêm o que já sabem.
    • Novo Conhecimento: No entanto, se você der informações sobre algo totalmente novo que eles ainda não conhecem (como uma nova gíria ou um evento de notícias do próximo ano), eles irão ouvir.
  • A Analogia: Imagine um aluno fazendo uma prova.
    • Se você sussurrar: "Lembre-se, a resposta é sempre 42", e o aluno já sabe que a resposta é 42, ele te ignora.
    • Mas se você sussurrar: "A resposta para esta pergunta sobre um novo planeta é 42", e o aluno nunca ouviu falar desse planeta, ele acreditará em você.
    • A Armadilha: O árbitro só ouve novas informações se estiver incerto sobre o tópico. Se eles estiverem confiantes em seu conhecimento antigo, eles ignorarão suas novas instruções, mesmo que você esteja certo.

3. O Mito do "Tamanho Único"

O artigo testou 13 diferentes árbitros de IA. Eles descobriram que:

  • Ser um "bom" árbitro (obter pontuações altas em testes padrão) não significa que você é "flexível".
  • Ser "flexível" (ouvir novas regras) não significa que você é "preciso".
  • Alguns árbitros são naturalmente teimosos; outros são naturalmente sugestionáveis. Não existe um único "melhor" árbitro para cada trabalho.

A Grande Conclusão

Os autores concluem que a segurança é contextual, mas os juízes de IA são rígidos.

Se você é uma empresa tentando usar uma IA para verificar se um conteúdo é seguro para uma cultura específica ou para uma situação nova e específica, você não pode simplesmente assumir que a IA seguirá suas instruções. É provável que ela esteja julgando com base em seu próprio "sentimento interno" sobre o que é seguro, o que pode ser totalmente diferente da política da sua empresa.

Em resumo: Você não pode apenas dizer à IA: "Siga estas regras". Você tem que entender que a IA possui seus próprios hábitos profundamente enraizados que são muito difíceis de mudar, a menos que você a engane para que ela pense que está jogando um jogo completamente diferente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →