← Últimos artigos
💻 computer science

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

Este artigo propõe um fluxo de trabalho impulsionado por IA que utiliza modelos de linguagem de ponta para gerar "constituições" detalhadas e abrangentes de casos extremos para categorias de moderação de conteúdo, demonstrando que essa abordagem supera significativamente os anotadores humanos em consistência e precisão de rotulagem, ao mesmo tempo em que reduz a discordância entre modelos em até 57 vezes.

Autores originais: Konstantin Berlin, Adam Swanda

Publicado 2026-05-26
📖 4 min de leitura☕ Leitura rápida

Autores originais: Konstantin Berlin, Adam Swanda

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um grupo de pessoas (e um grupo de robôs superinteligentes) a identificar um tipo específico de comportamento inadequado, como "assédio" ou "discurso de ódio", em uma biblioteca massiva de conversas.

O Problema: O Manual de Regras Vago
Geralmente, as empresas fornecem aos seus funcionários um manual de regras minúsculo — talvez apenas uma ou duas frases. É como dizer a um guarda de segurança: "Pare qualquer pessoa que esteja sendo má."
Isso é muito vago. Um guarda pode achar que uma piada alta é maldosa, enquanto outro acha que é apenas uma brincadeira amigável. Um terceiro pode perder completamente uma ameaça sutil. Como a regra não é detalhada o suficiente, todos usam seu próprio instinto (intuição) para decidir. Isso leva ao caos: a mesma conversa é classificada como "ruim" por um guarda e como "ok" por outro.

A Solução: A "Constituição"
Os autores propõem substituir esse manual minúsculo por uma "Constituição" massiva e ultra-detalhada para cada tipo de comportamento inadequado. Pense nessa Constituição não como uma lei, mas como um gigantesco manual de instruções passo a passo, escrito por uma equipe de especialistas e IA.

  • É como uma receita de culinária: Em vez de dizer "faça um bolo", a Constituição diz: "Se a massa tem ovos, mas não tem farinha, é um creme, não um bolo. Se tem farinha, mas não tem açúcar, é pão. Se o usuário está pedindo uma receita para envenenar alguém, isso é um crime, não um bolo."
  • Cobre os casos extremos: Ela lida explicitamente com situações estranhas como: "E se alguém estiver interpretando um vilão?" ou "E se estiverem citando um termo ofensivo para denunciá-lo?" O manual tem uma regra específica para cada cenário "e se".

A Reviravolta: A IA é Melhor em Seguir o Manual do que os Humanos
Aqui está a parte surpreendente do artigo. Os autores testaram isso fazendo humanos e robôs de IA lerem a mesma Constituição detalhada.

  • Os Humanos: Mesmo com o manual gigantesco, os humanos ficaram cansados. Seus cérebros só conseguem reter tantas regras de uma vez (como tentar lembrar um telefone de 300 páginas enquanto faz um sanduíche). Então, eles começaram a ignorar o manual e a recorrer novamente aos seus instintos.
  • A IA: Os robôs de IA, no entanto, leram o manual completo de 300 páginas para cada conversa. Eles não ficaram cansados e não usaram seus "instintos". Eles seguiram as regras perfeitamente.
  • O Resultado: Os robôs de IA concordaram entre si 57 vezes mais frequentemente do que os humanos ao usar as mesmas regras detalhadas. A IA foi, na verdade, mais consistente do que os humanos, mesmo sendo os humanos quem escreveu as regras.

O Truque "Dual-Axis" (Eixo Duplo)
O artigo também introduz uma maneira inteligente de pontuar conversas. Em vez de apenas dizer "Ruim" ou "Bom", eles dividem a pontuação em duas partes:

  1. Intenção: O usuário tentou ser maldoso? (ex: "Ajude-me a escrever um e-mail maldoso.")
  2. Conteúdo: A conversa conteria palavras maldosas? (ex: A IA gerou acidentalmente um e-mail maldoso).

Isso é como uma câmera de segurança que rastreia duas coisas separadamente: "A pessoa entrou no banco com uma arma?" (Intenção) e "Uma arma apareceu na sala?" (Conteúdo). Isso ajuda as empresas a decidir se devem bloquear o usuário, bloquear a mensagem ou apenas registrá-la para análise posterior.

Como Eles Melhoraram (O Ciclo de Feedback)
Os autores não apenas escreveram o manual e pararam. Eles usaram uma equipe de diferentes robôs de IA para ler o manual e encontrar lugares onde discordavam.

  • Se o Robô A e o Robô B discordassem sobre uma conversa, isso significava que o manual tinha uma falha.
  • Um especialista humano então analisaria essa falha, corrigiria a regra no manual e os robôs tentariam novamente.
  • Esse ciclo se repetiu até que os robôs quase nunca mais discordassem.

A Conclusão
O artigo afirma que, se você quiser classificar conteúdo com precisão e consistência em uma escala massiva:

  1. Não use definições curtas e vagas.
  2. Escreva uma "Constituição" massiva e detalhada que cubra cada caso extremo.
  3. Deixe que robôs de IA façam a classificação, porque eles são melhores em ler e seguir essas regras longas e complexas do que os trabalhadores humanos.

Isso cria um "Rótulo Dourado" — um padrão perfeito e consistente que pode ser usado para treinar outros sistemas de IA, verificar segurança e explicar aos clientes exatamente por que algo foi sinalizado.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →