← Últimos artigos
💬 NLP

Three Models of RLHF Annotation: Extension, Evidence, and Authority

Este artigo propõe distinguir entre três modelos conceituais de anotadores humanos em RLHF — extensão, evidência e autoridade — para orientar o desenho de pipelines de anotação mais eficazes, adaptando estratégias de coleta e agregação de dados ao papel normativo específico exigido para cada dimensão do alinhamento do modelo.

Autores originais: Steve Coyne

Publicado 2026-04-29
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Steve Coyne

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está construindo um robô muito inteligente capaz de escrever histórias, responder perguntas e conversar com pessoas. Você ensinou-o a falar alimentando-o com milhões de livros, mas agora o robô está um pouco selvagem. Às vezes, ele diz coisas grosseiras, mente ou dá conselhos ruins. Para corrigir isso, você contrata uma equipe de "editores" humanos para dizer ao robô o que é bom e o que é ruim. Esse processo é chamado de RLHF (Aprendizado por Reforço com Feedback Humano).

O artigo de Steve Coyne argumenta que, ao contratar esses editores humanos, frequentemente nos confundimos sobre por que os estamos contratando. Eles estão lá para copiar nossas ideias? Para nos contar fatos que não conhecemos? Ou para criar a lei final para nós?

Coyne sugere que existem três maneiras distintas de pensar sobre esses editores humanos, e misturá-las faz com que o robô fique confuso e se comporte mal.

Aqui estão os três modelos, explicados com analogias simples:

1. O Modelo de Extensão: "O Clone Sombrio"

A Ideia: Neste modelo, os editores humanos estão lá para copiar os designers do robô.
A Analogia: Imagine que você é um chef que deseja ensinar um sous-chef a cozinhar seu prato assinatura. Você não quer que o sous-chef adicione seu próprio toque único ou pergunte o que os clientes gostam. Você quer que ele prove a comida e diga: "Sim, isso tem exatamente o mesmo sabor que eu teria feito". Se o sous-chef disser: "Acho que precisa de mais sal", mas você acha que está perfeito, você o ignora.
Como funciona: Os editores são apenas extensões do cérebro da equipe de design. Eles estão lá para preencher as lacunas quando os designers estão muito ocupados para verificar cada resposta individual.

  • Bom para: Definir o tom, o estilo ou regras específicas da empresa do robô.
  • A Armadilha: Se você os tratar assim, mas depois ficar irritado quando eles discordarem da "comunidade", você está confuso.

2. O Modelo de Evidência: "A Testemunha Especializada"

A Ideia: Neste modelo, os editores estão lá para fornecer fatos ou dados que os designers não possuem.
A Analogia: Imagine que você é um juiz em uma sala de tribunal, mas não sabe nada sobre um tipo específico de peixe raro. Você contrata um biólogo marinho como testemunha especializada. Você pergunta: "Este peixe é venenoso?" O biólogo responde: "Sim, com base no meu conhecimento, é". Você deve ouvi-lo, mesmo que pessoalmente ache que ele parece seguro. O trabalho deles é fornecer evidências sobre a verdade.
Como funciona: Os editores são especialistas ou representantes do público que dizem aos designers: "Na verdade, a maioria das pessoas acha isso ofensivo" ou "Este fato está errado". Os designers não devem anulá-los apenas porque discordam; os editores estão fornecendo dados.

  • Bom para: Verificar se o robô é factualmente preciso ou se viola padrões sociais gerais (como "isso é ofensivo?").
  • A Armadilha: Se você os tratar como especialistas, mas depois demiti-los porque não concordam com sua opinião pessoal, você perde o valor de sua expertise.

3. O Modelo de Autoridade: "A Mini-Legislativa"

A Ideia: Neste modelo, os editores têm o poder de fazer as regras, independentemente de serem "certos" ou "errados" em um sentido factual.
A Analogia: Imagine uma reunião de cidade onde um grupo de cidadãos selecionados aleatoriamente vota em uma nova lei. Eles não precisam ser especialistas em trânsito; apenas precisam representar o povo. Se eles votarem para reduzir o limite de velocidade, a cidade deve obedecer, não porque os cidadãos são "mais inteligentes" que o prefeito, mas porque eles têm a autoridade de decidir pela comunidade.
Como funciona: Os editores atuam como uma "mini-legislativa". Seu trabalho não é encontrar a verdade ou copiar o designer; é exercer o direito de decidir o que o robô deve fazer. Seu poder vem de serem uma amostra justa e representativa da população.

  • Bom para: Decidir sobre questões políticas controversas ou questões morais profundas onde não há uma única resposta "correta", apenas o que a comunidade decide.
  • A Armadilha: Se você os tratar como uma legislatura, mas depois ignorar o voto deles porque não corresponde à sua visão pessoal, você está quebrando o "contrato social" do sistema.

Por Que Misturá-los Quebra o Robô?

O artigo argumenta que a maioria dos sistemas de IA atuais é uma mistura confusa de todos os três, o que leva a modos de falha:

  1. Auto-Destruição: Imagine que você contrata editores para atuar como uma "Mini-Legislativa" (Autoridade) para representar o público. Mas, em seguida, você demite qualquer editor que discorde de sua opinião pessoal (Extensão). Você destruiu exatamente a coisa que pediu: uma voz representativa. Você não pode ter uma democracia onde o líder pode demitir eleitores que votam contra ele.
  2. Fragmentação: Imagine que você diz aos editores: "Vocês estão aqui para nos dar fatos" (Evidência), mas suas instruções são vagas, então eles acham que você apenas quer que copiem seu estilo (Extensão). O resultado é um monte de dados confusos onde alguns editores tentam ser especialistas e outros tentam ser clones. O robô recebe um sinal misturado e não aprende nada útil.
  3. Má Atribuição (A "Lavagem de Responsabilidade"): Isso ocorre quando uma empresa diz: "Deixamos o público decidir o que o robô diz!" (Autoridade), mas, na realidade, secretamente demitem qualquer pessoa que discorde deles (Extensão). Eles estão tentando transferir a culpa pelo mau comportamento do robô para o "público", enquanto na verdade mantêm todo o controle.

A Grande Recomendação do Autor

Steve Coyne sugere que paremos de tentar construir um único pipeline para fazer tudo. Em vez disso, devemos construir pipelines diferentes para trabalhos diferentes:

  • Para Estilo: Use o modelo de Extensão. Deixe os designers decidirem se o robô deve soar animado ou sério.
  • Para Fatos: Use o modelo de Evidência. Contrate especialistas para dizer ao robô o que é verdade.
  • Para Valores Controversos: Use o modelo de Autoridade. Deixe um grupo representativo de pessoas votar sobre o que o robô deve fazer em situações morais difíceis.

A Conclusão:
Construir uma IA útil não é apenas um problema técnico; é um problema filosófico. Antes de contratar seus editores humanos, você precisa decidir: Eles são seus clones, seus especialistas ou seus legisladores? Se você não escolher um claramente, seu robô acabará confuso, inconsistente e potencialmente injusto.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →