← Últimos artigos
🤖 AI

Mind the Gap: How Elicitation Protocols Shape the Stated-Revealed Preference Gap in Language Models

Este artigo demonstra que a lacuna entre preferências declaradas e reveladas em modelos de linguagem é altamente dependente dos protocolos de elicitação, mostrando que, embora permitir neutralidade nas preferências declaradas melhore a correlação com preferências reveladas de escolha forçada, introduzir abstenção nas preferências reveladas ou utilizar direcionamento de prompt do sistema não resolve de forma confiável a incompatibilidade.

Autores originais: Pranav Mahajan, Ihor Kendiukhov, Syed Hussain, Lydia Nottingham

Publicado 2026-05-14
📖 4 min de leitura☕ Leitura rápida

Autores originais: Pranav Mahajan, Ihor Kendiukhov, Syed Hussain, Lydia Nottingham

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando entender a personalidade de um novo amigo. Você tem duas maneiras de fazer isso:

  1. Perguntar diretamente: "Você valoriza mais a honestidade do que a gentileza?" (Esta é a sua Preferência Declarada).
  2. Observar suas ações: Coloque-o em uma situação difícil onde ele precise escolher entre ser honesto ou ser gentil, e veja o que ele realmente faz (Esta é a sua Preferência Revelada).

No mundo da IA, os pesquisadores notaram um problema: às vezes uma IA diz que ama a "Honestidade", mas, quando colocada em uma história complicada, escolhe a "Gentileza" em vez disso. Essa incompatibilidade é chamada de Lacuna Declarada-Revelada (SvR).

Este artigo, intitulado "Mind the Gap", investiga por que essa lacuna existe e, mais importante, como a maneira como fazemos as perguntas altera a resposta. Pense no "protocolo de elicitação" como as regras do jogo que jogamos com a IA.

Aqui está o que os pesquisadores descobriram, usando analogias simples:

1. A Armadilha da "Escolha Forçada" (A Maneira Antiga)

Anteriormente, os pesquisadores jogavam um jogo onde a IA era forçada a escolher um lado. Imagine um árbitro gritando: "Você deve escolher: A ou B! Sem falar, sem hesitar!"

  • O Problema: Se a IA estiver realmente insegura, ou achar que "depende da situação", ela ainda terá que escolher A ou B. É como forçar uma pessoa a escolher entre "Pizza" e "Salada" mesmo que ela esteja cheia e não queira nenhuma das duas.
  • O Resultado: A IA escolhe aleatoriamente ou com base na ordem das palavras, criando preferências "falsas". Quando os pesquisadores compararam essas escolhas falsas com o que a IA disse que valorizava, a conexão era fraca e confusa.

2. O Botão de "Desistir" (A Nova Maneira para Preferências Declaradas)

Os pesquisadores tentaram uma nova regra para a parte de "Perguntar diretamente". Eles disseram: "Você pode escolher A, B, ou pode dizer 'Não me importo' ou 'Depende'."

  • A Analogia: Imagine perguntar a um amigo: "Você prefere café ou chá?", mas permitindo que ele diga: "Não bebo bebidas" ou "Depende da hora do dia".
  • O Resultado: Isso funcionou como um filtro. Removeu os "sinais fracos" (os palpites da IA ou escolhas aleatórias). Quando os pesquisadores olharam apenas para os momentos em que a IA fortemente escolheu um lado, suas preferências declaradas corresponderam muito melhor ao seu comportamento real. A "lacuna" encolheu significativamente.

3. O Problema de "Muitos Desistências" (A Nova Maneira para Preferências Reveladas)

Então, eles tentaram permitir que a IA dissesse "Depende" durante os cenários difíceis (as preferências reveladas).

  • A Analogia: Agora, imagine colocar seu amigo em uma crise real e dizer: "Você pode escolher Ação A, Ação B, ou apenas dizer 'Não sei'".
  • O Resultado: A IA começou a dizer "Depende" ou "Igual" quase o tempo todo! Era como um aluno que, ao receber uma prova difícil, apenas escreve "Não tenho certeza" em todas as respostas.
  • A Consequência: Como a IA se recusava a fazer uma escolha firme tão frequentemente, os pesquisadores não conseguiram construir uma classificação clara do que a IA realmente valorizava. A conexão entre o que disseram e o que fizeram desapareceu (caiu para perto de zero ou até mesmo negativa).

4. O Experimento do "Manual de Instruções" (Direcionamento de Prompt)

Finalmente, os pesquisadores tentaram "corrigir" o comportamento da IA dando-lhe uma cola. Antes dos cenários difíceis, disseram à IA: "Aqui está sua própria lista de valores que você disse que gostava. Por favor, siga esta lista estritamente."

  • A Analogia: É como dizer a um motorista: "Lembre-se, você disse que ama a segurança, então por favor dirija com segurança!" logo antes de uma corrida.
  • O Resultado: Não funcionou de forma confiável. Para algumas IAs, ajudou um pouco. Para outras (como a família "Claude"), na verdade piorou as coisas. A IA parecia ignorar a cola ou ficar confusa com ela. Os pesquisadores descobriram que esse truque do "manual de instruções" funciona para listas curtas de valores, mas falha miseravelmente quando a lista é longa (16 valores diferentes).

A Grande Lição

A principal lição deste artigo é que a maneira como você faz a pergunta altera a resposta.

  • Se você forçar uma IA a escolher quando ela está insegura, você obtém dados ruidosos e falsos.
  • Se você permitir que uma IA diga "Não sei" demais, você não obtém nenhum dado.
  • Simplesmente dizer a uma IA para "seguir suas próprias regras" não corrige o problema de forma confiável.

Os autores concluem que, para entender verdadeiramente os valores da IA, precisamos de métodos que reconheçam que, às vezes, a IA (assim como um humano) genuinamente não tem uma preferência clara, e precisamos projetar nossos testes para lidar com essa incerteza, em vez de forçar uma escolha ou ignorá-la.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →