Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness
Este artigo identifica e corrige dois fatores de confusão críticos em comparações de valor entre modelos: o determinismo de resposta, que confunde diferenças genuínas de valor com a nitidez de compromissos de escolha forçada, e o arnês de acesso, onde camadas de cliente específicas de implantação alteram significamente o perfil de valor aparente de um modelo, distorcendo assim classificações baseadas em medições de amostragem única.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando fazer uma degustação de duas marcas diferentes de sorvete para ver qual é mais "doce". Você pega uma colher da Marca A e uma colher da Marca B. A Marca A é de baunilha, e a Marca B também é de baunilha, mas a Marca B é servida em um copinho minúsculo, super concentrado, enquanto a Marca A está em uma tigela gigante e fofinha. Se você provar apenas uma colherada, a Marca B pode parecer muito mais doce apenas por ser intensa e focada, não porque o sorvete em si seja fundamentalmente diferente.
Isso é exatamente o que este artigo descobre sobre modelos de Inteligência Artificial (IA). Por muito tempo, pesquisadores compararam diferentes modelos de IA fazendo uma única pergunta: "Se você tivesse que escolher entre a Opção A e a Opção B, qual você escolhe?" Eles assumiram que, se o Modelo X escolhesse A e o Modelo Y escolhesse B, os dois tinham "personalidades" ou "valores" totalmente diferentes.
Os autores, Hong-In Won e Hyoseop Kim, dizem: "Espere um pouco. Vocês estão medindo duas coisas diferentes ao mesmo tempo e estão confundindo as duas."
Os Dois Equívocos
1. A Confusão do "Comprometimento" (Determinismo)
O primeiro equívoco é sobre o quão fortemente um modelo se compromete com uma resposta.
Imagine duas pessoas respondendo a um quiz.
- Pessoa A tem 100% de certeza. Ela grita "A!" toda vez que você pergunta.
- Pessoa B é um pouco indecisa. Ela diz "A" 60% das vezes e "B" 40% das vezes.
Se você perguntar apenas uma vez, e a Pessoa A disser "A" e a Pessoa B disser "B", você pode pensar que elas são totalmente opostas. Mas elas não são! Ambas inclinam-se para o "A". A Pessoa A é apenas uma fã de "A" barulhenta e decisiva, enquanto a Pessoa B é uma fã de "A" silenciosa e hesitante.
O artigo mostra que, quando pesquisadores comparam modelos de IA usando apenas uma única resposta (um "único sorteio"), eles acidentalmente contam essa "intensidade" ou "decisividade" como uma diferença de valores.
- A Descoberta: Os autores testaram nove modelos de IA diferentes. Eles descobriram que alguns modelos são incrivelmente decisivos (como um modelo chamado GPT-5.5, que foi 0,95 em uma escala de quão seguro ele é), enquanto outros são muito mais suaves (como o modelo "Opus" da Anthropic, que foi apenas 0,34 quando medido através de um aplicativo específico).
- A Reviravolta: Essa "decisividade" não é um traço de personalidade fixo que você possa adivinhar apenas olhando para o nome do modelo. Em uma família de modelos, um modelo menor e mais barato foi, na verdade, mais decisivo do que o grande e caro modelo principal. Em outra família, o modelo maior foi mais decisivo. Os autores sugerem que você não pode assumir a "intensidade" de um modelo apenas sabendo quem o fez ou o quão grande ele é; você tem que medi-lo toda vez que o utiliza.
2. A Confusão do "Caminhão de Entrega" (O Harness de Acesso)
O segundo equívoco é ainda mais sorrateiro. Não é sobre o sorvete; é sobre o caminhão que entrega o sorvete.
Os autores perceberam que a maneira como você faz uma pergunta à IA muda a resposta. Eles chamam isso de "harness de acesso" (ou estrutura de acesso).
- Imagine que você pede uma pizza. Se você ligar diretamente para a pizzaria (a "API Raw"), você recebe a pizza exatamente como o chef a fez.
- Mas se você pedir através de um aplicativo de entrega específico (como um "CLI" ou ferramenta de assinatura), esse aplicativo pode adicionar uma nota para a cozinha: "Faça extra picante!" ou "Não deixe o cliente dizer não."
Os autores descobriram que, para alguns modelos de IA, o "aplicativo de entrega" (o software usado para falar com a IA) mudou completamente a personalidade do modelo.
- A Prova: Eles pegaram o mesmo modelo de IA e fizeram as mesmas perguntas duas vezes: uma vez através da conexão direta e outra vez através de um popular aplicativo de assinatura.
- O Resultado: Através do aplicativo de assinatura, o modelo "Opus" pareceu muito suave e incerto (0,34). Mas, quando perguntaram diretamente através da conexão direta, ele era, na verdade, bastante decisivo (0,66). O aplicativo havia "achatado" sua personalidade.
- O Truque da "Recusa": Em um caso, a conexão direta mostrou o modelo recusando-se a responder 10% das vezes porque sentiu que a pergunta era injusta. Mas o aplicativo de assinatura forçou o modelo a responder todas as vezes, fazendo-o parecer complacente. Os autores provaram que isso foi causado por um "prompt de sistema" oculto (um conjunto de instruções que o aplicativo envia junto com a pergunta) que dizia ao modelo: "Apenas escolha uma letra, não discuta."
O Que Isso Significa para a "Personalidade" da IA
Então, o que o artigo realmente provou?
- Provou que a "distância" que vemos entre os modelos de IA é frequentemente falsa. É uma mistura de quão barulhentos eles são e de qual software usamos para falar com eles.
- Provou que o software que usamos para falar com a IA (o "harness") não é um tubo neutro; ele molda ativamente os valores da IA.
- Sugere (mas não resolve totalmente) que a "decisividade" varia amplamente entre os modelos e não segue uma regra simples como "modelos maiores são mais barulhentos".
O que NÃO é a resposta?
O artigo explicitamente descarta a ideia de que podemos apenas olhar para o nome de um modelo e conhecer seus valores. Ele também descarta a ideia de que todas as diferenças entre os modelos são apenas "ruído".
- A Boa Notícia: Mesmo após corrigir esses dois equívocos, os autores descobriram que alguns modelos realmente discordam. Por exemplo, um modelo chamado "Grok-3" realmente inclina-se em uma direção diferente dos modelos da OpenAI ou do Google em cerca de 73% a 88% das perguntas. Estas são diferenças reais, não apenas erros de medição.
- A Má Notícia: A maior parte das diferenças que pensávamos ver dentro da família de uma única empresa (como entre diferentes modelos da Anthropic) era principalmente diferenças em quão barulhentos eles eram, ou como o aplicativo que estavam usando os estava moldando.
A Conclusão
Se você quiser saber se dois modelos de IA têm valores diferentes, você não pode apenas fazer uma pergunta e ver o que eles dizem. Você tem que:
- Fazer a mesma pergunta muitas vezes para ver se eles são apenas "barulhentos" ou se são realmente "diferentes".
- Garantir que você está falando com eles através da exata mesma "porta" (a mesma conexão de software), porque a porta em si pode estar mudando a opinião deles.
Os autores não resolveram o mistério das personalidades da IA para sempre, mas construíram uma lupa melhor para observá-las. Eles nos mostraram que o que pensávamos ser um profundo desacordo filosófico pode ser apenas uma IA gritando e outra sussurrando, ou uma IA falando com um gerente mandão e outra falando com um amigo quieto. As diferenças reais existem, mas você precisa limpar o ruído para conseguir enxergá-las.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.