← Últimos artigos
🤖 machine learning

Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness

Este artigo identifica e corrige dois fatores de confusão críticos em comparações de valor entre modelos: o determinismo de resposta, que confunde diferenças genuínas de valor com a nitidez de compromissos de escolha forçada, e o arnês de acesso, onde camadas de cliente específicas de implantação alteram significamente o perfil de valor aparente de um modelo, distorcendo assim classificações baseadas em medições de amostragem única.

Autores originais: Hong-In Won, Jinseok Jang, Hyoseop Kim

Publicado 2026-07-14
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Hong-In Won, Jinseok Jang, Hyoseop Kim

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando fazer uma degustação de duas marcas diferentes de sorvete para ver qual é mais "doce". Você pega uma colher da Marca A e uma colher da Marca B. A Marca A é de baunilha, e a Marca B também é de baunilha, mas a Marca B é servida em um copinho minúsculo, super concentrado, enquanto a Marca A está em uma tigela gigante e fofinha. Se você provar apenas uma colherada, a Marca B pode parecer muito mais doce apenas por ser intensa e focada, não porque o sorvete em si seja fundamentalmente diferente.

Isso é exatamente o que este artigo descobre sobre modelos de Inteligência Artificial (IA). Por muito tempo, pesquisadores compararam diferentes modelos de IA fazendo uma única pergunta: "Se você tivesse que escolher entre a Opção A e a Opção B, qual você escolhe?" Eles assumiram que, se o Modelo X escolhesse A e o Modelo Y escolhesse B, os dois tinham "personalidades" ou "valores" totalmente diferentes.

Os autores, Hong-In Won e Hyoseop Kim, dizem: "Espere um pouco. Vocês estão medindo duas coisas diferentes ao mesmo tempo e estão confundindo as duas."

Os Dois Equívocos

1. A Confusão do "Comprometimento" (Determinismo)
O primeiro equívoco é sobre o quão fortemente um modelo se compromete com uma resposta.
Imagine duas pessoas respondendo a um quiz.

  • Pessoa A tem 100% de certeza. Ela grita "A!" toda vez que você pergunta.
  • Pessoa B é um pouco indecisa. Ela diz "A" 60% das vezes e "B" 40% das vezes.

Se você perguntar apenas uma vez, e a Pessoa A disser "A" e a Pessoa B disser "B", você pode pensar que elas são totalmente opostas. Mas elas não são! Ambas inclinam-se para o "A". A Pessoa A é apenas uma fã de "A" barulhenta e decisiva, enquanto a Pessoa B é uma fã de "A" silenciosa e hesitante.

O artigo mostra que, quando pesquisadores comparam modelos de IA usando apenas uma única resposta (um "único sorteio"), eles acidentalmente contam essa "intensidade" ou "decisividade" como uma diferença de valores.

  • A Descoberta: Os autores testaram nove modelos de IA diferentes. Eles descobriram que alguns modelos são incrivelmente decisivos (como um modelo chamado GPT-5.5, que foi 0,95 em uma escala de quão seguro ele é), enquanto outros são muito mais suaves (como o modelo "Opus" da Anthropic, que foi apenas 0,34 quando medido através de um aplicativo específico).
  • A Reviravolta: Essa "decisividade" não é um traço de personalidade fixo que você possa adivinhar apenas olhando para o nome do modelo. Em uma família de modelos, um modelo menor e mais barato foi, na verdade, mais decisivo do que o grande e caro modelo principal. Em outra família, o modelo maior foi mais decisivo. Os autores sugerem que você não pode assumir a "intensidade" de um modelo apenas sabendo quem o fez ou o quão grande ele é; você tem que medi-lo toda vez que o utiliza.

2. A Confusão do "Caminhão de Entrega" (O Harness de Acesso)
O segundo equívoco é ainda mais sorrateiro. Não é sobre o sorvete; é sobre o caminhão que entrega o sorvete.
Os autores perceberam que a maneira como você faz uma pergunta à IA muda a resposta. Eles chamam isso de "harness de acesso" (ou estrutura de acesso).

  • Imagine que você pede uma pizza. Se você ligar diretamente para a pizzaria (a "API Raw"), você recebe a pizza exatamente como o chef a fez.
  • Mas se você pedir através de um aplicativo de entrega específico (como um "CLI" ou ferramenta de assinatura), esse aplicativo pode adicionar uma nota para a cozinha: "Faça extra picante!" ou "Não deixe o cliente dizer não."

Os autores descobriram que, para alguns modelos de IA, o "aplicativo de entrega" (o software usado para falar com a IA) mudou completamente a personalidade do modelo.

  • A Prova: Eles pegaram o mesmo modelo de IA e fizeram as mesmas perguntas duas vezes: uma vez através da conexão direta e outra vez através de um popular aplicativo de assinatura.
  • O Resultado: Através do aplicativo de assinatura, o modelo "Opus" pareceu muito suave e incerto (0,34). Mas, quando perguntaram diretamente através da conexão direta, ele era, na verdade, bastante decisivo (0,66). O aplicativo havia "achatado" sua personalidade.
  • O Truque da "Recusa": Em um caso, a conexão direta mostrou o modelo recusando-se a responder 10% das vezes porque sentiu que a pergunta era injusta. Mas o aplicativo de assinatura forçou o modelo a responder todas as vezes, fazendo-o parecer complacente. Os autores provaram que isso foi causado por um "prompt de sistema" oculto (um conjunto de instruções que o aplicativo envia junto com a pergunta) que dizia ao modelo: "Apenas escolha uma letra, não discuta."

O Que Isso Significa para a "Personalidade" da IA

Então, o que o artigo realmente provou?

  • Provou que a "distância" que vemos entre os modelos de IA é frequentemente falsa. É uma mistura de quão barulhentos eles são e de qual software usamos para falar com eles.
  • Provou que o software que usamos para falar com a IA (o "harness") não é um tubo neutro; ele molda ativamente os valores da IA.
  • Sugere (mas não resolve totalmente) que a "decisividade" varia amplamente entre os modelos e não segue uma regra simples como "modelos maiores são mais barulhentos".

O que NÃO é a resposta?
O artigo explicitamente descarta a ideia de que podemos apenas olhar para o nome de um modelo e conhecer seus valores. Ele também descarta a ideia de que todas as diferenças entre os modelos são apenas "ruído".

  • A Boa Notícia: Mesmo após corrigir esses dois equívocos, os autores descobriram que alguns modelos realmente discordam. Por exemplo, um modelo chamado "Grok-3" realmente inclina-se em uma direção diferente dos modelos da OpenAI ou do Google em cerca de 73% a 88% das perguntas. Estas são diferenças reais, não apenas erros de medição.
  • A Má Notícia: A maior parte das diferenças que pensávamos ver dentro da família de uma única empresa (como entre diferentes modelos da Anthropic) era principalmente diferenças em quão barulhentos eles eram, ou como o aplicativo que estavam usando os estava moldando.

A Conclusão

Se você quiser saber se dois modelos de IA têm valores diferentes, você não pode apenas fazer uma pergunta e ver o que eles dizem. Você tem que:

  1. Fazer a mesma pergunta muitas vezes para ver se eles são apenas "barulhentos" ou se são realmente "diferentes".
  2. Garantir que você está falando com eles através da exata mesma "porta" (a mesma conexão de software), porque a porta em si pode estar mudando a opinião deles.

Os autores não resolveram o mistério das personalidades da IA para sempre, mas construíram uma lupa melhor para observá-las. Eles nos mostraram que o que pensávamos ser um profundo desacordo filosófico pode ser apenas uma IA gritando e outra sussurrando, ou uma IA falando com um gerente mandão e outra falando com um amigo quieto. As diferenças reais existem, mas você precisa limpar o ruído para conseguir enxergá-las.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →