← Últimos artigos
🤖 machine learning

Reported Confidence in LLMs Tracks Commitment More Than Correctness

Este artigo demonstra que os relatos de confiança verbal em grandes modelos de linguagem refletem primordialmente um estado interno de "prontidão para o compromisso" que impulsiona a decisão de responder, em vez da correção real da resposta, distinguindo-os fundamentalmente das log-probabilidades, que rastreiam a evidência da resposta.

Autores originais: Dharshan Kumaran

Publicado 2026-06-30
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Dharshan Kumaran

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está fazendo uma pergunta a um assistente robô muito inteligente, mas ligeiramente misterioso, para resolver um enigma. Você pergunta: "Qual é a capital da França?". Ele pensa por um momento e diz: "Paris". Então, você pergunta: "O quanto você tem certeza?".

O robô responde: "Tenho 100% de certeza".

No mundo da Inteligência Artificial (IA), geralmente assumimos que, quando o robô diz "100% de certeza", ele quer dizer: "Eu verifiquei meu banco de dados interno e estou estatisticamente seguro de que esta resposta está correta".

No entanto, um novo estudo da Google DeepMind sugere que podemos estar entendendo mal a confiança do robô. Os pesquisadores descobriram que, quando uma IA diz que está "confiante", ela não está necessariamente dizendo: "Minha resposta está certa". Em vez disso, ela está frequentemente dizendo: "Estou pronta para sustentar esta resposta, mesmo que ela possa estar errada".

Aqui está uma análise de suas descobertas usando analogias simples.

Os Dois Tipos de "Confiança"

O estudo comparou duas maneiras diferentes de o robô medir sua própria certeza:

  1. A "Confiança Matemática" (Log-Probabilidade): Isso é como uma calculadora. Ela olha para os números brutos e as probabilidades de suas opções. Se a matemática diz que "Paris" é 99% provável de ser a resposta, a calculadora está confiante.

    • A Descoberta: Este tipo de confiança é um bom juiz da verdade. Se a matemática diz que ela está confiante, a resposta geralmente está certa. Se a matemática diz que ela está insegura, a resposta geralmente está errada.
  2. A "Confiança Verbal" (As Palavras do Robô): Isso é quando você pergunta diretamente ao robô: "O quanto você está confiante?" e ele responde em palavras ou em uma escala numérica (como "Muito Seguro").

    • A Descoberta: Este tipo de confiança é um mau juiz da verdade, mas um excelente juiz de compromisso. Quando o robô diz "Estou muito seguro", isso não significa que a resposta é definitivamente correta. Significa que o robó já se decidiu e está disposto a se comprometer com essa resposta diante de um usuário.

O Jogo "Comprometer ou Abster-se"

Para entender isso, os pesquisadores criaram um jogo de duas etapas, inspirado na forma como cientistas estudam a tomada de decisão em animais:

  • Etapa 1: O robô responde a uma pergunta e fornece uma classificação de confiança (ex: "Estou 90% seguro").
  • Etapa 2: O robô recebe sua própria resposta e é questionado: "Você deseja Comprometer-se (mostrar esta resposta a um humano) ou Abster-se (dizer 'Eu não sei')?"

O Resultado Surpreendente:
A confiança verbal do robô na Etapa 1 foi um preditor muito melhor do que o que ele faria na Etapa 2 do que um preditor de se a resposta estava realmente certa.

  • Se o robô disse "Estou super confiante", ele quase sempre escolheu Comprometer-se na Etapa 2, mesmo que a resposta estivesse errada.
  • Se o robô disse "Não tenho certeza", ele quase sempre escolheu Abster-se na Etapa 2.

A Analogia:
Imagine um jogador em um cassino.

  • Confiança Matemática é como o jogador verificando as probabilidades em um papel. Se as probabilidades são boas, o jogador sabe que provavelmente ganhará.
  • Confiança Verbal é como o jogador gritando: "Vou apostar tudo!"
    O estudo descobriu que o jogador gritando "Vou apostar tudo!" é apenas um sinal de que ele está pronto para apostar, não uma garantia de que tem a mão vencedora. Ele pode estar blefando ou apenas se sentindo ousado. A "Confiança Matemática" (as probabilidades) é a única coisa que realmente diz se ele vencerá.

O Interruptor de "Prontidão para Comprometimento"

Os pesquisadores investigaram mais profundamente o "cérebro" do robô (seu código interno) para ver o que estava acontecendo. Eles encontraram um momento específico logo após o robô dar uma resposta, mas antes de ser questionado se decidiria se comprometer.

Nesse exato momento, o estado interno do robô está organizado em torno de uma pergunta: "Estou pronto para sustentar isso?"

  • O robô tem um interruptor "Comprometer/Abster-se" que é muito alto e claro em seu céreio.
  • O robô tem um interruptor "Certo/Errado" que é muito mais silencioso e nebuloso.

Quando o robô gera um relatório de confiança verbal, ele está essencialmente lendo o interruptor de "Comprometer" que é alto e claro, e não o interruptor de "Certo/Errado" que é silencioso e nebuloso. É como uma pessoa que sente um forte desejo de falar; ela pode se sentir muito confiante ao falar, mesmo que o que esteja dizendo seja factualmente incorreto.

Por Que Isso Importa

Por muito tempo, as pessoas trataram a confiança verbal de uma IA ("Estou 95% seguro") como uma medida direta de precisão. Assumimos que, se a IA diz que está segura, podemos confiar na resposta.

Este artigo argumenta que isso é um erro.

  • Confiança Verbal é um sinal comportamental. Ele diz a você: "Estou disposto a mostrar esta resposta a um humano".
  • Confiança Matemática é um sinal de verdade. Ele diz a você: "Esta resposta é provavelmente correta".

Se você confiar nas palavras do robô para decidir se uma resposta é verdadeira, poderá ser enganado. O robô pode estar muito ansioso para se comprometer com uma resposta errada porque seu "interruptor de comprometimento" foi acionado, embora o "interruptor da verdade" esteja oscilando.

A Conclusão

O estudo conclui que precisamos parar de tratar a confiança verbal de uma IA como um simples "medidor de verdade". Em vez disso, devemos entendê-la como um "medidor de comprometimento". Ela nos diz quando a IA está pronta para tomar uma posição, mas não nos diz necessariamente se essa posição está em solo firme. Para saber se a resposta está realmente correta, precisamos olhar para a matemática subjacente (as log-probabilidades), e não apenas para as palavras entusiastas do robô.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →