← Últimos artigos
💻 computer science

Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity

Este artigo investiga o impacto do ajuste de instrução em modelos de linguagem, constatando que, embora aumente consistentemente a confiança verbalizada e reduza a diversidade entre racionalidades, produz efeitos variáveis na diversidade lexical de superfície e degrada a calibração baseada em verossimilhança sem alterar significativamente a acurácia preditiva.

Autores originais: Irina Proskurina, Mayank Kumar, Oyindolapo O. Komolafe

Publicado 2026-08-14
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Irina Proskurina, Mayank Kumar, Oyindolapo O. Komolafe

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está conversando com um robô muito inteligente e muito bem informado. Você faz uma pergunta e ele responde com uma voz confiante, explicando exatamente por que acha que está certo. Mas aqui está o detalhe: às vezes, esse robô está apenas fingindo ter certeza. Ele pode estar dando um palpite desenfreado, mas soando como um professor. Isso é algo muito importante no mundo da Inteligência Artificial, especificamente para os "Grandes Modelos de Linguagem" (LLMs) — os computadores superinteligentes que escrevem histórias, resolvem problemas matemáticos e respondem curiosidades.

Para entender este artigo, você precisa saber duas coisas. Primeiro, Ajuste de Instrução (Instruction Tuning). Pense em um modelo de IA bruto como um aluno brilhante, mas caótico, que conhece um milhão de fatos, mas não sabe como seguir as regras de um professor. O "ajuste de instrução" é como enviar esse aluno para um treinamento intensivo especial onde ele aprende a ouvir comandos, seguir instruções e responder perguntas em um formato específico. Isso geralmente os torna muito melhores em fazer o que queremos. Segundo, Confiança e Diversidade. Quando uma IA responde, ela pode nos dizer o quanto tem certeza (confiança). Ela também gera "racionais" — pequenas explicações de seu raciocínio. "Diversidade lexical" é apenas uma forma sofisticada de dizer "quantas palavras e estruturas de frases diferentes ela usa". Se uma IA está realmente pensando profundamente, ela pode tentar diferentes maneiras de explicar sua resposta. Se ela está apenas recitando um roteiro, pode soar igual todas as vezes.

Por que nos importamos com isso? Porque na vida real — como quando um robô médico diagnostica um paciente ou um robô advogado revisa um contrato — precisamos saber se o robô está realmente certo ou se está apenas soando confiante. Se o robô ficar mais barulhento e repetitivo sem ficar de fato mais inteligente, esse é um erro perigoso.


O Experimento do "Aluno Superconfiante"

Neste estudo, os pesquisadores decidiram brincar de detetive. Eles queriam ver o que acontece com esses alunos de IA após terminarem seu treinamento de "Ajuste de Instrução". Especificamente, eles perguntaram: O robô se torna mais confiante porque realmente aprendeu mais, ou é apenas porque está agindo de forma mais confiante enquanto suas explicações se tornam chatas e repetitivas?

Eles pegaram três famílias diferentes de modelos de IA (pense nelas como três escolas diferentes: Qwen, Mistral e Llama) e compararam suas versões "antes" e "depois". Eles fizeram milhares de perguntas de testes científicos, questionários de conhecimentos gerais e enigmas de lógica.

Aqui está o que eles descobriram, e é um pouco de uma reviravolta na trama.

1. O Robô Fica Mais Barulhento, Mas Não Necessariamente Mais Inteligente
Após o ajuste de instrução, os robôs tornaram-se significativamente mais confiantes. Eles pararam de hesitar. Se você perguntasse "Qual o seu nível de certeza?", eles diriam "Estou 90% seguro!" em vez de "Talvez 50%".

  • O Detalhe: Essa confiança nem sempre correspondia à sua precisão real. Por exemplo, em um teste (ARC-Easy), a confiança do modelo Llama saltou de cerca de 49% para 90%, mas sua pontuação real no teste permaneceu exatamente a mesma, em 82,2%. Era como um aluno levantando a mão e gritando "Eu sei disso!" com 100% de certeza, mesmo que não tivesse realmente melhorado sua nota no teste. Os pesquisadores descobriram que essa "superconfiança verbalizada" aconteceu consistentemente em todos os modelos testados.

2. A Explicação "Roteirizada"
Os pesquisadores então analisaram as explicações (os racionais) que os robôs escreveram. Eles mediram duas coisas:

  • Diversidade de cross-rationale: Se você fizer a mesma pergunta ao robô cinco vezes, ele te dá cinco explicações diferentes ou apenas copia e cola a mesma?
  • Diversidade de superfície (surface-level): Quantas palavras e pares de palavras únicas ele usa em uma única explicação?

Os resultados foram mistos, mas reveladores. Os robôs tornaram-se muito mais repetitivos ao explicar suas respostas. Se você fizesse a mesma pergunta cinco vezes, os modelos ajustados por instrução davam explicações muito semelhantes, enquanto os modelos "crus" eram mais variados. É como se o treinamento intensivo tivesse ensinado eles a se prenderem a um único roteiro seguro.

  • No entanto, a "diversidade de superfície" (quantas palavras diferentes eles usaram) foi um pouco caótica. Às vezes os robôs usavam mais palavras únicas, às vezes menos. Dependia de qual robô e de qual teste você estava usando. Não havia uma regra única para isso.

3. O Descompasso
A descoberta mais importante é que essas duas mudanças — tornar-se mais confiante e tornar-se mais repetitivo — nem sempre aconteciam juntas de forma organizada.

  • Às vezes, o robô tornava-se menos incerto (mais confiante) e também menos diverso em suas explicações.
  • Outras vezes, ele tornava-se menos incerto, mas mais diverso em sua escolha de palavras.
  • Os pesquisadores descobriram que você não podia simplesmente olhar para quantas palavras diferentes um robô usava para adivinhar o quão confiante ele estava. As duas coisas estavam dançando ritmos diferentes.

4. Não é Apenas Sobre o Tamanho
Você pode pensar: "Talvez os robôs ficaram mais confiantes porque começaram a escrever explicações mais longas?". Os pesquisadores verificaram isso. Eles forçaram os robôs a escrever explicações com exatamente o mesmo comprimento e observaram apenas aqueles em que escolheram a mesma resposta. Mesmo assim, o padrão se manteve: os modelos ajustados por instrução ainda eram mais confiantes e ainda eram mais repetitivos em suas explicações. A mudança não era apenas um efeito colateral de escrever mais ou menos; era uma mudança fundamental em como os modelos se comportavam.

A Conclusão Final

O artigo conclui que o ajuste de instrução faz com que os modelos de IA ajam como alunos superconfiantes que memorizaram uma única maneira segura de explicar as coisas. Eles parecem mais certos, mas não necessariamente sabem mais, e param de tentar explicar as coisas de maneiras diferentes.

Os pesquisadores sugerem que isso é um sinal de alerta. Se dependermos da confiança de uma IA para nos dizer se ela está certa, podemos ser enganados. O robô pode estar gritando "Tenho certeza!", enquanto na verdade está apenas repetindo o mesmo roteiro de sempre. Eles também descobriram que a confiança do robô nem sempre correspondia à sua precisão real, e suas explicações tornaram-se menos variadas, o que pode dificultar a percepção de quando o robô está cometendo um erro.

Em resumo: Só porque o robô parece mais seguro de si após o treinamento, não significa que ele seja mais inteligente. Pode ser apenas que ele esteja melhor em parecer que sabe o que está fazendo, mesmo que esteja usando as mesmas falas de sempre.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →