← Últimos artigos
💬 NLP

Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer

Este artigo desafia a visão de que as alucinações decorrem exclusivamente da falta de conhecimento, revelando que LLMs maiores ajustados por instruções frequentemente alucinam porque falham em comprometer-se com um conceito correto já presente em sua distribuição de probabilidade, dispersando, em vez disso, a massa de probabilidade entre alternativas devido a um mecanismo de afinação dependente da escala que impulsiona tanto a utilidade quanto erros confiantes.

Autores originais: Jewon Yeom, Jaewon Sok, Heejun Kim, Seonghyeon Park, Jeongjae Park, Taesup Kim

Publicado 2026-05-22
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jewon Yeom, Jaewon Sok, Heejun Kim, Seonghyeon Park, Jeongjae Park, Taesup Kim

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: Não Se Trata de "Não Saber"

A maioria das pessoas pensa que as alucinações de IA (quando uma IA inventa coisas) acontecem porque a IA simplesmente não sabe a resposta. A ideia é: Se a IA sabe o fato, ela diz a verdade. Se não sabe, ela chuta.

Este artigo argumenta que isso está errado.

Os pesquisadores descobriram que, frequentemente, a IA sabe a resposta. Ela tem a informação correta "na cabeça" no exato momento em que começa a falar. No entanto, ela ainda escolhe dizer a coisa errada. Eles chamam isso de "Falha de Compromisso".

A Analogia: O Chef Nervoso

Imagine um chef muito talentoso (a IA) ao qual é perguntado: "Qual é a capital da França?"

  1. A Velha Teoria: Se o chef não sabe a resposta, ele chuta "Londres". Se ele sabe, ele diz "Paris".
  2. A Nova Teoria (Este Artigo): O chef sabe que a resposta é Paris. Na verdade, ele está pensando em "Paris" com tanta intensidade que seu cérebro está zumbindo com a palavra. Mas, como ele está pensando em "Paris" de muitas maneiras diferentes ao mesmo tempo (por exemplo, "Paris", "paris", "a cidade das luzes", "capital da França"), seu cérebro fica confuso.
    • Ele tem uma sensação forte por "Paris", mas ela está espalhada por todas essas frases diferentes.
    • Ao mesmo tempo, ele tem um pensamento muito nítido e focado sobre "Londres" (talvez porque tenha visto uma foto do Big Ben mais cedo).
    • Mesmo que a sensação de "Paris" seja mais forte no geral, o pensamento sobre "Londres" é tão nítido e concentrado que vence a corrida até a boca dele. Ele solta "Londres" com confiança, mesmo sabendo que era Paris.

Como Eles Descobriram Isso

Os pesquisadores observaram como os modelos de IA "pensam" antes de falar. Eles focaram na primeira palavra que a IA gera (o "passo de compromisso").

Eles introduziram uma nova maneira de medir o que a IA sabe, chamada Massa de Probabilidade Semântica.

  • Antigo Método: A IA escolheu a palavra exatamente correta? (Por exemplo, ela disse "Paris"?)
  • Novo Método: A IA teve uma sensação forte sobre o conceito de Paris, mesmo que isso estivesse dividido entre "Paris", "paris" e "a cidade das luzes"?

As Descobertas:

  • Eles testaram muitos modelos de IA (de pequenos a enormes).
  • Eles descobriram que 16% a 47% das vezes em que a IA cometeu um erro, ela na verdade tinha uma forte "sensação" pela resposta correta.
  • O Revés: Quanto maior o modelo de IA, mais frequentemente isso acontecia. Modelos maiores não apenas sabiam mais; eles cometiam mais desses tipos específicos de erros onde sabiam a resposta, mas ainda assim erravam.

Por Que Isso Acontece? (O Efeito de "Afiamento")

O artigo sugere que o Ajuste por Instrução (treinar a IA para ser útil e seguir regras) muda como a IA pensa.

Imagine que o cérebro da IA é uma paisagem de colinas e vales.

  • Antes do Treinamento: As colinas são planas e embaçadas. A IA está insegura.
  • Depois do Treinamento: A IA torna-se muito decisiva. Ela transforma seus pensamentos em picos nítidos e altos.
    • Quando a IA está certa, o pico para a resposta correta é tão alto e nítido que vence facilmente.
    • Mas, às vezes a IA fica confusa. A resposta "correta" é dividida em muitas pequenas colinas planas (porque ela está pensando em "Paris", "paris", "França", etc.). Enquanto isso, a resposta "errada" é um único pico incrivelmente nítido e alto.
    • O processo de tomada de decisão da IA é como uma bola rolando ladeira abaixo. Ela sempre rola em direção ao ponto mais nítido. Mesmo que o lado "correto" tenha mais "área de colina" no total, o lado "errado" tem o pico mais nítido, então a bola rola para lá.

Os Dois Tipos de Erros

Os pesquisadores encontraram duas maneiras pelas quais essa "Falha de Compromisso" acontece:

  1. A Primeira Palavra Errada: A IA começa a frase com a palavra errada imediatamente (por exemplo, dizendo "Moscou" em vez de "Paris"), mesmo tendo tido uma forte sensação por Paris.
  2. O Caminho Errado: A IA começa com a palavra certa (por exemplo, "Paris"), mas logo em seguida sai do trilho nas próximas palavras, transformando "Paris" em uma história sobre uma cidade diferente.

O "Imposto de Alinhamento"

O artigo conclui que isso é um efeito colateral de tornar os modelos de IA "úteis".

  • Para tornar uma IA confiante e rápida, nós a treinamos para ser muito decisiva (picos nítidos).
  • Isso funciona muito bem quando a IA está certa.
  • Mas, quando a IA está ligeiramente confusa, essa mesma "decisividade" faz com que ela esteja confiantemente errada. Ela não hesita em escolher a resposta errada porque seu cérebro é tão bom em escolher a opção "mais nítida", mesmo que essa opção esteja incorreta.

Resumo

  • Alucinações nem sempre são ignorância. Às vezes a IA sabe a resposta, mas falha em "comprometer-se" com ela.
  • Modelos maiores não são perfeitos. À medida que os modelos ficam maiores, eles ficam melhores em ser decisivos, o que, ironicamente, os torna mais propensos a estarem confiantemente errados.
  • O problema é a distribuição. A IA espalha seu "conhecimento" da resposta correta muito fino por muitas variações, enquanto a resposta errada recebe todo o foco em um único ponto nítido. A IA escolhe o ponto nítido, não a resposta correta.

O artigo sugere que, para corrigir isso, talvez precisemos ensinar a IA a olhar para o "conceito inteiro" (todas as maneiras de dizer "Paris") em vez de apenas escolher a única palavra mais nítida.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →