← Últimos artigos
💬 NLP

DECK: A Consistency x Confidence Taxonomy of LLM Hallucinations

O artigo introduz o DECK, uma nova taxonomia 2x2 que classifica as alucinações de LLM com base em suas assinaturas de detectabilidade através da consistência interamostral e da confiança ao nível do token, revelando que tipos específicos de erro (Drift, Entrenched, Confabulation, Knotted) exigem métodos de detecção distintos e expondo um ponto cego universal onde fabricações confiáveis e repetíveis em entradas de lacuna de conhecimento permanecem indetectáveis por abordas atuais de quantificação de incerteza ao nível da saída.

Autores originais: Mohit Singh Chauhan

Publicado 2026-06-02✓ Author reviewed
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Mohit Singh Chauhan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um robô muito inteligente e confiante que responde perguntas. Às vezes, esse robô inventa coisas. Chamamos esses erros de "alucinações".

Por muito tempo, pesquisadores tentaram classificar esses erros pelo que estava errado (ex: "Ele errou os fatos" ou "Ele raciocinou mal"). Mas os autores deste artigo, Mohit Singh Chauhan, dizem que isso é como classificar acidentes de carro por "bateu em uma árvore" vs. "bateu em uma parede". Isso diz o que aconteceu, mas não diz como pegar o motorista antes do acidente.

Este artigo introduz uma nova maneira de classificar erros chamada DECK. Em vez de olhar para o conteúdo do erro, ele olha para o sinal que o erro deixa para trás. Ele pergunta: "Qual tipo de detector teria detectado isso?"

Os Dois Detectores (Os Eixos)

Para construir seu sistema, os autores usam dois "sensores" simples para observar o robô:

  1. O Sensor de Consistência (O Teste da "Repetição"): Se você fizer a mesma pergunta ao robô 10 vezes, ele dará a mesma resposta todas as vezes?
    • Alta Consistência: Ele repete a mesma resposta.
    • Baixa Consistência: Ele dá uma resposta diferente a cada vez.
  2. O Sensor de Confiança (O Teste da "Certeza"): O quão seguro o robô parece? Ele diz a resposta com 100% de certeza ou parece hesitante?
    • Alta Confiança: "Eu tenho 100% de certeza."
    • Baixa Confiança: "Eu acho que talvez..."

A Taxonomia DECK (As Quatro Caixas)

Ao cruzar esses dois sensores, os autores criam uma grade 2x2 com quatro tipos de erros. Eles deram nomes cativantes:

1. Drift (O "Errante Confuso")

  • Como é: O robô é confiante, mas dá uma resposta errada diferente toda vez que você pergunta.
  • A Analogia: Imagine um guia turístico que é muito barulhento e seguro de si, mas toda vez que você pergunta "Onde fica o museu?", ele aponta para uma direção diferente. Ele é confiante, mas está à deriva (drifting).
  • Quem o pega? Um detector Black-Box (um que verifica se as respostas coincidem entre si) pegará isso porque as respostas não concordam.

2. Entrenched (O "Mulo Teimoso")

  • Como é: O robô é confiante e dá a mesma resposta errada exata todas as vezes.
  • A Analogia: Isso é como um aluno que memorizou o gabarito errado. Se você perguntar "Quanto é 2+2?", ele dirá confiantemente "5" toda vez, não importa quantas vezes você pergunte. Ele está preso (entrenched) em um equívoco.
  • Quem o pega? Este é o mais difícil. Os detectores de consistência acham que está certo porque é consistente! Somente um Juiz (uma segunda IA independente que conhece os fatos) pode pegar isso.

3. Confabulation (O "Fabricador Hesitante")

  • Como é: O robô está incerto e dá respostas erradas diferentes a cada vez.
  • A Analogia: É o robô admitindo: "Eu não sei, mas aqui vai um palpite... na verdade, talvez este outro palpite?". Ele está inventando coisas, mas sabe que está apenas supondo.
  • Quem o pega? Todo mundo pega isso. É baixa confiança e inconsistência, então todos os detectores sinalizam isso como "arriscado".

4. Knotted (O "Cerca Emaranhada")

  • Como é: O robô está incerto (baixa confiança), mas dá a mesma resposta errada exata todas as vezes.
  • A Analogia: Imagine um robô que tem medo de estar errado, então ele continua dizendo: "Não tenho certeza, mas acho que é provavelmente X", e ele diz "provavelmente X" todas as vezes. Ele está "emaranhado" (knotted) em um padrão repetitivo, mas errado e seguro.
  • Quem o pega? Um detector White-Box (um que olha para a matemática interna do robô) pegará isso porque a matemática interna do robô mostra que ele não está realmente seguro, embora a resposta seja repetida.

A Grande Descoberta: O "Ponto Cego Universal"

Os autores descobriram uma situação assustadora onde todos os detectores falham ao mesmo tempo.

Eles testaram os robôs em perguntas que ninguém consegue responder (como "Qual é a capital de um país que ainda não existe?").

  • Os robôs não disseram "Eu não sei".
  • Em vez disso, eles inventaram confiantemente uma resposta falsa e a repetiram todas as vezes.

Isso criou uma armadilha perfeita:

  • O Sensor de Consistência viu que eles estavam repetindo a resposta, então pensou: "Ótimo, é consistente!"
  • O Sensor de Confiança viu que eles pareciam seguros, então pensou: "Ótimo, é confiante!"
  • O Juiz falhou porque o Juiz também não sabia a resposta (já que o país não existe).

Os autores chamam isso de "Ponto Cego Universal". Quando um robô repete confiantemente uma mentira sobre algo que ele desconhece, nenhum detector atual consegue pegá-lo.

A Solução

O artigo sugere que, em vez de tentar construir um detector melhor para pegar essas mentiras específicas, devemos construir um "Envelope de Recusa" (Refusal Envelope). Isso é como um segurança de uma boate. Se a pergunta for sobre algo que o robô não deveria saber (uma lacuna de conhecimento), o segurança deve impedir o robô de responder, fazendo-o dizer "Eu não posso responder a isso", antes mesmo de o robô tentar inventar algo.

Resumo

O artigo não diz apenas que "a IA comete erros". Ele diz: "A IA comete erros em quatro padrões específicos. Alguns padrões são fáceis de pegar, outros são difíceis, e um padrão específico (mentiras confiantes e repetidas sobre coisas desconhecidas) é atualmente impossível de ser pego com ferramentas padrão. Precisamos impedir o robô de responder a essas perguntas em primeiro lugar."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →