DECK: A Consistency x Confidence Taxonomy of LLM Hallucinations
O artigo introduz o DECK, uma nova taxonomia 2x2 que classifica as alucinações de LLM com base em suas assinaturas de detectabilidade através da consistência interamostral e da confiança ao nível do token, revelando que tipos específicos de erro (Drift, Entrenched, Confabulation, Knotted) exigem métodos de detecção distintos e expondo um ponto cego universal onde fabricações confiáveis e repetíveis em entradas de lacuna de conhecimento permanecem indetectáveis por abordas atuais de quantificação de incerteza ao nível da saída.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um robô muito inteligente e confiante que responde perguntas. Às vezes, esse robô inventa coisas. Chamamos esses erros de "alucinações".
Por muito tempo, pesquisadores tentaram classificar esses erros pelo que estava errado (ex: "Ele errou os fatos" ou "Ele raciocinou mal"). Mas os autores deste artigo, Mohit Singh Chauhan, dizem que isso é como classificar acidentes de carro por "bateu em uma árvore" vs. "bateu em uma parede". Isso diz o que aconteceu, mas não diz como pegar o motorista antes do acidente.
Este artigo introduz uma nova maneira de classificar erros chamada DECK. Em vez de olhar para o conteúdo do erro, ele olha para o sinal que o erro deixa para trás. Ele pergunta: "Qual tipo de detector teria detectado isso?"
Os Dois Detectores (Os Eixos)
Para construir seu sistema, os autores usam dois "sensores" simples para observar o robô:
- O Sensor de Consistência (O Teste da "Repetição"): Se você fizer a mesma pergunta ao robô 10 vezes, ele dará a mesma resposta todas as vezes?
- Alta Consistência: Ele repete a mesma resposta.
- Baixa Consistência: Ele dá uma resposta diferente a cada vez.
- O Sensor de Confiança (O Teste da "Certeza"): O quão seguro o robô parece? Ele diz a resposta com 100% de certeza ou parece hesitante?
- Alta Confiança: "Eu tenho 100% de certeza."
- Baixa Confiança: "Eu acho que talvez..."
A Taxonomia DECK (As Quatro Caixas)
Ao cruzar esses dois sensores, os autores criam uma grade 2x2 com quatro tipos de erros. Eles deram nomes cativantes:
1. Drift (O "Errante Confuso")
- Como é: O robô é confiante, mas dá uma resposta errada diferente toda vez que você pergunta.
- A Analogia: Imagine um guia turístico que é muito barulhento e seguro de si, mas toda vez que você pergunta "Onde fica o museu?", ele aponta para uma direção diferente. Ele é confiante, mas está à deriva (drifting).
- Quem o pega? Um detector Black-Box (um que verifica se as respostas coincidem entre si) pegará isso porque as respostas não concordam.
2. Entrenched (O "Mulo Teimoso")
- Como é: O robô é confiante e dá a mesma resposta errada exata todas as vezes.
- A Analogia: Isso é como um aluno que memorizou o gabarito errado. Se você perguntar "Quanto é 2+2?", ele dirá confiantemente "5" toda vez, não importa quantas vezes você pergunte. Ele está preso (entrenched) em um equívoco.
- Quem o pega? Este é o mais difícil. Os detectores de consistência acham que está certo porque é consistente! Somente um Juiz (uma segunda IA independente que conhece os fatos) pode pegar isso.
3. Confabulation (O "Fabricador Hesitante")
- Como é: O robô está incerto e dá respostas erradas diferentes a cada vez.
- A Analogia: É o robô admitindo: "Eu não sei, mas aqui vai um palpite... na verdade, talvez este outro palpite?". Ele está inventando coisas, mas sabe que está apenas supondo.
- Quem o pega? Todo mundo pega isso. É baixa confiança e inconsistência, então todos os detectores sinalizam isso como "arriscado".
4. Knotted (O "Cerca Emaranhada")
- Como é: O robô está incerto (baixa confiança), mas dá a mesma resposta errada exata todas as vezes.
- A Analogia: Imagine um robô que tem medo de estar errado, então ele continua dizendo: "Não tenho certeza, mas acho que é provavelmente X", e ele diz "provavelmente X" todas as vezes. Ele está "emaranhado" (knotted) em um padrão repetitivo, mas errado e seguro.
- Quem o pega? Um detector White-Box (um que olha para a matemática interna do robô) pegará isso porque a matemática interna do robô mostra que ele não está realmente seguro, embora a resposta seja repetida.
A Grande Descoberta: O "Ponto Cego Universal"
Os autores descobriram uma situação assustadora onde todos os detectores falham ao mesmo tempo.
Eles testaram os robôs em perguntas que ninguém consegue responder (como "Qual é a capital de um país que ainda não existe?").
- Os robôs não disseram "Eu não sei".
- Em vez disso, eles inventaram confiantemente uma resposta falsa e a repetiram todas as vezes.
Isso criou uma armadilha perfeita:
- O Sensor de Consistência viu que eles estavam repetindo a resposta, então pensou: "Ótimo, é consistente!"
- O Sensor de Confiança viu que eles pareciam seguros, então pensou: "Ótimo, é confiante!"
- O Juiz falhou porque o Juiz também não sabia a resposta (já que o país não existe).
Os autores chamam isso de "Ponto Cego Universal". Quando um robô repete confiantemente uma mentira sobre algo que ele desconhece, nenhum detector atual consegue pegá-lo.
A Solução
O artigo sugere que, em vez de tentar construir um detector melhor para pegar essas mentiras específicas, devemos construir um "Envelope de Recusa" (Refusal Envelope). Isso é como um segurança de uma boate. Se a pergunta for sobre algo que o robô não deveria saber (uma lacuna de conhecimento), o segurança deve impedir o robô de responder, fazendo-o dizer "Eu não posso responder a isso", antes mesmo de o robô tentar inventar algo.
Resumo
O artigo não diz apenas que "a IA comete erros". Ele diz: "A IA comete erros em quatro padrões específicos. Alguns padrões são fáceis de pegar, outros são difíceis, e um padrão específico (mentiras confiantes e repetidas sobre coisas desconhecidas) é atualmente impossível de ser pego com ferramentas padrão. Precisamos impedir o robô de responder a essas perguntas em primeiro lugar."
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.