← Últimos artigos
💬 NLP

Uncertainty Quantification for Language Models: A Suite of Black-Box, White-Box, LLM Judge, and Ensemble Scorers

Este artigo apresenta o UQLM, um kit de ferramentas Python versátil e uma estrutura de conjunto ajustável que integra técnicas de quantificação de incerteza de caixa preta, caixa branca e LLM-como-Juiz para fornecer pontuações de confiança padronizadas para detectar alucinações em grandes modelos de linguagem, demonstrando desempenho superior sobre métodos existentes em vários benchmarks.

Autores originais: Dylan Bouchard, Mohit Singh Chauhan

Publicado 2026-01-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Dylan Bouchard, Mohit Singh Chauhan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robô muito inteligente, mas ocasionalmente excessivamente confiante. Você faz perguntas a ele e ele dá respostas que parecem perfeitas. Mas, às vezes, ele inventa coisas completamente — isso é chamado de "alucinação". Em trabalhos de alto risco, como saúde ou finanças, um fato inventado não é apenas um erro; é perigoso.

Este artigo apresenta um conjunto de ferramentas "truth-o-meter" (medidor de verdade) projetado para ajudar os humanos a descobrir quando esse assistente robô está mentindo para eles, sem a necessidade de consultar um livro de referência primeiro (um cenário de "livro fechado").

Aqui está como o framework do artigo funciona, explicado através de analogias simples:

1. Os Três Tipos de "Detetives da Verdade"

Os autores construíram um conjunto de diferentes métodos para verificar se uma resposta é real. Pense neles como três tipos diferentes de detetives:

  • O Detetive do "Pensamento de Grupo" (Black-Box UQ):
    Imagine que você faz a mesma pergunta ao robô 15 vezes. Se o robô estiver confiante e souber a resposta, ele dará aproximadamente a mesma resposta todas as vezes, apenas com uma frase ligeiramente diferente. Se o robô estiver alucinando, suas respostas serão todas espalhadas — histórias totalmente diferentes a cada vez.

    • A Visão do Artigo: Eles usam matemática para medir o quão semelhantes são essas 15 respostas. Se todas forem muito semelhantes, a "pontuação de confiança" é alta. Se forem caóticas, a pontuação é baixa. Eles usam diferentes maneiras de medir essa semelhança, como verificar se as frases se contradizem (como um verificador de fatos) ou o quanto elas se sobrepõem em significado.
  • O Detetive do "Monólogo Interno" (White-Box UQ):
    Imagine que o robô está escrevendo uma resposta palavra por palavra. Ao escolher cada palavra, ele tem um pequeno "pressentimento" (probabilidade) sobre se aquela palavra é a correta.

    • A Visão do Artigo: Se o robô estiver muito seguro de cada palavra que escolhe, suas pontuações de "pressentimento" interno são altas e a resposta provavelmente é verdadeira. Se o robô estiver hesitando e escolhendo palavras com baixa confiança, a resposta provavelmente é uma alucinação. Isso requer acesso aos "pensamentos" internos do robô (probabilidades de tokens).
  • O Detetive da "Revisão por Pares" (LLM-as-a-Judge):
    Imagine pedir a um segundo robô, igualmente inteligente, para ler a resposta do primeiro robô e dar uma nota a ela.

    • A Visão do Artigo: Eles fornecem a pergunta e a resposta para outra IA e perguntam: "O quanto você tem certeza de que isso está correto?". A segunda IA dá uma pontuação de 0 a 100, que é então convertida em uma pontuação de confiança de 0 a 1. Curiosamente, o artigo descobriu que o melhor "juiz" é geralmente um robô que também é muito bom em responder a esses tipos específicos de perguntas por conta própria.

2. O Super-Time "Mistura e Combina" (O Ensemble)

A maior inovação do artigo é perceber que nenhum detetive individual é perfeito. Às vezes, o detetive do "Pensamento de Grupo" está certo; outras vezes, o detetive da "Revisão por Pares" é melhor.

Assim, eles criaram um Ensemble Ajustável. Pense nisso como um treinador que pode ajustar o peso da opinião de cada detetive.

  • Se você estiver fazendo perguntas de matemática, o treinador pode ouvir mais o detetive do "Monólogo Interno".
  • Se você estiver fazendo perguntas de história, o treinador pode ouvir mais o detetive da "Revisão por Pares".
  • Como funciona: Você fornece ao sistema alguns exemplos de perguntas onde você já sabe as respostas corretas. O sistema "aprende" como misturar as pontuações de todos os detetives para obter o resultado mais preciso para as suas necessidades específicas.

3. Os Resultados: Por Que Isso Importa

Os autores testaram este conjunto de ferramentas em quatro modelos de IA diferentes em seis tipos diferentes de perguntas (como problemas matemáticos, curiosidades de múltipla escolha e fatos de resposta aberta).

  • O Time Vence: O "Super-Time de Mistura e Combina" quase sempre venceu qualquer detetive individual trabalhando sozinho.
  • A Filtragem Funciona: Eles mostraram que, se você usar essas pontuações para bloquear respostas de baixa confiança, as respostas restantes são muito mais precisas. Por exemplo, se eles bloqueassem os 40% inferiores das respostas com base na pontuação, a precisão das respostas restantes aumentou significamente.
  • Retornos Decrescentes: Eles descobriram que pedir ao robô 15 respostas diferentes é ótimo, mas pedir 30 ou 50 não ajuda muito mais. É como pedir conselhos a 15 amigos; pedir a 50 amigos apenas leva muito tempo sem dar um conselho muito melhor.

4. O Kit de Ferramentas: uqlm

Para tornar isso fácil para qualquer pessoa usar, os autores lançaram um pacote de software gratuito chamado uqlm. É como um kit de ferramentas pré-construído que permite aos desenvolvedores conectar esses diferentes "detetives" e o "treinador" (ensemble) sem ter que construir a matemática do zero.

A Conclusão Final

O artigo conclui que não existe uma solução de "tamanho único" para pegar as mentiras da IA. A melhor abordagem é usar um sistema flexível que combina diferentes métodos e os ajusta especificamente para o tipo de perguntas que você está fazendo. Isso ajuda a garantir que, quando uma IA fala, saibamos o quanto podemos confiar nela.

Nota Importante do Artigo: Os autores alertam que uma pontuação de confiança alta não garante que a resposta seja verdadeira no mundo real; apenas significa que a IA está segura de sua resposta. Portanto, em campos críticos como medicina ou direito, os humanos ainda devem verificar o trabalho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →