"very likely" Means "uncertain"? How LLMs Diverge from Humans in Linguistic Uncertainty Quantification
Este artigo investiga a divergência entre humanos e grandes modelos de linguagem na quantificação de incerteza verbal ao introduzir um algoritmo baseado em otimização, METHODNAME, que aprende mapeamentos de probabilidade ideais para marcadores verbais diretamente dos outputs do modelo para revelar disparidades sistemáticas de confiança sem depender de amostragem repetida.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Quando falamos, frequentemente cautelamos nossas afirmações. Dizemos que algo é "provável", "possível" ou "quase certo", usando essas palavras para sinalizar o quanto realmente sabemos. Essa capacidade de expressar dúvida é uma forma de metacognição, um controle mental onde reconhecemos os limites do nosso próprio conhecimento. É uma parte crucial da comunicação humana, permitindo-nos navegar pela incerteza sem fingir ter respostas que não possuímos. No mundo da inteligência artificial, especificamente com os grandes modelos de linguagem, essa mesma capacidade está se tornando um recurso de segurança crítico. Esses modelos podem, por vezes, gerar informações que soam confiantes, mas que são factualmente incorretas, um fenômeno conhecido como alucinação. Para confiar nesses sistemas, especialmente em campos sensíveis como a medicina ou o direito, precisamos saber quando eles estão inseguros. O desafio reside em descobrir se as palavras que uma IA usa para expressar dúvida significam o mesmo para um ouvinte humano do que significam para a própria máquina.
Uma equipe de pesquisadores partiu para investigar se a incerteza verbal expressa por grandes modelos de linguagem se alinha com a compreensão humana. Eles começaram reunindo uma coleção massiva de como as pessoas interpretam frases como "muito provável" ou "incerto". Baseando-se em décadas de pesquisa em psicologia e ciência da decisão, eles compilaram um guia de referência que mapeia essas frases comuns para probabilidades numéricas específicas. Por exemplo, na mente humana, a frase "muito provável" corresponde a um alto grau de confiança, enquanto "possível" situa-se em algum lugar no meio. Os pesquisadores então testaram vários modelos de linguagem avançados, pedindo-lhes que respondessem a perguntas e explicassem sua confiança usando essas mesmas expressões de linguagem natural. Eles compararam as respostas dos modelos com o guia de referência humano para ver se as máquinas estavam falando a mesma língua que seus usuários.
Os resultados revelaram uma desconexão significativa. Embora os modelos pudessem usar as palavras, eles atribuíam níveis diferentes de certeza a elas do que os humanos fazem. Por exemplo, quando um humano ouve "muito provável", interpreta como uma probabilidade forte, mas os modelos no estudo frequentemente usavam essa frase para descrever situações em que estavam, na verdade, bastante inseguros. Inversamente, os modelos poderiam expressar um alto grau de confiança para frases que os humanos consideram meros palpites. Esse descompasso significa que simplesmente ler a saída de um modelo e assumir que seus sinais verbais refletem seu estado interno pode ser enganoso. O estudo mostrou que confiar em um dicionário de palavras de incerteza feito por humanos não era suficiente para mensurar com precisão a confiança de uma máquina; os modelos tinham sua própria lógica interna distinta para o que essas palavras significavam.
Para preencher essa lacuna, os pesquisadores desenvolveram um novo método chamado VOCAL. Em vez de forçar os modelos a se conformarem às definições humanas, essa abordagem aprende o significado específico das palavras de incerteza diretamente do próprio comportamento do modelo. O sistema analisa milhares de respostas do modelo, observando quais frases ele utiliza quando está correto e quais utiliza quando está errado. Ele então constrói um mapa personalizado que traduz os hábitos verbais específicos do modelo em pontuações de probabilidade precisas. Esse processo envolve uma otimização matemática que suaviza os dados, garantindo que frases de som semelhante recebam pontuações semelhantes, mesmo que o modelo as utilize raramente. Ao adaptar a interpretação ao modelo específico, o método cria uma maneira muito mais confiável de detectar quando o modelo está inseguro.
Os experimentos demonstraram que essa abordagem personalizada funciona significativamente melhor do que tentar impor um padrão humano à máquina. Em testes em vários conjuntos de dados, incluindo problemas matemáticos complexos e questões médicas, o novo método foi muito mais preciso ao prever se a resposta de um modelo estava correta ou incorreta em comparação com o uso apenas do guia de referência humano. Em alguns casos, a melhoria foi substancial, transformando um método que mal performava melhor do que o acaso em um que podia identificar erros de forma confiável. Os pesquisadores descobriram que essa técnica poderia alcançar níveis de desempenho comparáveis a métodos muito mais caros que exigem que o modelo gere múltiplas respostas e as compare, mas sem o tempo ou o poder computacional adicional.
O estudo conclui que, embora os grandes modelos de linguagem possam imitar padrões de fala humanos, sua compreensão interna da incerteza é fundamentalmente diferente da nossa. Uma frase como "muito provável" não carrega o mesmo peso para a máquina que carrega para uma pessoa. Para tornar esses sistemas verdadeiramente confiáveis, não podemos simplesmente pedir que falem como humanos e esperar que signifiquem a mesma coisa. Em vez disso, devemos aprender a ler seu dialeto específico de incerteza. Ao criar mapas personalizados que traduzem os sinais verbais únicos de um modelo em sinais claros de confiança, podemos distinguir melhor entre uma resposta correta e uma alucinação confiante, tornando a tecnologia mais segura e confiável para o uso no mundo real.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.