← Últimos artigos
💬 NLP

Popular but Wrong: Understanding and Mitigating LLM Overconfidence through Knowledge Popularity

Este artigo revela que os grandes modelos de linguagem exibem excesso de confiança em respostas incorretas quando essas respostas são altamente populares ou ocorrem frequentemente com a consulta, e demonstra que a incorporação de sinais de popularidade de conhecimento mitiga efetivamente esse excesso de confiança, ao mesmo tempo em que melhora significativamente a precisão da estimativa de confiança.

Autores originais: Shiyu Ni, Keping Bi, Jiafeng Guo, Xueqi Cheng

Publicado 2026-09-01
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Shiyu Ni, Keping Bi, Jiafeng Guo, Xueqi Cheng

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No zumbido silencioso de uma fazenda de servidores, uma nova espécie de inteligência emergiu, uma que pode escrever poesia, resolver equações e responder perguntas com uma fluência que parece quase humana. Esses grandes modelos de linguagem são treinados em oceanos vastos de texto, aprendendo a prever a próxima palavra em uma frase ao reconhecer padrões no conhecimento humano. Mas há um porém: essas máquinas não "sabem" verdadeiramente os fatos da mesma forma que nós. Elas não possuem uma memória do mundo, apenas um sentido estatístico de quais palavras costumam aparecer juntas. Quando estão inseguras, frequentemente não o admitem. Em vez disso, frequentemente produzem respostas incorretas com absoluta certeza, um fenômeno que os pesquisadores chamam de excesso de confiança. Este é um problema crítico para qualquer pessoa que dependa dessas ferramentas para segurança, medicina ou finanças, porque uma mentira confiante é muito mais perigosa do que uma verdade hesitante. A questão central para os cientistas tem sido por que esses modelos confiam tão profundamente em seus próprios erros. Seria um erro aleatório ou existe um padrão oculto na forma como eles aprendem que os torna certos das coisas erradas?

Uma equipe de pesquisadores partiu para investigar esse mistério observando o conceito de popularidade. Eles se perguntaram se os modelos estavam simplesmente favorecendo respostas que eram famosas ou frequentemente vistas em seus dados de treinamento, mesmo quando essas respostas estavam erradas para a pergunta específica feita. Para testar isso, eles focaram em um tipo específico de tarefa: perguntas factuais sobre entidades do mundo real, como perguntar quem dirigiu um filme específico ou onde um jogador de basquete nasceu. Eles reuniram milhares dessas perguntas e compararam as respostas corretas contra as respostas erradas que os modelos geraram. Eles mediram a "popularidade" das pessoas e lugares envolvidos contando quantos links apontavam para eles na internet e com que frequência apareciam juntos em documentos escritos. Essa abordagem permitiu que vissem se os modelos estavam gravitando em direção aos nomes mais familiares em vez dos corretos.

Os pesquisadores descobriram que, quando esses modelos cometem erros, seus erros estão longe de serem aleatórios. Em vez de adivinhar nomes obscuros ou improváveis, os modelos tendem a alucinar respostas que são mais populares do que os fatos corretos. Por exemplo, se um modelo não conhece o diretor de um filme menos conhecido, é mais provável que ele nomeie confiantemente um diretor famoso que tenha visto muitas vezes antes, em vez de um desconhecido aleatório. Além disso, os modelos frequentemente escolhem respostas que aparecem frequentemente nas mesmas frases que a pergunta, mesmo que essa conexão seja incorreta. Um modelo pode responder a uma pergunta sobre um diretor de cinema nomeando o produtor, simplesmente porque esses dois papéis são frequentemente mencionados juntos em artigos. O estudo descobriu que essas alternativas populares, mas erradas, não são apenas comuns; elas também são as que o modelo mais confia. Mesmo quando a resposta é incorreta, o modelo atribui um nível de confiança mais alto à resposta popular e de som familiar do que a uma resposta menos famosa e correta.

Esse padrão se mantém em diferentes tipos de perguntas e diferentes tamanhos de modelos, sugerindo uma falha fundamental na forma como esses sistemas processam o conhecimento. Os pesquisadores descobriram que, quanto mais uma informação é repetida nos dados de treinamento, mais provável é que o modelo a gere e mais confiante ele será, independentemente de ser a resposta certa para a consulta específica. Isso cria um ciclo de feedback perigoso onde a resposta incorreta mais familiar é tratada como a verdade mais provável. O estudo destaca que lacunas substanciais de conhecimento de domínio estão associadas a uma geração ainda mais enviesada pela popularidade, o que significa que, quando os modelos sabem menos sobre um tópico específico, são mais propensos a confiar em associações familiares, mas incorretas. As descobertas revelam fortes associações sistemáticas entre popularidade e excesso de confiança, embora os pesquisadores observem que estas são correlações e não causalidades, o que significa que mostram um vínculo claro sem provar que a popularidade sozinha causa as previsões excessivamente confiantes.

Para enfrentar isso, os pesquisadores desenvolveram um método para ajudar os modelos a reconhecerem quando sua confiança pode estar equivocada. Eles criaram um sistema que observa a popularidade da resposta e a relação entre a pergunta e a resposta antes de aceitar a pontuação de confiança do modelo. Ao fatorar o quão popular é a resposta e com que frequência ela aparece com a pergunta, o sistema pode ajustar a confiança do modelo para baixo quando ele está seguro demais de uma resposta popular, mas provavelmente errada. Quando testaram essa abordagem em seis modelos diferentes, os resultados foram impressionantes. A confiança média que os modelos colocavam em suas respostas incorretas caiu dramaticamente, de um alto de 0,765 para 0,254. Ao mesmo tempo, a precisão geral da confiança do modelo melhorou significativamente, o que significa que o modelo tornou-se muito melhor em saber quando estava certo e quando estava errado.

O estudo conclui que a popularidade é um motor chave para o excesso de confiança na inteligência artificial. Os modelos não estão apenas adivinhando; eles estão seguindo um caminho de menor resistência em direção aos nomes e associações mais familiares. Ao compreender esse viés, é possível construir melhores salvaguardas que impeçam esses sistemas de soarem autoritários quando estão, na verdade, equivocados. Os pesquisadores observaram que, embora seu trabalho tenha focado em perguntas factuais sobre entidades específicas, o princípio provavelmente se estende a outras áreas onde os modelos possam favorecer padrões comuns em vez de verdades específicas. Eles também reconheceram que suas medidas de popularidade foram baseadas em dados públicos da internet, que servem como um substituto para o que os modelos viram durante o treinamento, e que a relação que encontraram é uma forte correlação, não uma causa e efeito comprovada. No entanto, a capacidade de usar esses sinais de popularidade para acalmar o excesso de confiança da máquina oferece um passo prático para tornar essas ferramentas poderosas mais confiáveis e dignas de confiança para o uso cotidiano.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →