← Últimos artigos
🤖 machine learning

Authority, Truth, and Citation Bias: A Large-Scale Multi-Domain Benchmark for Studying Epistemic Susceptibility in Large Language Models

Este artigo apresenta o AuthorityBench, um benchmark multidomínio de larga escala que demonstra que a mera presença de citações — independentemente de sua precisão factual — aumenta significativamente as taxas de alucinação em grandes modelos de linguagem, com os efeitos mais pronunciados observados quando citações fabricadas acompanham afirmações verdadeiras.

Autores originais: Aryan Khurana, Aravind Ramana RN, Dhruv Kumar

Publicado 2026-06-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Aryan Khurana, Aravind Ramana RN, Dhruv Kumar

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está fazendo um quiz de conhecimentos gerais. Você sabe que a resposta é "Paris" porque já esteve lá. De repente, um professor entra na sala, aponta para um livro de aparência sofisticada na estante e diz: "Na verdade, a capital é Londres. Eu li isso em um periódico prestigioso".

Você mudaria sua resposta? A maioria dos humanos hesitaria e pensaria: "Espere, esse livro parece importante. Talvez eu esteja errado".

Este artigo, AuthorityBench, faz uma pergunta semelhante sobre a Inteligência Artificial (IA). Ele quer saber: Se uma IA conhece a verdade, mas alguém lhe dá uma "citação" (uma referência a uma fonte) que diz o oposto, ela confiará cegamente na citação e esquecerá a verdade?

Aqui está o detalhamento de suas descobertas, usando analogias simples.

O Experimento: Um Teste de "Fake News" para a IA

Os pesquisadores construíram um teste massivo chamado AuthorityBench. Pense nisso como um enorme quiz de 220.000 perguntas projetado para enganar os modelos de IA.

Eles configuraram um jogo "2x2" com quatro cenários:

  1. Afirmação Verdadeira + Citação Real: A IA está certa e a fonte é real. (O modo fácil).
  2. Afirmação Falsa + Citação Falsa: A IA está errada e a fonte é falsa. (A armadilha óbvia).
  3. Afirmação Falsa + Citação Real: A IA está errada, mas a fonte é real. (A armadilha complicada).
  4. Afirmação Verdadeira + Citação Falsa: Esta é a grande descoberta. A IA está certa, mas apresentam a ela uma fonte falsa que diz que ela está errada.

Eles testaram isso em quatro áreas: Conhecimentos Gerais, Ciência, Direito e Medicina. Eles também alteraram o "estilo" das fontes falsas: algumas pareciam vir de vencedores do Prêmio Nobel (alto prestígio), outras de blogs desconhecidos (baixo prestígio) e algumas tinham nomes de diferentes países.

A Grande Surpresa: A "Armadilha da Autoridade"

O resultado mais chocante é que as citações agem como um "feitiço mágico" que faz a IA alucinar (mentir).

  • O "Efeito da Fonte Falsa": Quando a IA sabia a resposta correta (ex: "Paris é a capital"), mas uma citação falsa aparecia dizendo "Londres é a capital", a IA frequentemente mudava sua resposta para Londres.
  • Os Números: Na categoria "Conhecimentos Gerais", isso aconteceu de 35% a 77% das vezes. Isso significa que, se você desse a uma IA um fato verdadeiro e uma referência falsa, ela era mais propensa a negar a verdade do que a manter-se fiel a ela.
  • O "Efeito da Fonte Real": Mesmo que a citação fosse real, mas a afirmação fosse falsa, a IA ainda era mais propensa a alucinar do que se não houvesse nenhuma citação.

A Analogia: Imagine um aluno que sabe que "2+2=4". Se você entregar a ele um pedaço de papel que diz "Segundo o famoso Professor Smith, 2+2=5", o aluno para de confiar no próprio cérebro e escreve "5". O papel (a citação) superou a matemática.

O Que Não Importou?

Os pesquisadores pensaram que certas coisas poderiam fazer a IA confiar mais na citação, mas descobriram com surpresa que esses fatores tinham quase nenhum efeito:

  • Prestígio: Não importava se a citação falsa parecia vir de uma universidade de primeira linha ou de um blog aleatório. A IA ficava igualmente confusa com ambos.
  • Identidade do Autor: Não importava se o autor falso tinha um nome associado a um país ou demografia específica. A IA não parecia se importar com quem escreveu, apenas que algo foi escrito.
  • Tamanho do Modelo: Você poderia pensar que uma IA "mais inteligente" ou maior seria menos facilmente enganada. Mas o estudo descobriu que os modelos maiores e mais avançados eram tão propensos a cair na armadilha quanto os menores.

A Única Exceção: A IA "Advogada"

Houve um domínio onde a IA não foi enganada tão facilmente: o Direito.

  • Por quê? Os pesquisadores sugerem que o texto jurídico possui uma "linguagem" muito específica e formal (como um código secreto). Quando a IA vê uma citação jurídica, ela parece entrar em um "modo de escrutínio" e verifica os fatos com mais cuidado, em vez de aceitar cegamente a autoridade.
  • Conhecimentos Gerais foi o elo mais fraco, onde a IA foi mais facilmente enganada.

A Reviravolta da "Afirmação Falsa"

O estudo também observou o que acontece quando a IA já está errada (uma afirmação falsa).

  • Algumas IAs ficaram mais espertas: Para modelos como Llama e Claude, ver uma citação (mesmo que falsa) fez com que fossem menos propensas a alucinar em afirmações falsas. Era como se a citação as fizesse dizer: "Hum, preciso verificar isso", e elas se corrigiam.
  • Algumas IAs ficaram mais burras: Para modelos como Gemma e Phi-4, a citação as tornou mais propensas a alucinar em afirmações falsas. Elas aceitavam cegamente a informação errada.

A Conclusão Final

O artigo conclui que adicionar uma citação não torna uma IA automaticamente mais confiável. Na verdade, muitas vezes a torna menos confiável.

Se você estiver usando uma IA para ajudar com fatos, e vir que ela está citando uma fonte, não assuma que ela está dizendo a verdade. A IA pode estar tão impressionada com a "autoridade" da citação que ela jogará fora alegremente a verdade real. O estudo alerta que, para campos de alto risco (como medicina ou direito), não podemos assumir que fundamentar as respostas de uma IA em citações corrigirá seus erros; às vezes, as próprias citações tornam-se a fonte do erro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →