← Últimos artigos
🔬 physics

LLM hallucinations in the wild: Large-scale evidence from non-existent citations

Este estudo fornece evidências em larga escala de que a adoção generalizada de modelos de linguagem de grande escala levou a um aumento acentuado de citações inexistentes em milhões de artigos científicos, ameaçando a confiabilidade e a equidade da produção de conhecimento ao superar as salvaguardas editoriais atuais.

Autores originais: Zhenyue Zhao, Yihe Wang, Toby Stuart, Mathijs De Vaan, Paul Ginsparg, Yian Yin

Publicado 2026-05-11
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhenyue Zhao, Yihe Wang, Toby Stuart, Mathijs De Vaan, Paul Ginsparg, Yian Yin

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: O Problema do "Livro Falso"

Imagine que você está escrevendo um trabalho escolar. Você precisa listar os livros que leu na sua bibliografia. Se você inventar um título de livro que não existe, seu professor pode facilmente verificar e dizer: "Este livro não é real".

Este artigo é uma investigação massiva sobre o que acontece quando a IA (Modelos de Linguagem de Grande Porte) começa a escrever essas bibliografias para cientistas. Os pesquisadores descobriram que a IA está inventando cada vez mais títulos de livros falsos (citações) e inserindo-os em artigos científicos reais. Embora os cientistas sempre tenham cometido pequenos erros, o estudo mostra que, desde que a IA se tornou popular, o número desses "livros falsos" explodiu.

Como Eles Pegaram a IA

Os pesquisadores trataram o mundo científico como uma biblioteca gigante. Eles analisaram 111 milhões de referências (citações) em quatro grandes bibliotecas digitais (arXiv, bioRxiv, SSRN e PubMed Central).

  • O Método: Eles criaram um "mecanismo de busca" digital para verificar cada citação individualmente. Se o mecanismo de busca não conseguisse encontrar o livro ou artigo no mundo real, eles o marcavam como "não correspondido".
  • O Filtro: Eles sabiam que algumas citações eram apenas desorganizadas (formatação ruim ou livros obscuros). Então, usaram uma IA inteligente para limpar as desorganizadas. Se uma citação ainda não pudesse ser encontrada após toda a limpeza, eles a contavam como uma alucinação (uma referência falsa).
  • A Linha de Base: Eles compararam o número de citações falsas antes da IA se tornar popular (2022) com o número depois. Eles encontraram um aumento agudo e assustador começando em 2024.

O Resultado: Apenas em 2025, eles estimam que haja 146.932 citações falsas apenas nessas quatro bibliotecas. E isso provavelmente é apenas a ponta do iceberg.

Quem Está Fazendo Isso?

O artigo descobriu que o problema do "livro falso" não vem de algumas poucas maçãs podres; está espalhado por toda parte, mas está concentrado em grupos específicos:

  1. Os "Novatos": Os cientistas mais propensos a incluir citações falsas são pesquisadores no início da carreira (estudantes e novos professores) que ainda não publicaram muitos artigos.
    • Analogia: Pense nisso como um motorista novo que ainda não aprendeu as regras da estrada. Eles estão usando a IA para ajudá-los a dirigir (escrever artigos), mas estão acidentalmente dirigindo para bairros falsos porque não conhecem o mapa o suficiente para identificar os erros.
  2. Os "Motoristas Solitários": Artigos escritos por autores únicos ou pequenas equipes têm taxas muito mais altas de citações falsas do que grandes equipes.
    • Analogia: Se você escreve uma história sozinho, pode perder um erro de digitação. Se você escreve com uma equipe de editores, alguém mais vai pegá-lo. Grandes equipes atuam como uma rede de segurança; pequenas equipes muitas vezes não têm essa rede.
  3. Os Campos "Intensivos em IA": Campos onde as pessoas usam mais a IA (como Ciência da Computação e Ciências Sociais) têm as maiores taxas de citações falsas.

Quem Recebe o Crédito?

Aqui está a parte injusta. Quando a IA inventa um artigo falso, ela não inventa apenas um nome aleatório. Ela tende a inventar artigos escritos por cientistas famosos, bem-sucedidos e do sexo masculino.

  • Analogia: Imagine um aluno inventando uma citação falsa para um trabalho de história. Em vez de inventar um nome aleatório, o aluno acidentalmente (ou subconscientemente) inventa uma citação do presidente mais famoso da história.
  • A Consequência: Isso significa que a IA está acidentalmente reforçando a desigualdade. Ela dá crédito extra a pessoas que já são famosas e do sexo masculino, enquanto ignora estudiosos menos famosos ou do sexo feminino. Mesmo que o artigo seja falso, o nome da pessoa famosa é adicionado à lista de "pessoas que escreveram sobre isso".

Por Que os Editores Não Pegam?

Você pode pensar: "Os periódicos não verificam esses artigos antes de publicá-los?" O estudo diz não, não realmente.

  • O Problema dos Pré-prints: Muitos cientistas publicam seu trabalho online antes de ser oficialmente publicado (como um rascunho em um blog). O estudo descobriu que 78,8% das citações falsas passam pelos moderadores online iniciais.
  • A Lacuna da Revisão por Pares: Mesmo quando esses artigos vão para periódicos formais para revisão, 85% das citações falsas sobrevivem ao processo e são publicadas.
  • Analogia: É como um guarda de segurança em um show que verifica ingressos. O guarda pega as pessoas com ingressos falsos realmente óbvios, mas as pessoas com ingressos falsos "bem feitos" (que a IA torna muito convincentes) passam direto.

O Efeito "Bola de Neve"

A parte mais perigosa disso é como as citações falsas se espalham.

  1. A Biblioteca Fica Contaminada: Uma vez que um artigo falso é publicado, ele é adicionado ao Google Scholar e a outros bancos de dados.
  2. O Ciclo: Pesquisadores futuros (e IAs futuras) buscarão nesses bancos de dados, verão o artigo falso e pensarão: "Ah, esta é uma fonte real!". Eles então o citarão em seu próprio trabalho.
  3. O Resultado: O artigo falso se torna "real" porque todos o tratam como real. A IA está aprendendo com seus próprios erros, criando um ciclo onde a biblioteca se enche de mais e mais ficção.

A Conclusão

Este artigo argumenta que estamos em uma crise de confiança. A ciência depende da ideia de que, se você cita um artigo, esse artigo realmente existe e diz o que você afirma que ele diz.

O estudo mostra que a IA está quebrando essa confiança. Mesmo na ciência — o campo com as regras mais estritas e as melhores ferramentas para verificar fatos — a IA está com sucesso infiltrando milhares de referências falsas todos os anos. Se isso está acontecendo na ciência (onde é mais fácil pegar), o artigo sugere que provavelmente está acontecendo ainda pior em outros campos como direito, medicina e relatórios governamentais, onde há menos ferramentas para verificar os fatos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →