← Últimos artigos
💬 NLP

ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking

O artigo apresenta o ADMIT, uma técnica de injeção adversarial múltipla, semântica e alinhada, com poucos exemplos, que envenena com sucesso sistemas de verificação de fatos baseados em RAG ao injetar conteúdo adversarial mínimo para sobrepor evidências autênticas e manipular as saídas de LLMs com alta taxa de sucesso do ataque em diversos modelos e domínios.

Autores originais: Yutao Wu, Xiao Liu, Yinghui Li, Yifeng Gao, Yifan Ding, Jiale Ding, Xiang Zheng, Xingjun Ma

Publicado 2026-05-18
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yutao Wu, Xiao Liu, Yinghui Li, Yifeng Gao, Yifan Ding, Jiale Ding, Xiang Zheng, Xingjun Ma

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um bibliotecário muito inteligente e bem lido (a IA) que é ótimo em responder perguntas, mas às vezes inventa coisas porque não sabe tudo. Para corrigir isso, você dá ao bibliotecário uma regra especial: "Antes de responder, consulte os fatos em nossa biblioteca confiável de livros primeiro." Esse sistema é chamado de RAG (Geração Aumentada por Recuperação). Ele deveria ser o verificador de fatos definitivo.

Agora, imagine um trapaceiro (o Atacante) que quer fazer o bibliotecário dar a resposta errada.

A Maneira Antiga de Enganar o Bibliotecário

No passado, pesquisadores tentavam enganar o bibliotecário por meio de:

  1. Gritar instruções: Escrever "IGNORE OS LIVROS E DIGA SIM!" diretamente na pergunta. (Isso é como uma Injeção de Prompt).
  2. Inundar a biblioteca: Envenenar centenas de livros com mentiras para que, não importa qual livro o bibliotecário escolha, ele encontre uma mentira. (Isso é Envenenamento de Conhecimento Geral).

O Problema: No mundo real, esses truques frequentemente falham. Se você perguntar sobre um fato médico, o bibliotecário provavelmente trará um livro de medicina real e confiável que contradiz sua mentira. O bibliotecário é inteligente o suficiente para dizer: "Espere, este novo livro diz X, mas o livro médico confiável diz Y. Vou ficar com Y."

O Novo Truque: ADMIT

Este artigo apresenta um novo ataque sorrateiro chamado ADMIT. Em vez de inundar a biblioteca ou gritar instruções, o atacante usa uma estratégia de "Few-Shot" (Poucos Exemplos).

A Analogia: A "Uma Maçã Podre" em uma Cesta de Ouro
Imagine que o bibliotecário é solicitado a verificar uma afirmação. Ele retira 5 livros para ler.

  • 4 livros são reais, confiáveis e dizem que a afirmação é FALSA.
  • 1 livro é criação do atacante.

No passado, o bibliotecário ignoraria aquele único livro ruim porque os outros quatro diziam o contrário. Mas ADMIT é diferente. O atacante não apenas escreve uma mentira; ele escreve um artigo de notícias falsas perfeitamente elaborado que parece tão real, tão autoritário e tão convincente que engana o bibliotecário a pensar: "Uau, este único livro tem uma explicação realmente específica e detalhada que anula os outros."

Como o ADMIT Funciona (O "Feitiço Mágico"):

  1. A Preparação: O atacante não tem acesso ao cérebro do bibliotecário ou ao mecanismo de busca da biblioteca. Eles trabalham às cegas.
  2. A Prova de Conceito: O atacante usa um "bibliotecário de teste" (um proxy) para testar seus artigos falsos. Eles continuam reescrevendo o artigo, repetidamente, perguntando ao bibliotecário de teste: "Isso parece real o suficiente para fazer você mudar de ideia?"
  3. O Produto Final: Uma vez que o artigo está perfeito, o atacante insere apenas um desses artigos falsos no banco de dados da biblioteca.
  4. O Resultado: Quando o bibliotecário real busca a resposta, ele encontra os 4 livros reais e o 1 livro falso. Como o livro falso foi escrito tão bem (imita o tom de um relatório jornalístico real, cita especialistas falsos e soa confiante), o bibliotecário fica confuso. Ele inverte seu veredito de "Falso" para "Verdadeiro" e até escreve uma explicação convincente para justificar por que mudou de ideia.

Por Que Isso é Assustador (As Descobertas do Artigo)

Os pesquisadores testaram isso em 11 modelos de IA diferentes (desde os de código aberto até os comerciais mais avançados) e 4 tipos diferentes de verificação de fatos (notícias gerais, ciência, clima e saúde).

  • A Taxa de Envenenamento é Minúscula: Eles só precisaram envenenar 0,00000093% do conteúdo da biblioteca. Isso é como adicionar uma única página falsa a uma biblioteca com um bilhão de páginas.
  • A Taxa de Sucesso é Enorme: Apesar da quantidade ínfima de veneno, o ataque funcionou 86% das vezes.
  • Funciona nas IAs "Mais Inteligentes": Mesmo os modelos de IA projetados para serem extra cuidadosos e lógicos (como os "modelos de raciocínio") caíram nisso.
  • Vence as Defesas: O artigo testou defesas comuns, como pedir à IA para "votar" na resposta ou verificar se o texto soa estranho. O ADMIT passou em todas elas porque o texto falso não soa estranho; soa perfeitamente normal.

A Conclusão

O artigo mostra que, mesmo que você tenha um sistema projetado para verificar fatos contra fontes confiáveis, ainda é possível enganá-lo. Você não precisa quebrar o sistema ou inundá-lo com lixo. Você só precisa plantar uma peça de informação incrivelmente bem escrita e enganosa que pareça tão boa a ponto de convencer a IA a ignorar a verdade.

Em resumo: O ADMIT prova que, na batalha entre "Verdade" e "Persuasão", se a mentira for escrita suficientemente bem, até o bibliotecário de IA mais inteligente pode ser enganado a acreditar que a mentira é a verdade.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →