← Últimos artigos
🤖 AI

Addressing Corpus Knowledge Poisoning Attacks on RAG Using Sparse Attention

Este artigo apresenta o Sparse Document Attention RAG (SDAG), um novo mecanismo de defesa que utiliza atenção de esparsidade em blocos para evitar interações prejudiciais entre documentos em sistemas de Geração Aumentada por Recuperação, mitigando significativamente ataques de envenenamento de conhecimento de corpus e superando as defesas de estado da arte existentes.

Autores originais: Sagie Dekel, Moshe Tennenholtz, Oren Kurland

Publicado 2026-08-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Sagie Dekel, Moshe Tennenholtz, Oren Kurland

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No cenário moderno da inteligência artificial, os grandes modelos de linguagem atuam como vastos repositórios do conhecimento humano, capazes de responder perguntas e gerar textos com uma fluência surpreendente. No entanto, esses modelos possuem uma limitação: são treinados em dados que param em um determinado ponto no tempo, o que significa que não podem conhecer eventos recentes ou fatos específicos e de nicho sem ajuda. Para resolver isso, pesquisadores desenvolveram um sistema chamado Geração Aumentada por Recuperação (Retrieval-Augmented Generation). Nesta configuração, quando um usuário faz uma pergunta, o sistema primeiro pesquisa em uma biblioteca massiva de documentos para encontrar informações relevantes. Em seguida, ele alimenta tanto a pergunta quanto esses documentos recuperados no modelo de linguagem, que os utiliza como um guia para elaborar uma resposta precisa. Este método mantém o conhecimento da IA atualizado e reduz a chance de ela inventar coisas, um problema conhecido como alucinação. Contudo, essa própria dependência de documentos externos cria uma nova vulnerabilidade. Como o sistema confia nos documentos que encontra, um ator malicioso poderia secretamente injetar informações falsas na biblioteca. Se o sistema recuperar esses documentos envenenados, poderá ser enganado para ignorar a verdade e entregar uma mentira em vez disso.

Pesquisadores do Technion, em Israel, identificaram uma fraqueza específica na forma como esses sistemas processam informações que os torna suscetíveis a tal decepção. Nos modelos de linguagem padrão, o mecanismo que permite à IA focar em diferentes partes de um texto é projetado para permitir que cada palavra olhe de volta para todas as palavras anteriores em um fluxo contínuo. Isso funciona bem para escrever uma história ou resumir um único artigo, onde o contexto flui naturalmente de uma frase para a próxima. No entanto, em um sistema de recuperação, a entrada é frequentemente uma coleção de documentos separados e distintos colados uns aos outros. Os pesquisadores argumentam que o método padrão de processamento desses documentos permite que palavras de um documento interajam com palavras de outro de uma maneira que pode ser prejudicial. Quando um documento malicioso está presente, seu conteúdo enganoso pode influenciar a compreensão da IA sobre os documentos verdadeiros, envenenando efetivamente toda a resposta.

Para enfrentar isso, a equipe introduziu uma nova estratégia de defesa chamada Atenção de Documentos Esparsa (Sparse Document Attention). Em vez de permitir que a IA deixe cada palavra do conjunto recuperado olhar para todas as outras palavras, este método cria uma fronteira estrita entre os documentos. Ele força o sistema a tratar cada documento recuperado como uma ilha isolada. Dentro de um único documento, as palavras ainda podem referenciar umas às outras para manter o contexto, mas elas são completamente bloqueadas de olhar para ou serem influenciadas por palavras em qualquer um dos outros documentos recuperados. Esta mudança é aplicada apenas quando o sistema está gerando uma resposta, não exigindo o retreinamento do modelo de IA subjacente nem adições complexas ao pipeline de software. É um ajuste simples nas regras de atenção que evita a conversa cruzada prejudicial entre um mentiroso e um portador da verdade.

Os pesquisadores testaram esta abordagem rigorosamente através de uma variedade de cenários, utilizando diferentes conjuntos de dados de perguntas e respostas e múltiplos tipos de modelos de linguagem. Eles simularam ataques onde um adversário injetou documentos enganosos projetados para direcionar a IA para uma resposta incorreta específica. Nestes testes, o sistema padrão, que permitia que os documentos influenciassem uns aos outros, frequentemente caía na armadilha, muitas vezes produzindo a resposta falsa desejada pelo atacante. Em contraste, o sistema utilizando o novo método de atenção esparsa provou ser muito mais resiliente. Ele conseguiu ignorar os documentos envenenados na grande maioria dos casos, mantendo a precisão de suas respostas e reduzindo drasticamente a taxa de sucesso dos ataques. A melhoria foi tão significativa que o novo método superou estratégias de defesa existentes, mais complexas, que haviam sido desenvolvidas para detectar esses ataques.

O estudo também explorou como a posição de um documento falso afeta o resultado. Eles descobriram que, quando um documento enganoso é muito semelhante em conteúdo aos documentos verdadeiros, é mais difícil para o sistema resistir à sua influência. No entanto, o novo método permaneceu eficaz mesmo nestas situações difíceis. Além disso, os pesquisadores descobriram que esta defesa funciona bem mesmo quando a IA é solicitada a resolver problemas complexos que exigem a combinação de informações de múltiplos documentos, como questões de raciocínio de múltiplos passos. Embora a configuração inicial tenha mostrado uma leve queda de desempenho em comparação com o método padrão, os pesquisadores descobriram que um breve período de ajuste fino (fine-tuning) do modelo para as novas regras recuperou completamente essa perda, resultando em um sistema que era tanto robusto contra ataques quanto altamente preciso.

As descobertas sugerem que a maneira como uma IA olha para seu material de origem é tão importante quanto o próprio material. Ao simplesmente impedir que diferentes documentos conversem entre si, o sistema torna-se muito mais difícil de ser enganado. Esta abordagem oferece uma maneira prática e eficiente de proteger sistemas de IA baseados em recuperação, garantindo que eles dependam da verdade em vez de serem influenciados pela mentira mais persuasiva na sala. O trabalho estabelece um novo padrão para proteger esses sistemas, mostrando que uma mudança fundamental na forma como o modelo processa a informação pode ser mais eficaz do que adicionar camadas de ferramentas de detecção complexas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →