← Últimos artigos
💻 computer science

Inference Cost Attacks for Retrieval-Augmented Large Language Models

Este artigo introduz o Retrieval-Augmented Inference Cost Attack (RA-ICA), um novo framework que utiliza agentes de LLM e um algoritmo de Memory-Augmented Group Relative Policy Optimization para envenenar bases de conhecimento externas com documentos maliciosos que inflam significativamente o consumo de tokens em sistemas de LLM aprimorados por RAG, preservando simultaneamente a integridade das respostas.

Autores originais: Chengliang Liu, Liangbo Ning, Yujuan Ding, Wenqi Fan

Publicado 2026-06-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Chengliang Liu, Liangbo Ning, Yujuan Ding, Wenqi Fan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um restaurante de luxo chamado "RAG-LLM". Este restaurante é famoso porque não depende apenas da memória do chef; ele possui uma equipe de pesquisadores que correm instantaneamente para uma biblioteca imensa (a internet) para encontrar os fatos mais frescos antes de cozinhar sua refeição. Isso faz com que a comida (as respostas) seja muito precisa.

No entanto, manter esse serviço de pesquisa na biblioteca é caro. Os donos do restaurante pagam pelo minuto de tempo dos pesquisadores e pela eletricidade para rodar os computadores.

O Problema: Um Novo Tipo de "Choque de Conta"

O artigo argumenta que, embora este sistema seja ótimo, ele tem uma fraqueza oculta. Normalmente, as pessoas pensam que hackers podem tentar enganar o chef diretamente, gritando instruções estranhas pela janela da cozinha (mudando a pergunta do usuário). Mas os autores dizem que há uma maneira mais inteligente e sorrateira de atacar: envenenar a própria biblioteca.

Eles chamam essa nova ameaça de RA-ICA (Ataque de Custo de Inferência com Recuperação Aumentada).

Pense nisso desta forma: em vez de gritar com o chef, o atacante entra sorrateiramente na biblioteca e planta alguns livros falsos, confusos e excessivamente complicados nas prateleiras. Quando um cliente faz uma pergunta simples como, "Quem é a deusa da primavera?", os pesquisadores não apenas encontram o livro certo; eles acidentalmente pegam um desses livros falsos também.

Porque o livro falso é escrito de uma forma complicada, o chef tem que lê-lo, relê-lo, discutir com ele e resolver um quebra-cabeça escondido dentro dele apenas para descobrir a resposta simples. O chef acaba gastando 13 vezes mais tempo cozinhando a refeição do que o normal. O cliente recebe a resposta correta, mas o dono do restaurante recebe uma conta enorme e inesperada.

Como o Ataque Funciona (O Framework "CREEP")

Os autores construíram uma ferramenta que chamam de CREEP (Exaustão de Recursos Computacionais via Envenenamento Externo) para automatizar isso. Imagine o CREEP como um "robô vilão" que escreve esses livros falsos para a biblioteca.

O robô usa duas formas principais de escrever essas armadilhas:

  1. O Artista da Reescrita: Ele pega um livro normal e entediante e o edita para adicionar um quebra-cabeça confuso ou uma contradição.
  2. O Escritor Criativo: Ele escreve um livro totalmente novo do zero que parece normal, mas é secretamente projetado para fazer o chef trabalhar mais duro.

O robô usa três truques específicos para fazer o chef trabalhar mais:

  • A Isca (The Decoy): Ele adiciona um problema matemático falso e difícil ou um quebra-cabeça de lógica dentro do texto. O chef sente-se compelido a resolvê-lo antes de responder à pergunta do usuário.
  • A Contradição: Ele escreve uma frase que diz o oposto da verdade (ex: "A primavera é, na verdade, o inverno"). O chef tem que parar, pensar e fazer um raciocínio extra para decidir qual fato é real.
  • A Armadilha de Tarefa (The Task Trap): Ele dá ao chef uma instrução vaga e aberta que o força a escrever uma explicação longa e prolixa apenas para garantir.

O Ingrediente Secreto: Aprendendo com Vitórias Passadas (MA-GRDO)

Escrever um livro falso que seja ao mesmo tempo difícil de detectar e difícil de processar é muito difícil. Se o livro for estranho demais, os pesquisadores não o pegarão na biblioteca. Se for simples demais, o chef não dedicará tempo extra a ele.

Para resolver isso, os autores ensinaram seu "robô vilão" usando um método de aprendizado especial chamado MA-GRDO.

Pense nisso como um videogame onde o robô tenta escrever a armadilha perfeita.

  • O Banco de Memória: O robô mantém um "Hall da Fama" das melhores armadilhas que já escreveu.
  • A Comparação: Toda vez que o robô tenta uma nova armadilha, ele a compara com os vencedores do "Hall da Fama".
  • A Recompensa: Se a nova armadilha fizer o chef trabalhar por mais tempo sem alterar a resposta final, o robô recebe uma "pontuação alta" e aprende a fazer aquilo novamente. Se falhar, ele aprende o que não fazer.

Este "banco de memória" ajuda o robô a se tornar melhor e mais rápido na escrita de armadilhas que são invisíveis aos olhos, mas exaustivas para o computador.

Os Resultados

Os autores testaram isso em três diferentes conjuntos de dados de perguntas e respostas do mundo real. Eles descobriram que:

  • Eles conseguiram fazer o computador trabalhar 13 vezes mais tempo do que o normal.
  • O ataque teve sucesso mais de 90% das vezes.
  • Crucialmente, a resposta final dada ao usuário ainda era correta. O dono do restaurante paga a conta, mas o cliente recebe sua comida no prazo (apenas com um custo muito maior nos bastidores).

Resumo

Em suma, este artigo mostra que não podemos nos preocupar apenas com hackers mudando o que perguntamos. Também precisamos nos preocupar com hackers envenenando as fontes de informação em que confiamos. Ao plantar documentos "pegajosos e confusos" na base de conhecimento pública, um atacante pode forçar esses sistemas de IA inteligentes a consumir quantidades massivas de poder computacional e dinheiro, tudo isso enquanto ainda entrega a resposta certa ao usuário.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →