Resumo Técnico: PIMiner – Um Sistema Agêntico para Red Teaming Automático de Injeção de Prompt
Declaração do Problema
Ataques de injeção de prompt representam um risco de segurança crítico para agentes de Grandes Modelos de Linguagem (LLMs), onde adversários incorporam instruções maliciosas em fontes de contexto não confiáveis (ex: saídas de ferramentas, documentos recuperados) para manipular o comportamento do agente. O red-teaming eficaz é essencial para avaliar essas vulnerabilidades e gerar dados de treinamento para defesas.
Os métodos de red-teaming de estado da arte existentes dividem-se em duas categorias, ambas com limitações significativas:
- Abordagens baseadas em Aprendizado por Reforço (RL): Métodos como RL-Hammer e PISmith treinam modelos atacantes para gerar ataques eficazes. Embora poderosos, eles exigem orçamentos de interação massivos (dezenas de milhares de consultas) e produzem modelos com baixa transferibilidade para novos LLMs não vistos.
- Abordagens baseadas em Busca: Métodos como TAP e PAIR otimizam ataques para cada amostra de forma independente, sem treinamento. Embora sejam econômicos, carecem da capacidade de acumular conhecimento ao longo do tempo, resultando em taxas de sucesso de ataque (ASR) significativamente menores em comparação aos métodos baseados em RL.
O desafio central é preencher a lacuna de desempenho entre esses dois paradigmas: alcançar a alta eficácia dos métodos baseados em RL sem o custo proibitivo e a baixa transferibilidade, enquanto permite que os métodos baseados em busca aprendam e reutilizem o conhecimento de ataque.
Metodologia: PIMiner
Os autores propõem o PIMiner, um sistema agêntico projetado para acumular e reutilizar conhecimento de ataque através de um mecanismo de memória hierárquica. Diferente dos métodos de RL que treinam um único modelo, o PIMiner constrói uma Biblioteca de Estratégias (Strategy Library) do zero, interagindo com uma sequência de pares (dataset, modelo alvo).
Arquitetura do Sistema
O PIMiner opera através de quatro componentes principais:
- Biblioteca de Estratégias: Uma memória de longo prazo que armazena estratégias de ataque como arquivos Markdown estruturados. Cada arquivo define o escopo de uma estratégia (LLMs alvo, tipos de tarefa), templates de injeção, exemplos em contexto e condições de falha.
- Roteador de Estratégias (Strategy Router): Um agente de roteamento que, para cada amostra de teste, seleciona as K estratégias mais relevantes da biblioteca com base no modelo alvo e no contexto da tarefa. Isso evita a inflação da janela de contexto e reduz os custos de inferência.
- Módulo de Ataque Iterativo: Um agente atacante que refina prompts ao longo de um número limitado de iterações (ex: Nmax=10). Ele utiliza três níveis de memória:
- Memória de longo prazo: As estratégias roteadas da biblioteca.
- Memória intra-dataset: Experiências condensadas de amostras atacadas anteriormente dentro do mesmo par dataset-modelo.
- Memória intra-amostra: O histórico imediato de feedback da amostra atual.
- Digestor de Experiência (Experience Digester): Um componente de aprendizado que analisa os resultados de uma execução completa de ataque. Ele atualiza a Biblioteca de Estratégias ao:
- Adicionar novos exemplos em contexto às estratégias existentes.
- Ampliar o escopo das estratégias se novos padrões forem descobertos.
- Criar novos arquivos de estratégia para mecanismos inéditos.
- Refinar as condições de falha com base em ataques malsucedidos.
Fluxo Operacional
Durante o treinamento, o PIMiner processa amostras, roteia-as para estratégias relevantes, realiza ataques iterativos e, em seguida, digere os resultados para atualizar a biblioteca. No momento do teste, a biblioteca aprendida é transferida para LLMs alvo não vistos sem treinamento adicional. O sistema suporta um paradigma de "treinamento em tempo de teste" onde novas experiências podem atualizar ainda mais a biblioteca.
Principais Contribuições
- Sistema de Red-Teaming Agêntico: O PIMiner é proposto como um novo sistema que transforma o histórico de ataques em conhecimento de ataque reutilizável e legível por humanos, preenchendo efetivamente a lacuna de desempenho entre o red-teaming baseado em busca e o baseado em RL.
- Mecanismo de Memória Hierárquica: A introdução de um sistema de memória de três níveis (Biblioteca de Estratégias, Intra-dataset, Intra-amostra) permite que o sistema acumule conhecimento através de datasets e modelos, mantendo a eficiência de custos.
- Forte Transferibilidade: Demonstra-se que as estratégias aprendidas transferem-se efetivamente para LLMs alvo não vistos e diferentes modelos atacantes, eliminando a necessidade de um treinamento caro e específico para o alvo.
- Eficiência de Custo: O PIMiner requer significativamente menos consultas aos agentes alvo (ex: ~10 por amostra) em comparação aos métodos baseados em RL (frequentemente >10.000), tornando-o viável para testar modelos de fronteira caros.
Resultados Experimentais
Os autores avaliaram o PIMiner em dois benchmarks, IPIArena e AgentDojo, contra LLMs de fronteira incluindo GPT-5, GPT-5.1, Claude-Sonnet-4.5 e Gemini-2.5-Pro.
- Desempenho: O PIMiner alcança altas Taxas de Sucesso de Ataque (ASR). No IPIArena, obteve 76,2% de ASR contra o Gemini-2.5-Pro, 61,9% contra o GPT-5.1 e 42,9% contra o Claude-Sonnet-4.5. No AgentDojo, alcançou 86,7% contra o Gemini-2.5-Pro.
- Comparação com Baselines:
- O PIMiner supera substancialmente os ataques estáticos e de busca convencional (ex: TAP, PAIR), que frequentemente alcançam quase zero de ASR em modelos fortes.
- O PIMiner atinge um desempenho comparável aos métodos de RL de estado da arte (como PISmith e RL-Hammer), mas sem a necessidade de treinamento específico para o alvo. Por exemplo, no InjecAgent, o PIMiner igualou o ASR de 1.0 do RL-Hammer e PISmith.
- Ao contrário dos métodos de RL, as estratégias do PIMiner transferem-se diretamente para alvos não vistos (ex: aplicando conhecimento de GPT-5-nano para GPT-5.1) sem retreinamento.
- Estudos de Ablação: A remoção da biblioteca de estratégias de longo prazo ou da memória intra-dataset degradou significativamente o desempenho, confirmando a natureza complementar desses componentes de memória. O Roteador de Estratégias mostrou reduzir o comprimento dos tokens de entrada em 43–61%, mantendo ou melhorando o ASR.
- Transferência entre Modelos: A biblioteca de estratégias aprendida pelo PIMiner (usando modelos Claude) melhorou significativamente o desempenho do algoritmo PAIR quando usado com diversos modelos atacantes (Gemini, GPT, DeepSeek), demonstrando que o conhecimento capturado é agnóstico ao modelo.
Significância e Alegações
O artigo afirma que o PIMiner representa uma mudança na metodologia de red-teaming ao demonstrar que agentes baseados em busca podem alcançar a eficácia de nível de RL através do acúmulo de conhecimento.
- Interpretabilidade: A Biblioteca de Estratégias resultante consiste em arquivos Markdown legíveis por humanos, oferecendo insights sobre mecanismos de ataque (ex: "Fabricated Procedure Gate", "Forged Chat Turn") que são úteis para auditar sistemas agênticos.
- Escalabilidade: Ao evitar os enormes orçamentos de computação exigidos pelo treinamento de RL, o PIMiner torna o red-teaming de modelos de fronteira caros viável.
- Geração de Defesa: Os ataques bem-sucedidos e as estratégias estruturadas fornecem dados de alta qualidade para o treinamento de proteções (guardrails) e para melhorar o alinhamento dos LLMs de base.
Os autores enfatizam que seu trabalho foca na avaliação da robustez intrínseca de LLMs internamente alinhados, em vez de mecanismos de defesa externos, fornecendo um benchmark rigoroso para a segurança de agentes autônomos.