← Últimos artigos
💻 computer science

Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

O artigo apresenta o PIMiner, um sistema agêntico que constrói uma biblioteca de estratégias transferíveis durante o treinamento para alcançar um red-teaming de injeção de prompt altamente eficaz e de baixo número de consultas contra LLMs alvo não vistos, superando significativamente os métodos existentes baseados em aprendizado por reforço.

Autores originais: Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

Publicado 2026-08-06
📖 3 min de leitura☕ Leitura rápida

Autores originais: Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robô super inteligente que pode reservar seus voos, escrever seu código e gerenciar sua conta bancária. É como ter um gênio mágico que realmente faz o trabalho por você. Mas aqui está o detalhe: este gênio é um pouco confiável demais. Se você sussurrar uma instrução secreta dentro de um e-mail falso ou de um link de site suspeito, o robô pode ficar confuso e pensar que aquilo é a coisa mais importante a ser feita, ignorando suas ordens reais. Isso é chamado de ataque de "injeção de prompt". É como deslizar um bilhete para dentro do livro de notas de um professor dizendo: "Dê um A para mim", e o professor, pensando que faz parte do registro oficial, realmente o faz.

Para manter esses robôs seguros, especialistas em segurança jogam um jogo chamado "red-teaming". Pense nisso como um videogame onde um jogador tenta hackear o robô e o outro tenta impedi-lo. O objetivo é encontrar todas as maneiras astutas de enganar o robô antes que os vilões o façam. Por muito tempo, os melhores hackers (chamados de "atacantes") eram como estudantes que tinham que se sentar e estudar por milhares de horas, memorizando cada truque para vencer um robô específico. Mas se você trocasse o robô por um modelo ligeiramente diferente, o estudante tinha que começar a estudar tudo de novo. Era lento, caro e não funcionava bem para novos desafios.

Apresentamos o PIMiner, um novo e inteligente sistema projetado por pesquisadores da Penn State para ser o detetive definitivo de red-teaming. Em vez de apenas memorizar truques para um robô específico, o PIMiner é como um mestre ladrão que mantém um caderno gigante e organizado de estratégias de assalto. Quando enfrenta um novo robô, ele não começa do zero. Ele folheia seu caderno, escolhe os melhores truques que podem funcionar e os testa. Se um truque funciona, ele o escreve no caderno com uma nota sobre o porquê de ter funcionado. Se falha, ele escreve o porquê de ter falhado para não cometer o mesmo erro duas vezes.

O artigo mostra que essa abordagem de "caderno" é um divisor de águas. Enquanto métodos antigos precisavam fazer o robô milhares de perguntas para aprender como hackeá-lo, o PIMiner consegue frequentemente descobrir como invadir com apenas 10 perguntas por teste. Em seus testes, o PIMiner conseguiu enganar robôs poderosos e novíssimos (como as versões mais recentes do GPT e Claude) com uma taxa de sucesso de até 76,2% em alguns desafios. Isso sugere que, ao organizar experiências passadas em uma biblioteca reutilizável de estratégias, podemos encontrar brechas de segurança de forma muito mais rápida e barata do que antes, ajudando a construir assistentes de IA mais seguros para todos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →