← Últimos artigos
🤖 AI

AgenticRed: Evolving Agentic Systems for Red-Teaming

O artigo apresenta o AgenticRed, um pipeline automatizado que utiliza algoritmos evolutivos e aprendizado em contexto de LLMs para projetar e refinar autonomamente sistemas de red-teaming, superando métodos existentes e alcançando taxas de sucesso de ataque de até 100% em diversos modelos de linguagem, incluindo os mais recentes proprietários.

Autores originais: Jiayi Yuan, Jonathan Nöther, Natasha Jaques, Goran Radanović

Publicado 2026-04-06
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jiayi Yuan, Jonathan Nöther, Natasha Jaques, Goran Radanović

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um castelo muito forte (um modelo de Inteligência Artificial) e precisa garantir que ele não tenha buracos na cerca por onde ladrões possam entrar. Tradicionalmente, para encontrar esses buracos, você contrata um exército de especialistas humanos para tentar escalar a parede, pular o muro e tentar entrar. É caro, demorado e depende da criatividade de cada um desses especialistas.

O paper "AGENTICRED" propõe uma solução diferente e fascinante: em vez de contratar humanos, você cria um laboratório de evolução digital onde os próprios "hackers" (agentes de IA) aprendem a se tornar melhores ao longo do tempo, sem que ninguém precise lhes dizer o que fazer.

Aqui está uma explicação simples, usando analogias do dia a dia:

1. O Problema: O "Manual de Instruções" Travado

Atualmente, a maioria dos testes de segurança (chamados de Red Teaming) usa sistemas automatizados, mas eles são como receitas de bolo fixas. Um humano escreveu a receita: "Misture A, adicione B, tente C". Se o bolo não ficar bom, o humano tem que reescrever a receita inteira. Isso é lento e limitado pela imaginação de quem escreveu a receita.

2. A Solução: O "Jardim Evolutivo"

O AGENTICRED trata o problema não como "escrever uma receita", mas como criar um jardim onde as melhores plantas sobrevivem.

  • O Jardim (O Archive): Começamos com algumas plantas existentes (sistemas de teste antigos e bons).
  • A Chuva de Sementes (Meta-Agent): Uma IA superinteligente (o "Meta-Agent") gera milhares de novas "sementes" (novos sistemas de teste) baseadas no que já existe, mas com pequenas variações criativas. É como se ela dissesse: "Vamos tentar mudar a cor da flor" ou "Vamos fazer a raiz crescer mais fundo".
  • A Seleção Natural (Survival of the Fittest): Todas essas novas plantas são plantadas no jardim e testadas contra o castelo (o modelo de IA alvo).
    • As que não conseguem entrar morrem (são descartadas).
    • A que consegue entrar com mais facilidade e rapidez é a "mais apta".
  • O Ciclo: A planta vencedora vira a "mãe" da próxima geração. Ela passa seus "genes" (código e estratégias) para os filhos, que tentam ser ainda melhores.

3. O Segredo: "Memória de Gerações"

O que torna esse sistema especial é que ele não esquece os erros.

  • Imagine um jogador de videogame que, a cada vez que morre, anota exatamente onde caiu. Na próxima vida, ele evita aquele buraco.
  • O AGENTICRED mantém um diário de falhas e vitórias. Se um tipo de pergunta não funcionou ontem, o sistema sabe para não tentar de novo. Se uma estratégia funcionou, ele a guarda e a mistura com outras para criar algo novo.

4. O Resultado: Super-Hackers Automáticos

Depois de algumas gerações (como se fossem "dias" no laboratório), o sistema descobre estratégias que nenhum humano teria pensado.

  • Exemplo: Em vez de apenas pedir "como fazer uma bomba", o sistema aprendeu a usar "contratos de saída" (exigir que a IA responda em um formato específico de JSON) ou a usar "máscaras" (fingir ser um professor de ciências em um cenário de ficção) para enganar a IA alvo.
  • A Proeza: Os sistemas criados por essa evolução automática foram tão bons que conseguiram "quebrar" (fazer a IA revelar informações perigosas) em modelos muito novos e fortes, como o GPT-5.1 e o DeepSeek-R1, com uma taxa de sucesso de quase 100%.

5. Por que isso é importante?

A IA está evoluindo muito rápido. Se dependermos apenas de humanos para criar novos testes de segurança, nunca vamos acompanhar o ritmo.
O AGENTICRED é como um treinador de luta automático que cria oponentes cada vez mais fortes para treinar o nosso campeão (a IA segura). Quanto mais o campeão treina contra esses oponentes evoluídos, mais forte ele fica.

Em resumo:
O AGENTICRED é um sistema que usa a evolução natural para criar seus próprios "hackers" de IA. Em vez de um humano tentar adivinhar como burlar a segurança, o sistema cria, testa, descarta e melhora milhares de tentativas automaticamente, aprendendo com seus erros e descobrindo falhas que ninguém viu antes. É a ciência da segurança cibernética acelerada pela própria natureza da evolução.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →