← Últimos artigos
🤖 AI

To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack

Este documento de posicionamento argumenta que, para combater os inevitáveis ataques cibernéticos impulsionados por IA, os defensores devem mudar fundamentalmente sua estratégia ao desenvolver e implantar de forma responsável suas próprias capacidades ofensivas de IA dentro de ambientes controlados e governados para dominar as ameaças antes dos adversários.

Autores originais: Terry Yue Zhuo, Yangruibo Ding, Wenbo Guo, Ruijie Meng

Publicado 2026-02-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Terry Yue Zhuo, Yangruibo Ding, Wenbo Guo, Ruijie Meng

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: As Velhas Regras Não Funcionam Mais

Durante a última década, a cibersegurança funcionou como um jogo de "Whac-A-Mole" (Acerte a Toupeira).

  • O Jeito Antigo: Os hackers precisavam ser humanos altamente qualificados. Construir um ataque complexo era como construir uma casa personalizada; levava meses de trabalho duro e profunda expertise. Como era tão caro e lento, os hackers atacavam apenas as "casas grandes" (grandes empresas) ou usavam ferramentas genéricas simples para bater em milhares de portas esperando que uma estivesse aberta. Os defensores assumiam que os hackers não podiam se dar ao luxo de bater em todas as portas.
  • A Nova Ameaça: Agentes de IA estão mudando o jogo. Imagine um hacker que não é uma pessoa, mas um enxame de milhares de pequenos robôs incansáveis. Esses robôs não precisam ser especialistas. Eles podem bater em milhões de portas em um segundo. Mesmo que falhem 99% das vezes, eles só precisam ter sucesso 1% das vezes para obter lucro. Eles podem atacar as "casas pequenas" (sistemas de nicho) que os humanos costumavam ignorar por não valerem o esforço.

O artigo argumenta que os defensores estão atualmente tentando deter esses robôs colocando placas de "Não Entre" nos próprios robôs. Mas o artigo diz que isso não funcionará porque agentes mal-intencionados podem simplesmente construir seus próprios robôs sem as placas.

Por Que as Defesas Atuais Estão Falhando

Os autores afirmam que estamos tentando deter os hackers de IA usando três métodos principais, mas todos são como tentar parar uma inundação com um peneirão:

  1. Filtragem de Dados de Treinamento (A abordagem da "Biblioteca Limpa"):

    • A Ideia: Removemos todas as instruções ruins (como "como construir uma bomba") dos livros de treinamento da IA para que ela nunca aprenda a ser má.
    • Por que Falha: Hackers mal-intencionados não precisam ler os "livros ruins". Eles podem ensinar a IA a descobrir como hackear usando lógica básica e senso comum, exatamente como um humano pode descobrir como abrir uma fechadura sem um manual. Além disso, hackers mal-intencionados podem simplesmente baixar a IA e ensiná-la por conta própria.
  2. Alinhamento de Segurança (A abordagem do "Bom Comportamento"):

    • A Ideia: Treinamos a IA para dizer "Não" quando lhe pedem para fazer algo ruim.
    • Por que Falha: Hackers mal-intencionados são astutos. Eles podem enganar a IA para que ela pense que um pedido ruim é, na verdade, um pedido bom (como pedir a um guarda para "testar a segurança" em vez de "invadir"). Além disso, se a IA estiver rodando no próprio computador de um hacker, ele pode simplesmente retreiná-la para ignorar o botão de "Não".
  3. Barreiras de Saída/Guardrails (A abordagem do "Segurança de Boate"):

    • A Ideia: Colocamos um segurança na porta para verificar cada mensagem que a IA envia e bloquear qualquer coisa que pareça perigosa.
    • Por que Falha: Um hacker pode dividir um grande ataque em mil etapas minúsculas e de aparência inofensiva. O segurança vê cada etapa como segura, mas, quando você as junta, elas constroem uma bomba.

A Solução Proposta: Construa Seus Próprios Robôs de "Red Team"

O artigo sugere uma mudança radical: Devemos ensinar nossos próprios agentes de IA a hackear, para que possamos usá-los para nos defender.

Pense nisso como um corpo de bombeiros.

  • Defesa Atual: Esperamos um incêndio começar e depois tentamos apagá-lo.
  • A Ideia do Artigo: Contratamos uma equipe de incendiários profissionais (nossa "IA Ofensiva") para trabalhar dentro de uma instalação de treinamento segura e isolada (um "Cyber Range").
    • Esses "Bons Incendiários" tentam incendiar o prédio usando todos os truques possíveis.
    • Como são IAs, eles podem tentar milhões de maneiras de iniciar um fogo em segundos.
    • Nós observamos onde eles têm sucesso, encontramos os pontos fracos em nosso prédio e os consertamos antes que um verdadeiro vilão apareça.

Os Três Passos para Tornar Isso Seguro

Os autores sabem que isso parece perigoso, por isso propõem três regras estritas para evitar que os "Bons Incendiários" causem danos reais:

  1. Construir Melhores Pistas de Teste: Precisamos de melhores "cursos de direção" (benchmarks) para medir exatamente o quão bons esses robôs de hacking são. Precisamos testá-los em cenários do mundo real, não apenas em quebra-cabeças simples.
  2. Treinar, Não Apenas Programar Scripts: Em vez de dar aos robôs uma lista fixa de passos a seguir, precisamos treiná-los para aprender e se adaptar, exatamente como um hacker humano faria. Isso os torna melhores em encontrar novas fraquezas desconhecidas.
  3. A Regra do "Sandbox" (Ambiente Isolado): Esta é a parte mais importante. Os "Bons Incendiários" nunca devem sair da instalação de treinamento segura.
    • Eles permanecem dentro de uma gaiola digital onde não podem tocar a internet real.
    • Eles encontram os buracos e escrevem um relatório.
    • Então, pegamos esse relatório e o entregamos a uma "IA Segura" diferente, que só sabe consertar buracos, não criá-los. Esta "IA Segura" é a que lançamos ao público para proteger nossos sistemas.

A Conclusão

O artigo conclui que não podemos esperar que os hackers mal-intencionados descubram como usar a IA para nos atacar. Quando eles descobrirem, será tarde demais.

Em vez disso, devemos dominar a arma primeiro. Precisamos construir nossa própria IA ofensiva, mantê-la trancada em uma gaiola segura e usá-la para encontrar todas as maneiras possíveis pelas quais nossos sistemas podem ser quebrados. Somente entendendo como o inimigo pensa e age em uma escala massiva poderemos esperar defender nossos sistemas.

Em resumo: Para deter os robôs malvados, temos que construir nossos próprios robôs bons que sejam ainda melhores em quebrar coisas, mas devemos mantê-los em uma gaiola para que eles apenas nos ajudem a consertar nossa casa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →