← Últimos artigos
⚡ electrical engineering

Learning Red Agent Policy from Observations for Neurosymbolic Autonomous Cyber Agents

Este artigo propõe uma técnica de aprendizado por imitação para permitir que agentes de defesa cibernética autônomos neurosimbólicos prevejam políticas e ações de agentes vermelhos não observáveis a partir de observações de rede, aumentando assim sua capacidade de se adaptar a ataques cibernéticos sofisticados em ambientes parcialmente observáveis.

Autores originais: Ankita Samaddar, Sandeep Neema, Daniel Balasubramanian, Xenofon Koutsoukos

Publicado 2026-06-17
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Ankita Samaddar, Sandeep Neema, Daniel Balasubramanian, Xenofon Koutsoukos

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um jogo de xadrez de alto risco jogado em uma sala com neblina. Você é o defensor (o "Agente Azul"), tentando proteger seu castelo. Seu oponente é o atacante (o "Agente Vermelho"), que está tentando invadir.

O problema? Você não consegue ver seu oponente. Você só vê os resultados dos movimentos dele: uma porta é aberta de repente, uma luz pisca ou um móvel é movido. Você conhece seus próprios movimentos, mas tem que adivinhar o que seu oponente invisível acabou de fazer com base em como a sala mudou.

Este artigo descreve uma nova maneira para o defensor "ler a mente" do atacante em uma rede digital, mesmo quando o atacante está escondido.

O Cenário: Um Castelo Digital

Os pesquisadores usaram uma rede simulada chamada CybORG. Pense nesta rede como um castelo com três áreas:

  1. O Pátio (Sub-rede do Usuário): Onde as pessoas comuns trabalham.
  2. O Escritório (Sub-rede Corporativa): Onde residem servidores e dados importantes.
  3. O Cofre (Sub-rede Operacional): O maquinário mais crítico e sensível.

O atacante tenta se infiltrar do Pátio, passar pelo Escritório e, finalmente, chegar ao Cofre para causar danos. O defensor tenta impedi-lo.

O Problema: A Neblina da "Caixa Preta"

Neste jogo, o defensor é "parcialmente observável". Esta é uma maneira elegante de dizer: "Eu não consigo ver o atacante."

  • O defensor vê o estado da rede (ex: "O Servidor A agora está comprometido").
  • O defensor sabe o que ele fez (ex: "Eu escaneei a rede").
  • Mas o defensor não sabe o que o atacante fez para causar essa mudança. Eles escanearam? Hackearam uma senha? Instalaram um vírus?

Sem saber o movimento específico do atacante, é difícil prever seu próximo passo ou entender quão profundamente ele penetrou no sistema.

A Solução: Uma IA "Sherlock Holmes"

Os autores propõem uma técnica chamada Aprendizado de Política (Policy Learning) usando um método semelhante ao Aprendizado por Imitação (Imitation Learning).

Aqui está a analogia: Imagine que você está assistindo a um mágico realizar um truque. Você vê as mãos do mágico se moverem (a ação do defensor) e vê o coelho aparecer (a mudança de estado da rede). Você não vê o movimento secreto que o mágico fez para tirar o coelho de dentro do chapéu.

Os pesquisadores construíram uma IA que age como um detetve:

  1. Observar e Aprender: Eles deixam a IA assistir a milhares de jogos onde o atacante e o defensor jogam. Embora a IA não veja os movimentos do atacante durante o jogo, ela possui uma "folha de cola" (a verdade fundamental/ground truth) durante o treinamento para ver o que realmente aconteceu.
  2. Encontrar o Padrão: A IA aprende um padrão: "Quando o defensor escaneia a rede e o servidor subitamente parece diferente, o atacante deve ter feito X."
  3. Prever o Futuro: Uma vez treinada, a IA pode observar um novo jogo em tempo real. Ela vê o movimento do defensor e a mudança resultante, e diz: "Aposto que o atacante acabou de fazer X."

Como Funciona: O Processo de Detetive de Três Etapas

O artigo divide isso em três estágios, como um detetive resolvendo um caso:

  1. A Fase "O Que Aconteceu?" (Dinâmica Inversa): A IA observa o "antes" e o "depois" da rede e o movimento do defensor. Ela tenta adivinhar o movimento "invisível" que o atacante fez para causar a mudança. Ela cria um palpite abstrato e aproximado (uma "ação latente").
  2. A Fase de "Prática" (Aprendizado de Política): A IA treina a si mesma para ser melhor em adivinhar. Ela tenta imitar os movimentos invisíveis que descobriu na etapa 1. É como um aluno praticando uma dança observando as pegadas do professor.
  3. A Fase de "Tradução" (Mapeamento): Os palpites da IA ainda são vagos. Esta etapa traduz o palpite vago em um nome de ataque específico do mundo real (ex: "Explorar Serviço Remoto") e um alvo específico (ex: "Servidor 3").

O "Cérebro Neurosimbólico"

O artigo menciona IA Neurosimbólica e Árvores de Comportamento (Behavior Trees).

  • Neurosimbólico significa combinar dois tipos de pensamento:
    • Neural: Aprender a partir de dados (como um humano aprendendo através da experiência).
    • Simbólico: Seguir regras lógicas (como um computador seguindo uma lista de verificação estrita).
  • Árvores de Comportamento são como um fluxograma ou uma árvore de decisão. Imagine um segurança com uma prancheta. O guarda verifica: "A porta está aberta? Sim. Há um intruso? Sim. Então, toque o alarme."
  • Os pesquisadores integraram essa nova IA de "leitura de mente" neste fluxograma. Agora, o guarda não apenas reage à porta aberta; o guarda pode prever que o intruso provavelmente irá ao Cofre em seguida e se preparar para isso.

Os Resultados: Quão Bom Foi?

Os pesquisadores testaram isso no ambiente simulado "CybORG" contra dois tipos de atacantes:

  1. O Atacante "Linha Reta" (B-Line): Um caminho direto e reto para o objetivo. (Como um ladrão correndo direto para o cofre).
  2. O Atacante "Errante" (Meander): Um atacante que vaga, checando cada sala e tentando entrar em cada computador antes de seguir adiante. (Como um ladrão bisbilhotando toda a casa).

As Descobertas:

  • Atacantes Diretos: A IA foi incrivelmente precisa (mais de 99%) ao prever os movimentos do atacante direto. Como o caminho deles é previsível, a IA "detetive" conseguia facilmente adivinhar o próximo passo.
  • Atacantes Errantes: A IA ainda foi muito boa (cerca de 95% para a área geral, embora um pouco menos precisa quanto ao computador exato) em prever o atacante errante.
  • Atacantes de Mudança de Estratégia: Eles até testaram um atacante que muda de estratégia no meio do caminho. A IA conseguiu se adaptar e continuar prevendo, embora tenha levado um momento para se ajustar quando a estratégia mudou.

Por Que Isso Importa

A principal conclusão é que este sistema permite que um defensor veja o invisível. Ao prever o que o atacante está fazendo agora, o defensor pode:

  • Detectar uma intrusão mais cedo.
  • Entender quão profundo o atacante penetrou (ex: "Eles têm acesso de usuário, mas ainda não têm acesso de administrador").
  • Reagir de forma mais eficaz porque não estão apenas supondo; eles estão fazendo uma previsão educada baseada na "política" oculta do atacante.

Em suma, o artigo apresenta uma maneira de transformar um jogo de defesa nebuloso e cego em uma partida mais clara, onde o defensor pode antecipar o próximo movimento do atacante, mesmo sem vê-lo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →