← Derniers articles
⚡ electrical engineering

Learning Red Agent Policy from Observations for Neurosymbolic Autonomous Cyber Agents

Cet article propose une technique d'apprentissage par imitation pour permettre aux agents de cyberdéfense autonomes neurosymboliques de prédire les politiques et les actions non observables des agents rouges à partir d'observations réseau, améliorant ainsi leur capacité à s'adapter à des cyberattaques sophistiquées dans des environnements partiellement observables.

Auteurs originaux : Ankita Samaddar, Sandeep Neema, Daniel Balasubramanian, Xenofon Koutsoukos

Publié 2026-06-17
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ankita Samaddar, Sandeep Neema, Daniel Balasubramanian, Xenofon Koutsoukos

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez une partie d'échecs à haut risque jouée dans une pièce embrumée. Vous êtes le défenseur (l'Agent Bleu), essayant de protéger votre château. Votre adversaire est l'attaquant (l'Agent Rouge), qui tente de s'introduire.

Le problème ? Vous ne pouvez pas voir votre adversaire. Vous ne voyez que les résultats de ses mouvements : une porte qui s'ouvre soudainement, une lumière qui vacille, ou un meuble qui est déplacé. Vous connaissez vos propres mouvements, mais vous devez deviner ce que votre adversaire invisible vient de faire en fonction de la façon dont la pièce a changé.

Cette publication décrit une nouvelle façon pour le défenseur de « lire dans l'esprit » de l'attaquant dans un réseau numérique, même lorsque l'attaquant est caché.

Le Cadre : Un Château Numérique

Les chercheurs ont utilisé un réseau simulé appelé CybORG. Considérez ce réseau comme un château possédant trois zones :

  1. La Cour (Sous-réseau Utilisateur) : Où les gens ordinaires travaillent.
  2. Le Bureau (Sous-réseau Entreprise) : Où se trouvent les serveurs et les données importants.
  3. Le Coffre-fort (Sous-réseau Opérationnel) : La machinerie la plus critique et sensible.

L'attaquant tente de s'infiltrer depuis la Cour, à travers le Bureau, et enfin dans le Coffre-fort pour causer des dommages. Le défenseur tente de l'arrêter.

Le Problème : Le Brouillard de la « Boîte Noire »

Dans ce jeu, le défenseur est « partiellement observable ». C'est une façon sophistiquée de dire : « Je ne peux pas voir l'attaquant. »

  • Le défenseur voit l'état du réseau (ex : « Le serveur A est maintenant compromis »).
  • Le défenseur sait ce qu'il a fait (ex : « J'ai scanné le réseau »).
  • Mais le défenseur ne sait pas ce que l'attaquant a fait pour provoquer ce changement. Ont-ils scanné ? Ont-ils piraté un mot de passe ? Ont-ils installé un virus ?

Sans savoir quel mouvement spécifique l'attaquant a effectué, il est difficile de prédire son étape suivante ou de comprendre jusqu'à quel point il a pénétré le système.

La Solution : Une IA de type « Sherlock Holmes »

Les auteurs proposent une technique appelée Apprentissage de Politique (Policy Learning) utilisant une méthode similaire à l'Apprentissage par Imitation.

Voici l'analogie : Imaginez que vous regardez un magicien réaliser un tour. Vous voyez les mains du magicien bouger (l'action du défenseur) et vous voyez le lapin apparaître (le changement d'état du réseau). Vous ne voyez pas le mouvement secret que le magicien a fait pour sortir le lapin du chapeau.

Les chercheurs ont construit une IA qui agit comme un détective :

  1. Observer et Apprendre : Ils ont laissé l'IA regarder des milliers de parties où l'attaquant et le défenseur s'affrontent. Même si l'IA ne voit pas les mouvements de l'attaquant pendant la partie, elle dispose d'un « aide-mémoire » (la vérité terrain) pendant l'entraînement pour voir ce qui s'est réellement passé.
  2. Trouver le Modèle : L'IA apprend un motif : « Quand le défenseur scanne le réseau et que le serveur semble soudainement différent, l'attaquant doit avoir fait X. »
  3. Prédire l'Avenir : Une fois entraînée, l'IA peut observer une nouvelle partie en temps réel. Elle voit le mouvement du défenseur et le changement résultant, puis elle dit : « Je parie que l'attaquant vient de faire X. »

Comment cela fonctionne : Le processus de détective en trois étapes

Les chercheurs décomposent cela en trois étapes, comme un détective résolvant une affaire :

  1. La phase « Que s'est-il passé ? » (Dynamique Inverse) : L'IA regarde l'« avant » et l'« après » du réseau ainsi que le mouvement du défenseur. Elle essaie de deviner le mouvement « invisible » que l'attaquant a effectué pour provoquer le changement. Elle crée une supposition brute et abstraite (une « action latente »).
  2. La phase « Pratique » (Apprentissage de Politique) : L'IA s'entraîne pour devenir meilleure dans ses suppositions. Elle essaie de mimer les mouvements invisibles qu'elle a déduits à l'étape 1. C'est comme un élève pratiquant une danse en regardant les empreintes de pas du professeur.
  3. La phase « Traduction » (Cartographie) : Les suppositions de l'IA sont encore vagues. Cette étape traduit la supposition vague en un nom d'attaque spécifique au monde réel (ex : « Exploiter un service distant ») et une cible spécifique (ex : « Serveur 3 »).

Le Cerveau « Neurosymbolique »

La publication mentionne l'IA Neurosymbolique et les Arbres de Comportement.

  • Neurosymbolique signifie combiner deux types de pensée :
    • Neurale : Apprendre à partir de données (comme un humain apprenant par l'expérience).
    • Symbolique : Suivre des règles logiques (comme un ordinateur suivant une liste de contrôle stricte).
  • Les Arbres de Comportement sont comme un organigramme ou un arbre de décision. Imaginez un garde de sécurité avec un presse-papiers. Le garde vérifie : « Est-ce que la porte est ouverte ? Oui. Y a-t-il un intrus ? Oui. Alors, déclenchez l'alarme. »
  • Les chercheurs ont intégré cette IA de « lecture de pensée » dans cet organigramme. Désormais, le garde ne se contente pas de réagir à la porte ouverte ; le garde peut prédire que l'intrus va probablement se diriger vers le Coffre-fort ensuite, et se préparer en conséquence.

Les Résultats : Quelle était l'efficacité ?

Les chercheurs ont testé cela dans l'environnement simulé « CybORG » contre deux types d'attaquants :

  1. L'Attaquant « Ligne Droite » (B-Line) : Un chemin direct et rectiligne vers l'objectif. (Comme un cambrioleur courant droit vers le coffre-fort).
  2. L'Attaquant « Erratique » (Meander) : Un attaquant qui erre, vérifiant chaque pièce et essayant de s'introduire dans chaque ordinateur avant de progresser. (Comme un cambrioleur fouillant toute la maison).

Les conclusions :

  • Attaquants directs : L'IA était incroyablement précise (plus de 99 %) pour prédire les mouvements de l'attaquant direct. Comme leur chemin est prévisible, l'IA « détective » pouvait facilement deviner l'étape suivante.
  • Attaquants erratiques : L'IA était toujours très performante (environ 95 % pour la zone générale, bien que légèrement moins précise sur l'ordinateur exact) pour prédire l'attaquant erratique.
  • Attaquants changeants : Ils ont même testé un attaquant qui change de stratégie à mi-chemin. L'IA a pu s'adapter et continuer à prédire, bien qu'elle ait eu besoin d'un moment pour rattraper le changement de stratégie.

Pourquoi cela importe

L'idée principale est que ce système permet à un défenseur de voir l'invisible. En prédisant ce que l'attaquant fait en ce moment même, le défenseur peut :

  • Détecter une intrusion plus tôt.
  • Comprendre jusqu'où l'attaquant est allé (ex : « Ils ont un accès utilisateur, mais pas encore un accès administrateur »).
  • Réagir plus efficacement car il ne se contente pas de deviner ; il fait une prédiction éclairée basée sur la « politique » cachée de l'attaquant.

En résumé, cette publication présente un moyen de transformer un jeu de défense brumeux et aveugle en une confrontation plus claire où le défenseur peut anticiper le prochain mouvement de l'attaquant, même sans le voir.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →