← Derniers articles
💻 computer science

Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies

Ce papier propose une méthodologie novatrice qui combine les grands modèles de langage avec des ontologies de domaine et des contraintes SHACL pour créer un agent IA améliorant considérablement la précision et l'explicabilité de l'extraction d'informations structurées et sémantiquement valides à partir de journaux de cybersécurité, en particulier pour les données de leurres.

Auteurs originaux : Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

Publié 2026-04-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective tentant de résoudre un crime, mais au lieu de rapports de police clairs, on vous remet des milliers de pages de notes manuscrites désordonnées, de griffonnages et de phrases inachevées. C'est ce à quoi font face les experts en cybersécurité lorsqu'ils tentent de lire les journaux d'événements système. Ces journaux sont les « journaux intimes » des ordinateurs, enregistrant chaque action entreprise, mais ils sont souvent non structurés, confus et remplis de jargon.

Ce papier présente un nouvel outil appelé OntoLogX pour aider les détectives (les analystes en cybersécurité) à donner un sens à ce chaos. Voici comment il fonctionne, décomposé en concepts simples :

1. Le Problème : La « Chambre en Désordre »

Les méthodes traditionnelles pour lire ces journaux sont comme essayer de trouver un jouet spécifique dans une chambre en désordre en n'utilisant qu'une lampe de poche et une liste fixe de règles. Si le jouet est caché sous une pile de vêtements ou étiqueté d'un nom étrange, la lampe de poche le manque.

  • Le Problème : Les ordinateurs génèrent des journaux non structurés et ambigus. Les anciennes méthodes peinent à trouver les « méchants » (les événements malveillants) de manière fiable.
  • Le Nouvel Outil : Les auteurs utilisent des Modèles de Langage de Grande Taille (LLM). Imaginez un LLM comme un stagiaire surdoué qui a lu presque tout ce qui se trouve sur Internet et qui peut comprendre le langage naturel. Cependant, ce stagiaire peut être un peu « rêveur » — parfois, il invente des choses ou se trompe légèrement sur les faits parce qu'il n'est pas strictement lié par des règles.

2. La Solution : L'« Architecte » et l'« Inspecteur »

Pour corriger la tendance du stagiaire à rêver, les auteurs ont construit un système appelé OntoLogX qui ajoute deux couches de contrôle cruciales :

  • L'Architecte (L'Ontologie) : Avant que le stagiaire ne commence à écrire, le système lui fournit un plan strict appelé une Ontologie. C'est comme un ensemble spécifique de blocs de construction et un livre de règles. Il dit : « Vous ne pouvez construire une maison qu'en utilisant ces briques spécifiques (classes) et vous devez les connecter de cette manière précise (relations). » Cela force l'IA à organiser les données de journal désordonnées en un format net et structuré appelé Graphe de Connaissance.
  • L'Inspecteur (Validation SHACL) : Une fois que le stagiaire a construit la structure, un inspecteur strict (utilisant un outil appelé SHACL) vérifie le travail. L'inspecteur demande : « Avez-vous utilisé les bonnes briques ? Avez-vous connecté le toit aux murs correctement ? Y a-t-il une porte manquante ? »
    • Si le bâtiment est incorrect, l'inspecteur le renvoie au stagiaire avec une note : « Corrigez ceci. »
    • Le stagiaire réessaie. Cette boucle continue jusqu'à ce que le bâtiment soit parfait.

3. Le Processus : Apprendre par l'Exemple

Le système ne demande pas simplement au stagiaire de deviner. Il utilise une astuce intelligente appelée Génération Augmentée par Récupération.

  • Imaginez que le stagiaire possède une bibliothèque de cas passés réussis. Lorsqu'un nouveau journal désordonné arrive, le système trouve les cas passés les plus similaires (exemples) et les montre au stagiaire.
  • Il dit : « Regardez comment nous avons résolu ce puzzle similaire auparavant. Utilisez ce même style pour résoudre ce nouveau. »
  • Cela aide le stagiaire à comprendre exactement ce que l'« Architecte » (l'Ontologie) souhaite, conduisant à des résultats bien meilleurs.

4. Les Résultats : Une Meilleure Précision, Pas de Vitesse

Les auteurs ont testé ce système contre la « vieille méthode » (demander simplement au stagiaire d'écrire sans l'Architecte ni l'Inspecteur).

  • Le Résultat : La nouvelle méthode était significativement plus précise. Elle a trouvé plus de « méchants » (un Rappel plus élevé) et a commis moins d'erreurs (une Précision plus élevée).
  • Le Compromis : Le papier indique explicitement qu'ils ont priorisé la qualité sur la vitesse. La nouvelle méthode prend un peu plus de temps car elle doit vérifier le travail, obtenir des retours et réessayer. Mais le résultat final est une carte des menaces cybernétiques beaucoup plus fiable et digne de confiance.
  • Le Gagnant : Parmi les différents modèles d'IA testés, Claude 3.5 Sonnet a obtenu les meilleurs résultats, bien que des modèles open source comme Llama 3.3 aient également très bien performé.

Analogie de Résumé

Si lire les journaux de cybersécurité est comme essayer de traduire un journal intime chaotique et manuscrit en un document juridique formel :

  • Ancienne Méthode : Vous demandez à un traducteur intelligent de simplement « faire de son mieux ». Il pourrait saisir le sens, mais le format sera désordonné et incohérent.
  • OntoLogX : Vous donnez au traducteur un modèle juridique strict (Ontologie), vous lui montrez des exemples de documents juridiques parfaits (exemples few-shot), et vous faites réviser chaque brouillon par un avocat strict (SHACL). Si le brouillon n'est pas parfait, l'avocat le renvoie pour corrections. Le résultat est un document juridique sans faille à chaque fois, même si cela prend un peu plus de temps à produire.

Conclusion Clé : Ce papier prouve que combiner une « IA intelligente » avec des « règles strictes » et des « contrôles de qualité » crée un système beaucoup plus fiable pour transformer des journaux informatiques désordonnés en renseignements clairs et exploitables sur les menaces cybernétiques.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →