← Derniers articles
🤖 machine learning

TIJERE: A Novel Threat Intelligence Joint Extraction Model Based on Analyst Expert Knowledge

Ce papier présente TIJERE, un modèle novateur d'extraction conjointe d'entités et de relations qui exploite l'expertise des analystes et un SecureBERT+ finement ajusté au sein d'un cadre d'étiquetage multiséquentiel pour atteindre des performances de pointe en matière de renseignement sur les cybermenaces, accompagné de la publication du premier jeu de données étiqueté conjointement disponible publiquement, DNRTI-JE, afin de combler les lacunes existantes dans l'analyse automatisée des menaces.

Auteurs originaux : Inoussa Mouiche, Sherif Saad

Publié 2026-05-05
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Inoussa Mouiche, Sherif Saad

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective tentant de résoudre une affaire massive de cybercriminalité. Vous avez des milliers de rapports de police désordonnés et non organisés (rapports de renseignement sur les menaces) rédigés dans un mélange de jargon technique et de descriptions vagues. Votre objectif est de construire une immense carte organisée (un graphe de connaissances) qui montre exactement qui a fait quoi à qui et quand.

Par exemple, vous devez déterminer que « APT29 » (un groupe de pirates informatiques) a utilisé « Mimikatz » (un outil) pour attaquer « la Banque XYZ » (une victime).

Cet article présente un nouvel outil appelé TIJERE pour aider à automatiser ce travail d'enquête. Voici comment il fonctionne, expliqué simplement :

Le Problème : L'« Approche par Pipeline » vs L'« Approche Jointe »

Auparavant, les ordinateurs tentaient de résoudre ce problème en deux étapes séparées (comme une chaîne de montage d'usine) :

  1. Étape 1 : Trouver tous les noms de personnes, de groupes et d'outils (Reconnaissance d'Entités Nommées).
  2. Étape 2 : Examiner ces noms et deviner comment ils sont connectés (Extraction de Relations).

Le Défaut : Si l'Étape 1 fait une petite erreur (comme identifier à tort un outil comme une personne), cette erreur se propage à l'Étape 2, ruinant toute la carte. De plus, les phrases dans les rapports cyber sont souvent désordonnées. Une phrase peut dire : « APT29 a utilisé l'Outil A pour attaquer la Banque X », mais implique aussi que « L'Outil A a été utilisé par APT29 ». L'ordinateur se perd pour savoir quelle connexion correspond à quoi, surtout lorsque les mêmes mots apparaissent dans des rôles différents.

La Solution : TIJERE (Le Système du « Détective Expert »)

TIJERE change la donne en effectuant les deux étapes simultanément dans un cerveau unifié. Mais il ne se contente pas de s'appuyer sur le texte brut ; il utilise trois astuces ingénieuses pour agir comme un expert humain :

1. La « Fiche Triche de Connaissances Expertes » (Fonctionnalités de Domaine Expert)

Imaginez que vous lisez une phrase : « APT29 a utilisé Mimikatz. »

  • Un ordinateur normal voit « APT29 » et « Mimikatz » comme de simples mots aléatoires. Il pourrait penser que « Mimikatz » est un nom de personne car il ne sait pas ce que c'est.
  • TIJERE possède une fiche triche spéciale. Il sait que « APT29 » est un Groupe de Pirates et que « Mimikatz » est un Outil.
  • L'Analogie : C'est comme donner à l'ordinateur une paire de lunettes qui surligne le type de chaque objet. Une fois qu'il voit « Groupe de Pirates » et « Outil », il sait instantanément que la relation est probablement « Utilise », car les pirates utilisent des outils. Cela empêche l'ordinateur de se perdre face à des mots ambigus.

2. Le « Surligneur » (Masque d'Entité)

Dans une phrase longue et complexe avec de nombreux noms, il est difficile pour un ordinateur de savoir quels deux noms interagissent entre eux.

  • TIJERE utilise un surligneur numérique. Lorsqu'il examine la connexion entre « APT29 » et « Mimikatz », il surligne uniquement ces deux mots et transforme tout le reste de la phrase en « bruit de fond ».
  • L'Analogie : C'est comme un professeur pointant un laser sur deux élèves spécifiques dans une salle de classe bondée pour leur poser une question, en ignorant tout le monde. Cela aide l'ordinateur à se concentrer strictement sur le couple pertinent.

3. La Stratégie des « Multiples Copies » (Étiquetage Multiséquentiel)

C'est la plus grande innovation de l'article. Habituellement, un ordinateur lit une phrase une fois et tente de deviner toutes les relations à la fois.

  • TIJERE prend une phrase et crée des copies séparées et personnalisées pour chaque paire possible d'éléments dans cette phrase.
  • L'Analogie : Imaginez que vous avez une phrase avec trois paires de suspects. Au lieu de demander à l'ordinateur de résoudre tout le puzzle d'un coup, TIJERE crée trois copies séparées de la phrase.
    • Copie A dit : « Voici la paire (APT29, Mimikatz). Quelle est leur relation ? »
    • Copie B dit : « Voici la paire (APT29, Banque). Quelle est leur relation ? »
    • Copie C dit : « Voici la paire (Mimikatz, Banque). Quelle est leur relation ? »
  • En décomposant le problème en ces questions plus petites et ciblées, l'ordinateur cesse d'être submergé par les relations « chevauchantes ».

Le Dictionnaire Spécial (SecureBERT+)

Les rapports de cybersécurité utilisent un langage très spécifique (comme « EternalBlue » ou « Hameçonnage ciblé ») que les ordinateurs normaux ne comprennent pas bien. TIJERE utilise une version spéciale d'un modèle linguistique appelée SecureBERT+.

  • L'Analogie : Pensez-y comme entraîner l'ordinateur sur un dictionnaire écrit spécifiquement pour les espions et les pirates, plutôt que sur un dictionnaire anglais standard. Cela l'aide à comprendre l'« argot » du monde cyber.

Les Résultats : Une Nouvelle Carte et un Nouveau Tableau de Score

Pour prouver que cela fonctionne, les auteurs ont fait deux choses :

  1. Ils ont construit un nouvel ensemble de données (DNRTI-JE) : Ils ont pris des rapports existants et les ont étiquetés manuellement avec à la fois les noms et les relations. C'est la première fois qu'un tel ensemble de données « étiqueté conjointement » est rendu public pour la cybersécurité.
  2. Ils ont testé le modèle : Lorsqu'ils ont fait fonctionner TIJERE par rapport à d'autres méthodes, il s'est imposé comme un gagnant clair.
    • Il a correctement identifié les noms (Entités) 93 % du temps.
    • Il a correctement identifié les relations 98 % du temps.

Résumé

Pensez à TIJERE comme à un détective surpuissant qui ne se contente pas de lire le rapport ; il comprend les types de personnages impliqués, utilise un surligneur pour se concentrer sur les bons couples, et décompose les phrases complexes en entretiens simples, un à un. En combinant cela avec un « dictionnaire de pirates » spécialisé, il construit une carte des menaces cyber beaucoup plus précise que jamais auparavant.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →