← Derniers articles
💬 NLP

TTPrint: Evidence-Grounded TTP Extraction via Diverge-then-Converge Verification

TTPrint est un cadre novateur qui améliore l'extraction des techniques MITRE ATT&CK à partir de rapports de renseignement sur les cybermenaces en adoptant une stratégie « divergence puis convergence » consistant à identifier d'abord largement des comportements candidats ancrés dans des preuves spécifiques, puis à les vérifier rigoureusement par rapport à des définitions autoritaires, surpassant ainsi significativement les méthodes existantes tant en rappel qu'en précision.

Auteurs originaux : Yutong Cheng, Changze Li, Raihan Sultan Pasha Basuki, Qian Cui, Wei Ding, Peng Gao

Publié 2026-05-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yutong Cheng, Changze Li, Raihan Sultan Pasha Basuki, Qian Cui, Wei Ding, Peng Gao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective tentant de résoudre un rapport de scène de crime massif et chaotique. Le rapport compte des centaines de pages, rédigé dans un mélange de jargon technique et de descriptions vagues. Votre tâche consiste à identifier des « Modus Operandi » spécifiques (la façon dont les criminels ont procédé) et à les faire correspondre à un immense manuel de règles officiel appelé MITRE ATT&CK.

Le problème est épineux :

  1. Ne rien manquer : Si vous omettez une technique, les criminels s'en sortent avec une nouvelle astuce.
  2. Ne rien inventer : Si vous devinez une technique qui n'est pas réellement présente, vous faites perdre du temps à tout le monde en poursuivant des fantômes.

Les méthodes existantes (comme d'anciens manuels de règles ou des IA à passage unique) peinent à accomplir les deux. Elles soit manquent trop d'indices, soit devinent trop d'erreurs.

Voici TTPRINT, un nouveau système qui résout ce problème en agissant comme une équipe de détectives humains utilisant une stratégie « Diverger puis Converger ». Pensez-y comme un processus en deux étapes : Élargir d'abord, puis Rétrécir.

Le flux de travail du détective TTPRINT

Phase 1 : La « Divergence » (Élargir)

Au lieu d'essayer de deviner la réponse immédiatement, TTPRINT découpe le rapport de crime massif en petits morceaux digestes appelés « comportements atomiques ».

  • L'analogie : Imaginez prendre un roman de 50 pages et le découper en phrases individuelles.
  • Ce que cela fait : Pour chaque petite phrase, l'IA se demande : « Qu'est-ce que cela pourrait être ? » Elle génère une longue liste de correspondances possibles issues du manuel de règles. Elle lance délibérément un filet large, même si cela signifie suggérer certaines options peu probables. L'objectif ici est le Rappel (Recall) : s'assurer qu'aucun indice réel n'est laissé derrière.

Phase 2 : L'« Ancrage » (Trouver la preuve)

Avant que l'IA ne puisse confirmer une hypothèse, elle doit prouver dans le texte l'indice provient.

  • L'analogie : Si vous dites : « Le suspect a utilisé un pied-de-biche », vous devez pointer la phrase exacte du rapport qui dit : « Le suspect a utilisé un pied-de-biche ». Vous ne pouvez pas simplement dire : « Je pense qu'ils ont utilisé un pied-de-biche parce qu'ils ont cassé une fenêtre ».
  • Ce que cela fait : TTPRINT utilise un algorithme strict, non basé sur l'IA, pour trouver la « fenêtre » spécifique de texte qui soutient le comportement. Cela ancre chaque hypothèse à une pièce de preuve spécifique, empêchant l'IA d'halluciner (d'inventer des choses) en se basant sur l'ambiance générale de l'ensemble du document.

Phase 3 : La « Convergence » (Rétrécir)

Vient maintenant la vérification rigoureuse. L'IA prend la liste des correspondances « possibles » et la « fenêtre de preuve » spécifique.

  • L'analogie : Un détective senior examine la liste du junior. Il compare la phrase spécifique (la preuve) et la définition officielle du manuel de règles côte à côte. Il se demande : « Cette phrase correspond-elle vraiment à la définition du manuel de règles, ou est-ce juste une hypothèse lâche ? »
  • Ce que cela fait : L'IA attribue un score de confiance. Si la correspondance est faible, elle est rejetée. Si elle est forte, elle est conservée. Cette étape garantit la Précision : seuls les faits véritablement soutenus par le texte subsistent.

Pourquoi cela fonctionne mieux

L'article affirme que les méthodes précédentes tentaient d'effectuer toutes ces étapes en une seule fois (comme un détective devinant toute l'histoire en une seule inspiration). Cela conduit à des erreurs :

  • Trop prudents : Ils manquent des indices subtils pour éviter de deviner faux.
  • Trop confiants : Ils devinent faux parce que la formulation dans le rapport ne correspond pas parfaitement à la définition du manuel de règles.

TTPRINT sépare le « devinage » du « contrôle ». En divisant le travail, il peut être audacieux lors du devinage (attraper tout) et strict lors du contrôle (ne garder que la vérité).

Les résultats

Les chercheurs ont testé TTPRINT sur deux ensembles de données :

  1. TRAM-Clean : Une version épurée d'un ensemble de données existant (ils ont corrigé des erreurs dans les étiquettes originales).
  2. TTPRINT-Bench : Un tout nouvel ensemble de données de 150 rapports complets qu'ils ont créés à partir de zéro.

Le tableau de bord :

  • Sur le nouvel ensemble de données, TTPRINT a obtenu un taux de réussite de 87,39 % (Macro-F1).
  • La meilleure méthode précédente (une IA standard utilisant la « Chaîne de Pensée ») n'a obtenu que 58,02 %.
  • TTPRINT a amélioré le score de près de 30 %, ce qui signifie qu'il a trouvé significativement plus de techniques réelles tout en commettant beaucoup moins d'erreurs.

Le « bouton » de contrôle

Une fonctionnalité intéressante est un « bouton de seuil » (appelé τ\tau).

  • Tournez-le vers le haut : Vous obtenez moins de résultats, mais vous êtes sûr à 100 % qu'ils sont corrects (Haute Précision). Idéal pour les systèmes automatisés qui ne peuvent pas se permettre de faire une erreur.
  • Tournez-le vers le bas : Vous obtenez plus de résultats, attrapant presque tout, même si certains peuvent être fragiles (Haut Rappel). Idéal pour les équipes de sécurité qui souhaitent attraper chaque menace possible et enquêter plus tard.

Résumé

TTPRINT est comme un détective qui écrit d'abord toutes les théories possibles basées sur chaque phrase d'un rapport, puis vérifie rigoureusement chaque théorie par rapport à la preuve spécifique avant de rédiger le dossier final de l'affaire. Cette approche lui permet de capturer plus de menaces réelles et de générer moins de fausses alertes que toute méthode précédente.

Note : L'article se concentre strictement sur l'extraction de ces techniques à partir de rapports en langue anglaise. Il ne prétend pas prédire les attaques futures, arrêter les pirates en temps réel, ni fonctionner comme un outil de diagnostic médical ou juridique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →