← Nieuwste papers
🤖 machine learning

Constructing Multi-label Hierarchical Classification Models for MITRE ATT&CK Text Tagging

Dit artikel introduceert een raamwerk voor multi-label hiërarchische classificatie voor het automatiseren van MITRE ATT&CK-teksttagging dat een hoge nauwkeurigheid bereikt (94% op tactiekgehalte en 82% op techniekgehalte) met behulp van klassieke machine learning-methoden, waarbij GPT-4o aanzienlijk wordt overtroffen en de noodzaak voor complexe LLM-gebaseerde architecturen wordt geëlimineerd.

Oorspronkelijke auteurs: Andrew Crossman, Jonah Dodd, Viralam Ramamurthy Chaithanya Kumar, Riyaz Mohammed, Andrew R. Plummer, Chandra Sekharudu, Deepak Warrier, Mohammad Yekrangian

Gepubliceerd 2026-01-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Andrew Crossman, Jonah Dodd, Viralam Ramamurthy Chaithanya Kumar, Riyaz Mohammed, Andrew R. Plummer, Chandra Sekharudu, Deepak Warrier, Mohammad Yekrangian

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een bibliothecaris bent die een enorme, chaotische bibliotheek probeert te organiseren vol verhalen over cyberaanvallen. Elke keer als er een nieuw verhaal (een "dreigingsrapport") binnenkomt, moet je het onder specifieke categorieën indelen zodat andere bibliothecarissen het later kunnen vinden.

In de wereld van cybersecurity wordt dit systeem voor het archiveren MITRE ATT&CK genoemd. Het is als een gigantische, twee-laagse archiefkast:

  1. De bovenste lade (Tactics/Tactieken): Dit beantwoordt de vraag: "Waarom deed de boef dit?" (bijv. "Ze wilden wachtwoorden stelen" of "Ze wilden hun sporen wissen").
  2. De onderste lade (Techniques/Technieken): Dit beantwoordt de vraag: "Hoe deden ze het?" (bijv. "Ze gebruikten een specif kind type phishing-e-mail" of "Ze gebruikten een specifieke softwarefout").

Jarenlang moesten beveiligingsexperts deze rapporten lezen en ze handmatig in de juiste laden archiveren. Dat is traag, saai en foutgevoelig door menselijke fouten. Dit artikel gaat over het bouwen van een robotassistent die dit archiveren voor hen kan doen.

De "Bottom-Up" Constructie

In plaats van te proberen een gigantische, complexe robot vanaf nul op te bouwen (een "top-down" aanpak), bouwden de auteurs hun systeem stap voor stap, zoals het stapelen van blokken. Ze begonnen klein en voegden pas complexiteit toe wanneer ze wisten dat de vorige blok stevig stond.

  1. Stap 1: De Simpele Classificatie (De "Eén-Label" Robot)
    Eerst leerden ze een simpel machine learning-model om naar een zin te kijken en één "Waarom" (Tactic) te raden. Ze testten dit tegen GPT-4o, de beroemde AI-chatbot.

    • Het resultaat: De simpele robot won. Hij had ongeveer 82% van de antwoorden goed, terwijl GPT-4o slechts 59% goed had. De auteurs ontdekten dat voor deze specifieke, gestructureerde taak een simpel, klassiek hulpmiddel eigenlijk beter was dan de hippe, complexe AI.
  2. Stap 2: De Multi-Label Classificatie (De "Meerdere-Labels" Robot)
    Het echte leven is niet simpel; een enkele zin heeft vaak meerdere redenen voor een aanval. Dus upgradeden ze de robot zodat hij de top 3 "Waarommen" kon raden in plaats van slechts één.

    • Het resultaat: Dit verhoogde hun nauwkeurigheid naar 94%.
  3. Stap 3: De Hiërarchische Classificatie (De "Volledige Archivering" Robot)
    Ten slotte leerden ze de robot om de "Waarom" én de "Hoe" samen te raden. Als de robot raadt dat de "Waarom" "Wachtwoorden stelen" is, kijkt hij vervolgens naar de specifieke "Hoe" (bijv. "Keylogging").

    • Het resultaat: Dit systeem bereikte een nauwkeurigheid van 82% voor de volledige "Waarom + Hoe" combinatie.

Het "Geheime Recept" (Waarom het werkt)

De auteurs gebruikten niet de nieuwste, duurste "Generatieve AI" of complexe neurale netwerken. In plaats daarvan gebruikten ze klassieke machine learning (specifiek iets dat "Stochastic Gradient Descent" met "TF-IDF" wordt genoemd).

Denk er zo over na: in plaats van een supercomplexe, dure Ferrari te bouwen om naar de supermarkt te rijden, bouwden ze een zeer betrouwbare, efficiënte fiets. Deze doet het werk sneller, kost minder en is makkelijker te repareren.

Ze voegden ook een privacyvergrendeling toe (hashing). Stel je voor dat ze hun robot met de wereld wilden delen, maar bezorgd waren over het delen van de geheime recepten (de data) die werden gebruikt om hem te trainen. Ze bedachten een manier om de data te versleutelen, zodat de robot ervan kon leren zonder dat iemand de originele ingrediënten kon zien. Dit maakte het mogelijk om de robot veilig met het publiek te delen.

De "Nieuwe Bibliotheek" Test

Om te zien of hun robot echt slim was, testten ze hem niet alleen op de verhalen waar hij van had geleerd. Ze gaven hem een compleet nieuwe set verhalen over financiële dreigingen (specifiek voor de banksector) die hij nog nooit had gezien.

  • Het resultaat: In het begin was de robot in de war (omdat de nieuwe verhalen anders waren). Maar toen ze hem slechts een heel klein beetje training gaven op deze nieuwe verhalen, leerde hij snel om ze correct te archiveren. Dit bewijst dat de robot flexibel is en kan aanpassen aan nieuwe situaties zonder dat er een enorme hoeveelheid nieuwe data nodig is.

De Belangrijkste Conclusie

De paper concludeert dat je niet altijd de meest dure, complexe AI nodig hebt om een probleem op te lossen. Door de taak op te splitsen in kleine, beheersbare stappen en betrouwbare, klassieke tools te gebruiken, bouwden zij een systeem dat:

  • Nauwkeuriger is dan een top-tier AI-chatbot (GPT-4o) voor deze specifieke taak.
  • Sneller en goedkoper is in gebruik.
  • Veilig te delen is met het publiek.
  • Kan aanpassen aan nieuwe soorten data met zeer weinig extra training.

Ze hebben deze "robotbibliothecaris" gratis beschikbaar gesteld op GitHub, zodat andere beveiligingsteams hem kunnen gebruiken om hun eigen cyberdreigingsrapporten te organiseren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →