Beyond Single Reports: Evaluating Automated ATT&CK Technique Extraction in Multi-Report Campaign Settings
Deze empirische studie toont aan dat het aggregeren van meerdere CTI-rapporten de prestaties van geautomatiseerde ATT&CK-techniekextractie met ongeveer 26% verbetert ten opzichte van single-report analyses, hoewel de maximale prestaties beperkt blijven en misclassificaties een disproportioneel effect hebben op de dekking van beveiligingscontroles.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, complexe misdaad moet oplossen. De daders (hackers) hebben een plan uitgevoerd dat we een "campagne" noemen. Om dit plan te begrijpen, schrijven honderden verschillende mensen verslagen: de politie, privé-detectives, hackers die het hebben gezien, en zelfs de slachtoffers.
Elk verslag vertelt een ander stukje van het verhaal. De ene zegt: "Ze hebben de voordeur opengebroken," en de andere zegt: "Ze hebben de sleutels van de buren gestolen." Als je maar naar één verslag kijkt, mis je de rest van het plaatje. Je denkt misschien dat de dader alleen de voordeur heeft gebruikt, terwijl hij eigenlijk ook via het raam is gekomen.
Dit is precies waar dit onderzoek over gaat.
Het Probleem: De "Eén Verslag"-Valstrik
In de wereld van cybersecurity proberen computers automatisch te lezen wat er in deze verslagen staat en te vertalen naar een standaardlijst met "hack-methodes" (de MITRE ATT&CK-lijst). Tot nu toe hebben onderzoekers gekeken of computers dit goed kunnen op basis van één verslag per keer.
De auteurs van dit paper zeggen: "Dat is niet genoeg! Net als bij een echte misdaad, moet je alle verslagen samenvoegen om het volledige plaatje te zien."
Wat hebben ze gedaan?
De onderzoekers hebben 29 verschillende "computer-detectives" (automatische programma's) getest. Ze hebben gekeken of deze programma's beter werkten als ze:
- Slechts één verslag lazen.
- Alle verslagen van dezelfde hack-campagne samenlazen (zoals SolarWinds, XZ Utils en Log4j).
Ze gebruikten drie soorten "detectives":
- De Woordzoeker (NER): Kijkt naar specifieke woorden en patronen.
- De Slimme Lezer (Encoder): Begrijpt zinnen en context, zoals een mens die een tekst leest.
- De AI-Verteller (LLM): Een krachtige kunstmatige intelligentie die de tekst begrijpt en zelf conclusies trekt.
De Belangrijkste Ontdekkingen (in simpele taal)
1. Meer verslagen = Beter resultaat
Toen de computers alle verslagen samenlazen, werden ze gemiddeld 26% beter in het vinden van de hack-methodes. Het is alsof je een puzzel maakt: met één stukje zie je niets, maar met 10 stukjes zie je al een deel van het beeld.
- De verrassing: De "Slimme Lezers" (Encoder) werden juist slechter als ze meer verslagen lazen. Ze raakten in de war door de hoeveelheid informatie. De "Woordzoekers" en de "AI-Vertellers" werden juist beter.
2. De "Verwarrende Tweeling" (Fouten)
De computers maken nog steeds fouten. Ze verwarren vaak methodes die op elkaar lijken.
- Analogie: Het is alsof een computer denkt dat "een fiets stelen" hetzelfde is als "een motor stelen", omdat beide twee wielen hebben en je ermee wegrijdt. In de hack-wereld verwarren ze methodes die dezelfde tactiek gebruiken (bijvoorbeeld "verstoppen" of "ontdekken"). Ongeveer 1 op de 3 fouten komt door deze verwarring tussen "tweeling-methodes".
3. Het "Gaten in het Net"-effect
Dit is misschien wel het belangrijkste punt. Als de computer zelfs maar één hack-methode mist, kan het zijn dat ze ook geen enkele verdediging (een "control") aanbevelen die daar tegen werkt.
- Analogie: Stel je voor dat je een slot op je deur zet. Maar je vergeet dat de dader ook een raam kan openbreken. Je hebt dan een goed slot op de deur, maar je huis is nog steeds kwetsbaar. De onderzoekers zagen dat zelfs de beste computer 10% van de hack-methodes miste, maar dat dit leidde tot 23% minder verdediging in het totaalplaatje. Dat is een groot gat in je veiligheidsnet!
4. Hoeveel verslagen zijn nodig?
Je hoeft niet alle verslagen ter wereld te lezen.
- Analogie: Het is alsof je een recept probeert te reconstrueren. Na het lezen van 5 tot 15 verslagen weet je meestal al het recept. Meer verslagen lezen levert dan weinig extra info meer op. Dit noemen ze "verzadiging".
- Tip: Verslagen van betrouwbare bronnen (zoals de overheid of grote tech-bedrijven) die vol staan met technische details, zijn het meest waardevol. Verslagen die "makkelijk te lezen" zijn (met simpele taal), zijn vaak juist minder nuttig voor de computer, omdat ze de technische details missen.
Wat betekent dit voor ons?
De boodschap is duidelijk: Stop met kijken naar één verslag.
Als je wilt weten hoe hackers werken en hoe je je moet beschermen, moet je alle beschikbare informatie samenvoegen.
- Gebruik slimme AI (zoals de "AI-Vertellers") om alle verslagen te analyseren.
- Accepteer dat je soms verslagen moet lezen die saai of technisch zijn; die bevatten de goudmijn aan informatie.
- Wees je ervan bewust dat als een computer een hack-methode mist, je verdediging ook een gat heeft.
Kortom: In de strijd tegen hackers is "meer informatie" niet alleen beter, het is noodzakelijk om het volledige plaatje te zien en je echt veilig te voelen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.