← Nieuwste papers
🤖 machine learning

Context-aware Entity-Relation Extraction for Threat Intelligence Knowledge Graphs

Dit artikel introduceert het Context-aware Threat Intelligence Knowledge Graph (CTiKG)-kader, dat hybride NLP-modellen combineert die SecureBERT+-embeddings en domeinontologie integreren om de beperkingen van bestaande pijplijnbenaderingen bij het extraheren van accurate entiteit-relatie-triplets uit ongestructureerde cybersecurityrapporten te overwinnen, waardoor aanzienlijke prestatiewinst wordt behaald op STIX 2.1-gealigneerde benchmarks.

Oorspronkelijke auteurs: Inoussa Mouiche, sherif Saad

Gepubliceerd 2026-05-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Inoussa Mouiche, sherif Saad

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een cybersecurity-detective bent die een enorm mysterie probeert op te lossen. Je hebt duizenden rommelige, handgeschreven rapporten (on gestructureerde tekst) die hackers, hun tools en hun aanvallen beschrijven. Je doel is om deze rommelige notities om te zetten in een schoon, georganiseerd "Gezocht"-posterbord (een Kennisgrafiek) waarop je direct kunt zien wie met wie verbonden is, welke tools ze gebruiken en waar ze toeslaan.

Dit artikel introduceert een nieuwe, slimmere manier om dat bord te bouwen, genaamd CTiKG. Hier is hoe het werkt, opgesplitst in eenvoudige concepten:

Het Probleem: De "Gebroken Assemblagelijn"

Voorheen was het proberen om deze borden te bouwen als het runnen van een defecte assemblagelijn.

  1. Stap 1: Een robot probeerde de namen van mensen en plaatsen te vinden (Entiteiten).
  2. Stap 2: Een tweede robot probeerde uit te zoeken hoe ze met elkaar verbonden waren (Relaties).

Het probleem was dat als de eerste robot een fout maakte (zoals het verkeerd identificeren van de naam van een hacker), de tweede robot in de war raakte en ook een fout maakte. Dit wordt "foutpropagatie" genoemd. Ook waren de robots getraind op algemeen Engels (zoals het lezen van Wikipedia), dus ze begrepen geen specifieke hackersjargon of vaktermen. Ze zouden "Mimikatz" lezen en denken dat het gewoon een willekeurig woord was, en niet een specifieke hacking-tool.

De Oplossing: De "Contextbewuste Detective" (CTiKG)

De auteurs bouwden een nieuw systeem dat fungeert als een gespecialiseerd detective-team dat vloeiend spreekt de taal van cyberbedreigingen. Ze verbeterden het proces op drie hoofdmanieren:

1. De "Superlezer" (Betere Entiteitsherkenning)

In plaats van een basisrobot, gebruikten ze een gespecialiseerd brein genaamd SecureBERT+. Denk hierbij aan een detective die elk cybercrimerapport dat ooit is geschreven, heeft gelezen.

  • De Upgrade: Ze voegden een "veiligheidsnet" (een CRF-laag) toe aan dit brein. In het oude systeem zou de robot een woord kunnen labelen als "Start van een Naam" maar vergeten het "Einde van een Naam" te labelen, waardoor een gebroken zin ontstaat. Het veiligheidsnet zorgt ervoor dat de labels altijd logisch samenhangen, zoals een puzzelstuk dat alleen past als de stukken eromheen correct zijn.
  • Het Resultaat: Dit systeem is veel beter in het opsporen van de 21 verschillende soorten "verdachten" (zoals hackers, malware of IP-adressen) in de tekst, waardoor fouten met ongeveer 3–4% worden verminderd.

2. De "Regelboek" (Betere Relatie-extractie)

Zodra de verdachten zijn gevonden, moet het systeem de punten met elkaar verbinden.

  • De Upgrade: Ze creëerden een specifiek Domein-Ontologie. Stel je dit voor als een streng regelboek of een flowchart dat zegt: "Een hacker gebruikt een tool," of "Een tool richt zich op een computer."
  • Hoe het helpt: Zelfs als de AI een beetje in de war raakt, fungeert het regelboek als scheidsrechter. Als de AI probeert te zeggen dat een "Computer" "geassocieerd is met" een "Datum" op een manier die niet logisch is, corrigeert het regelboek dit. Dit zorgt ervoor dat de verbindingen (relaties) logisch en accuraat zijn.
  • Het Resultaat: Dit verbeterde de nauwkeurigheid van het verbinden van de punten met tot 8%.

3. De "Trainingsplaats" (Nieuwe Data)

Om hun nieuwe detectives te leren, gebruikten de auteurs niet alleen oude, rommelige data. Ze creëerden een nieuwe, super-schone trainingsset genaamd DNRTI-AUG-STIX2.

  • Ze namen bestaande rapporten en voegden meer voorbeelden toe van zeldzame soorten hackers en tools (Data Augmentation) zodat de AI niet in de war zou raken door dingen die het nog nooit had gezien.
  • Ze voegden ook vergelijkbare categorieën samen (zoals verschillende soorten hash-codes) om het leerproces soepeler te maken.

De Resultaten: Een Scherpere Afbeelding

De auteurs testten hun nieuwe systeem tegen de oude systemen met behulp van deze nieuwe datasets.

  • De Score: Hun nieuwe systeem scoorde significant hoger op een schaal van 0 tot 1 (specifiek, met een verbetering van de F1-scores met 3–4% voor het vinden van namen en tot 8% voor het vinden van verbindingen).
  • Het Bewijs: Ze testten het niet alleen op één type rapport; ze testten het op drie verschillende datasets (DNRTI-AUG-STIX2, DNRTI en STUCCO) om te bewijzen dat het werkt, ongeacht welk type cyber-rapport het leest.

De Conclusie

Dit artikel claimt niet om hackers te stoppen of de toekomst te voorspellen. In plaats daarvan claimt het een beter hulpmiddel voor beveiligingsexperts te hebben gebouwd. Door de "assemblagelijn"-fouten te herstellen en de AI te leren "hackers" te spreken, creëerden ze een systeem dat rommelige tekst omzet in een duidelijk, betrouwbaar kaartbeeld van cyberbedreigingen. Deze kaart helpt beveiligingsteams snellere, beter onderbouwde beslissingen te nemen omdat de informatie accuraat en eenvoudig te doorzoeken is.

De auteurs hebben ook hun nieuwe "trainingsdata" en "regelboeken" gedeeld op GitHub, zodat andere onderzoekers ze kunnen gebruiken om nog betere systemen te bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →