← Nieuwste papers
🤖 machine learning

TIJERE: A Novel Threat Intelligence Joint Extraction Model Based on Analyst Expert Knowledge

Dit artikel introduceert TIJERE, een nieuw model voor gezamenlijke entiteits- en relatie-extractie dat gebruikmaakt van deskundige kennis van analisten en een fijngefineerde SecureBERT+ binnen een multisequentielabelingskader om state-of-the-art prestaties te bereiken op het gebied van cyberbeveiligingsdreigingsinformatie, en presenteert tegelijkertijd de eerste publiek beschikbaar gestelde gezamenlijk gelabelde dataset, DNRTI-JE, om bestaande lacunes in geautomatiseerde dreigingsanalyse aan te pakken.

Oorspronkelijke auteurs: Inoussa Mouiche, Sherif Saad

Gepubliceerd 2026-05-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Inoussa Mouiche, Sherif Saad

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een enorme cybercriminele zaak probeert op te lossen. Je hebt duizenden rommelige, ongeorganiseerde politierapporten (bedreigingsinlichtingenrapporten) die geschreven zijn in een mix van technische jargon en vage beschrijvingen. Je doel is om een gigantische, georganiseerde kaart (een kennisgrafiek) te bouwen die precies laat zien wie wat aan wie en wanneer heeft gedaan.

Bijvoorbeeld, je moet uitzoeken dat "APT29" (een hackergroep) "Mimikatz" (een tool) heeft gebruikt om "XYZ Bank" (een slachtoffer) aan te vallen.

Dit artikel introduceert een nieuwe tool genaamd TIJERE om deze detectivearbeid te automatiseren. Hier is hoe het werkt, eenvoudig uitgelegd:

Het Probleem: De "Pijplijn" versus de "Gecombineerde" Aanpak

Voorheen probeerden computers dit op te lossen in twee aparte stappen (zoals een fabrieksassemblagelijn):

  1. Stap 1: Zoek alle namen van personen, groepen en tools (Named Entity Recognition).
  2. Stap 2: Kijk naar die namen en gok hoe ze met elkaar verbonden zijn (Relation Extraction).

Het Gebrek: Als Stap 1 een kleine fout maakt (zoals het verkeerd identificeren van een tool als een persoon), wordt die fout doorgegeven aan Stap 2, waardoor de hele kaart wordt verpest. Bovendien zijn zinnen in cyber-rapporten vaak rommelig. Een zin kan zeggen: "APT29 gebruikte Tool A om Bank X aan te vallen," maar impliceert ook "Tool A werd gebruikt door APT29." De computer raakt in de war over welke verbinding welke is, vooral wanneer dezelfde woorden in verschillende rollen voorkomen.

De Oplossing: TIJERE (Het "Expert-Detective" Systeem)

TIJERE verandert het spel door beide stappen tegelijkertijd uit te voeren in één geïntegreerd brein. Maar het vertrouwt niet alleen op ruwe tekst; het gebruikt drie slimme trucs om te handelen als een menselijke expert:

1. De "Expertkennis" Spiekbrief (Expert Domain Features)

Stel je voor dat je een zin leest: "APT29 gebruikte Mimikatz."

  • Een normale computer ziet "APT29" en "Mimikatz" als gewoon willekeurige woorden. Het zou kunnen denken dat "Mimikatz" een persoonsnaam is omdat het niet weet wat het is.
  • TIJERE heeft een speciale spiekbrief. Het weet dat "APT29" een Hackergroep is en "Mimikatz" een Tool.
  • De Analogie: Het is alsof je de computer een bril geeft die het type van elk object markeert. Zodra het "Hackergroep" en "Tool" ziet, weet het direct dat de relatie waarschijnlijk "Gebruikt" is, omdat hackers tools gebruiken. Dit voorkomt dat de computer in de war raakt door dubbelzinnige woorden.

2. De "Markeerstift" (Entity Mask)

In een lange, complexe zin met veel namen is het moeilijk voor een computer om te weten welke twee namen met elkaar praten.

  • TIJERE gebruikt een digitale markeerstift. Wanneer het kijkt naar de verbinding tussen "APT29" en "Mimikatz", markeert het alleen die twee woorden en zet alles anders in de zin om in "achtergrondruis".
  • De Analogie: Het is alsof een leraar met een laserpointer op twee specifieke leerlingen in een volle klas wijst om hen een vraag te stellen, en iedereen anders negeert. Dit helpt de computer zich strikt te focussen op het relevante paar.

3. De "Meerdere Kopieën" Strategie (Multisequence Labeling)

Dit is de grootste innovatie van het artikel. Normaal gesproken leest een computer een zin één keer en probeert alle relaties tegelijkertijd te raden.

  • TIJERE neemt één zin en maakt afzonderlijke, aangepaste kopieën voor elk mogelijk paar items in die zin.
  • De Analogie: Stel je voor dat je een zin hebt met drie paren verdachten. In plaats van de computer te vragen om de hele puzzel in één keer op te lossen, maakt TIJERE drie aparte kopieën van de zin.
    • Kopie A zegt: "Hier is het paar (APT29, Mimikatz). Wat is hun relatie?"
    • Kopie B zegt: "Hier is het paar (APT29, Bank). Wat is hun relatie?"
    • Kopie C zegt: "Hier is het paar (Mimikatz, Bank). Wat is hun relatie?"
  • Door het probleem op te splitsen in deze kleinere, gefocuste vragen, raakt de computer niet meer overweldigd door "overlappende" relaties.

Het Speciale Woordenboek (SecureBERT+)

Cybersecurity-rapporten gebruiken een zeer specifieke taal (zoals "EternalBlue" of "Spear-phishing") die normale computers niet goed begrijpen. TIJERE gebruikt een speciale versie van een taalmodel genaamd SecureBERT+.

  • De Analogie: Denk hieraan als het trainen van de computer op een woordenboek dat specifiek is geschreven voor spionnen en hackers, in plaats van een standaard Engels woordenboek. Dit helpt het de "jargon" van de cyberwereld te begrijpen.

De Resultaten: Een Nieuwe Kaart en een Nieuwe Scorekaart

Om te bewijzen dat dit werkt, hebben de auteurs twee dingen gedaan:

  1. Ze bouwden een nieuwe dataset (DNRTI-JE): Ze namen bestaande rapporten en labelden deze handmatig met zowel de namen als de relaties. Dit is de eerste keer dat zo'n "gezamenlijk gelabelde" dataset openbaar is gemaakt voor cybersecurity.
  2. Ze testten het model: Toen ze TIJERE tegen andere methoden lieten testen, was het een duidelijke winnaar.
    • Het identificeerde namen (Entiteiten) 93% van de tijd correct.
    • Het identificeerde relaties 98% van de tijd correct.

Samenvatting

Denk aan TIJERE als een superkrachtige detective die niet alleen het rapport leest; het begrijpt de typen betrokken personages, gebruikt een markeerstift om zich te focussen op de juiste paren, en splitst complexe zinnen op in eenvoudige, één-op-één interviews. Door dit te combineren met een gespecialiseerd "hackerswoordenboek", bouwt het een veel nauwkeurigere kaart van cyberbedreigingen dan ooit tevoren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →