CTIConnect: A Benchmark for Retrieval-Augmented LLMs over Heterogeneous Cyber Threat Intelligence
Dit artikel introduceert CTIConnect, een uitgebreide benchmark en evaluatieharness die is ontworpen om retrieval-augmented LLM's systematisch te beoordelen over negen heterogene Cyber Threat Intelligence-taken, waarbij wordt onthuld dat effectieve prestaties domeinspecifieke structurele interventies vereisen in plaats van generieke retrieval-verbeteringen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een cybersecurity-detective bent die een complexe misdaad probeert op te lossen. Je hebt een enorme bibliotheek aan aanwijzingen, maar ze zijn geschreven in vijf totaal verschillende talen en formaten: sommige zijn rigide, technische spreadsheets (zoals een database van softwarebugs), terwijl andere lange, rommelige nieuwsartikelen zijn geschreven door verschillende verslaggevers die straattaal en bijnamen gebruiken voor dezelfde criminelen.
Dit is de wereld van Cyber Threat Intelligence (CTI). Het probleem is dat er te veel informatie is voor een mens om handmatig te kunnen lezen en de verbanden te leggen.
Maak kennis met Large Language Models (LLMs). Zie deze AI-modellen als briljante, supersnelle detectives die bijna alles kunnen lezen en begrijpen. Maar er is een addertje onder het gras: deze AI's hebben een "geheugenlimiet". Ze kunnen niet elke nieuwe dreigingsrapportage die dagelijks naar buiten komt uit het hoofd leren. Als je ze een vraag stelt over een gloednieuwe virus, kunnen ze het fout raden omdat ze het laatste rapport nog niet hebben "gelezen".
Om dit op te lossen, gebruiken we Retrieval-Augmented Generation (RAG). Dit is alsof je de AI-detective een magische bibliotheekkaart geeft. Wanneer er een vraag wordt gesteld, rent de AI eerst naar de bibliotheek, pakt de meest relevante documenten, en geeft daarna antwoord op basis van wat hij zojuist heeft gelezen.
Het Probleem: De "Lost in Translation"-kloof
De auteurs van dit paper, CTIConnect, ontdekten dat het simpelweg geven van een bibliotheekkaart aan de AI niet genoeg is. De bibliotheek is een puinhoop.
- Het Vocabulaire-mismatch: Het ene document noemt een hackergroep misschien "APT29", terwijl een ander document hen "Cozy Bear" noemt, en een derde "Nobelium". Als je de AI vraagt om alle rapporten over "APT29" te vinden, kan een standaard zoekopdracht de rapporten missen die alleen die andere namen gebruiken.
- Het Formaat-mismatch: Het ene document zegt misschien "De aanvaller heeft wachtwoorden uit het geheugen gestolen", terwijl een technische database dit vermeldt als "T1003.001 – LSASS Memory". De AI begrijpt mogelijk niet dat dit hetzelfde ding is.
Het paper betoogt dat standaard zoekinstrumenten (die alleen zoeken naar vergelijkbare woorden) hier falen omdat ze deze kloven niet kunnen overbruggen. Ze zijn als een vertaler die alleen letterlijke woord-voor-woord vertalingen kent, maar de betekenis of de bijnamen niet begrijpt.
De Oplossing: CTIConnect
Het team heeft een nieuwe benchmark (een gestandaardiseerde test) gebouwd genaamd CTIConnect om te zien hoe goed AI-detectives presteren wanneer ze moeten zoeken in deze rommelige, meertalige bibliotheek.
Ze creëerden 1.860 door experts geverifieerde vragen die drie hoofdvormen van detectivewerk dekken:
Entity Linking (Verbanden leggen):
- De Taak: "Deze softwarebug (CVE) wordt veroorzaakt door welke specifieke zwakte (CWE)?"
- De Analogie: Het matchen van een specifiek automodel aan het type motor. De AI moet vertalen tussen twee verschillende technische catalogi.
- De Fix: De AI moet de vraag "vertalen" naar de exacte technische termen die de database gebruikt voordat hij gaat zoeken.
Entity Attribution (De dader benoemen):
- De Taak: "Een rapport zegt 'de slechteriken hebben bestanden versleuteld met een .cuba extensie'. Welke specifieke hacktechniek beschrijft dit?"
- De Analogie: Een getuigenbeschrijving lezen ("Hij droeg een rode hoed en rende snel") en dit matchen aan een politiebestand ("Verdachte: John Doe, bekend om hardlopen").
- De Fix: De AI moet de zin afbreken in kleine, atomaire acties en elke actie vertalen naar de officiële politiecode.
Multi-Document Synthesis (Het verhaal opbouwen):
- De Taak: "Combineer rapporten van vijf verschillende nieuwsbronnen om een profiel op te stellen van de hackergroep 'APT29'."
- De Analogie: Je hebt vijf verschillende getuigen die dezelfde partij beschrijven. De één noemt de gastheer "Bob", een ander "Bobby", en een derde "De Baas". De AI moet beseffen dat ze het allemaal over dezelfde persoon hebben en hun verhalen tot één tijdlijn combineren.
- De Fix: De AI moet slim genoeg zijn om te beseffen dat "Bob" = "Bobby" = "De Baas" is voordat hij begint met lezen.
Wat ze vonden
De onderzoekers testten 10 verschillende AI-modellen (zowel gratis/open-source als dure/proprietary modellen) met deze nieuwe test. Dit zijn hun belangrijkste ontdekkingen:
- Eén maat past niet iedereen: Een "one-size-fits-all" zoekstrategie faalde jammerlijk. De beste manier om naar een technische bug te zoeken (Entity Linking) is totaal anders dan de beste manier om naar een bijnaam van een hacker te zoeken (Multi-Document Synthesis).
- Gespecialiseerde tools winnen: Wanneer ze de AI gespecialiseerde strategieën gaven (zoals "vertaal de vraag eerst" of "breek de zin op in delen"), steeg de prestatie van de AI spectaculair—soms zelfs met 35%. Standaard zoekinstrumenten verbeterden de prestaties slechts een klein beetje (1-5%).
- De bottleneck verschuift:
- Voor technische koppelings-taken, lag het probleem bij het zoekinstrument. Zodra de AI het juiste document vond, kon zelfs een "kleinere" AI het correct beantwoorden.
- Voor benaming en verhaal-opbouw taken, lag het probleem bij het brein van de AI. Zelfs met de juiste documenten had de AI veel intelligentie nodig om de context te begrijpen en de aliassen te verbinden.
- Slimmer zoeken > Grotere breinen: Voor sommige taken werkte het gebruik van een "kleinere" AI met een gespecialiseerd zoekinstrument beter dan het gebruik van een "massieve, dure" AI met een basis zoekinstrument. Dit betekent dat je niet altijd de duurste AI nodig hebt; je hebt alleen de juiste manier nodig om informatie te vinden.
De Kernboodschap
Het paper concludeert dat om effectieve AI-beveiligingstools te bouwen, we niet alleen kunnen vertrouwen op grotere AI-modellen of generieke zoekmachines. We moeten gespecialiseerde retrieval-systemen bouwen die de unieke "dialecten" en "bijnamen" van de cybersecuritywereld begrijpen.
Denk er zo over na: je hebt geen grotere bibliotheek nodig om een misdaad op te lossen; je hebt een bibliothecaris nodig die precies weet hoe hij het juiste boek moet vinden, zelfs als de titel in een code is geschreven die jij niet spreekt. CTIConnect biedt de kaart en de test om die biblicaris te bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.