← Nieuwste papers
💬 NLP

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

Dit artikel introduceert ExCyTIn-Bench, de eerste benchmark die is ontworpen om LLM-agenten te evalueren op cyberdreigingsonderzoek door 7.542 vragen te genereren op basis van Microsoft Sentinel-logbestanden en onderzoeksgrafieken, waarbij wordt aangetoond dat de huidige topmodellen slechts een beloningscore van 0,606 bereiken en dat er aanzienlijke ruimte is voor toekomstige verbetering.

Oorspronkelijke auteurs: Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

Gepubliceerd 2026-05-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Geheel: Een Nieuwe "Rijexamen" voor AI-Detectives

Stel je voor dat je een vloot van zeer slimme, nieuwe AI-robots hebt. Je wilt weten of ze goed genoeg zijn om cybersecurity-detectives te worden. Kunnen ze een berg rommelige data bekijken, de slechteriken vinden en precies uitzoeken wat er tijdens een hack is gebeurd?

De auteurs van dit paper zeggen: "We kunnen ze niet zomaar trivia-vragen stellen zoals 'Wat is een virus?', want dat test alleen hun geheugen. We moeten zien of ze het werk daadwerkelijk kunnen doen."

Dus bouwden ze ExCyTIn-Bench. Denk hierbij aan een hoog-risico rijexamen voor AI-agenten. In plaats van een auto bestuurt de AI door een digitale misdaadplek. In plaats van een testcircuit is het een gesimuleerd computernetwerk van een bedrijf, gevuld met nep (maar realistische) beveiligingslogs.

Hoe Ze De Test Bouwden (De "Misdaadplek")

Om de test eerlijk en realistisch te maken, verzonnen de onderzoekers niet zomaar willekeurige vragen. Ze bouwden de test in drie stappen:

  1. De Misdaadplek (De Data): Ze richtten een nep-Microsoft Azure-bedrijf op genaamd "Alpine Ski House". Ze simuleerden 8 verschillende cyberaanvallen die in het echt hebben plaatsgevonden (zoals ransomware of e-mailoplichting). Ze verzamelden 57 verschillende tabellen met logs (zoals politierapporten, telefoonregistraties en beveiligingscamera-beelden) met duizenden vermeldingen.
  2. De Kaart (De Grafiek): Wanneer een menselijke detective onderzoek doet, kijkt hij niet naar alles tegelijk. Hij volgt een spoor: Waarschuwing A leidt naar Gebruiker B, wat leidt naar Verdacht Bestand C. De onderzoekers zetten deze sporen om in een kaart (een grafiek).
    • De Knopen: De kaart heeft stippen die "Waarschuwingen" (de politiesirenes) en "Entiteiten" (de mensen of computers die betrokken zijn) voorstellen.
    • De Randen: De lijnen die ze verbinden, tonen hoe ze met elkaar samenhangen.
  3. De Vragen (Het Examen): In plaats van dat een mens vragen schrijft, gebruikten ze een AI om naar deze kaart te kijken en 7.542 vragen te genereren.
    • Voorbeeld: "We zagen een verdachte login vanaf IP-adres X. Op basis van de kaart, welk bestand gebruikte de hacker om wachtwoorden te stelen?"
    • De AI-agent moet het antwoord vinden door langs de lijnen van de kaart te "rijden", de database te bevragen en de stippen met elkaar te verbinden.

Hoe De AI Het Examen Doet

De AI-agent wordt geplaatst in een MySQL-database-omgeving (een gigantisch archiefkabinet). Het kent de indeling van het kabinet niet. Het moet:

  1. Om de kaart vragen: "Welke tabellen heb je?"
  2. De aanwijzingen lezen: "Laat me de logs voor dit IP-adres zien."
  3. De stippen verbinden: "Oké, dat IP-adres is gekoppeld aan deze gebruiker. Laat me controleren wat die gebruiker heeft gedaan."
  4. Het antwoord indienen: "De hacker gebruikte het bestand ntdsutil.exe."

Als de AI het antwoord goed heeft, krijgt hij een punt. Als hij vastloopt of de verkeerde vragen stelt, krijgt hij een lagere score. De test geeft zelfs deels punten als de AI enkele aanwijzingen vindt maar niet het uiteindelijke antwoord, net als een leraar die punten geeft voor het tonen van je werk.

Wat Ze Vonden (De Resultaten)

De onderzoekers testten veel verschillende AI-modellen (van grote bedrijven zoals OpenAI, Google en Anthropic, evenals open-source modellen) op deze test.

  • Het is Moeilijk: Zelfs de slimste AI-modellen hadden moeite. Het beste model (Claude-Opus-4.5) haalde slechts een score van 0,606 (op 1,0). Dit betekent dat er nog veel ruimte is voor verbetering.
  • Het "Aha!"-moment: De AI-modellen die het beste presteerden, waren degene die stap-voor-stap konden redeneren. Ze gokten niet zomaar; ze verkennden de database, realiseerden zich dat hun eerste gok verkeerd was en probeerden een nieuw pad, net als een menselijke detective.
  • Open Source vs. Grote Tech: Verrassend genoeg presteerden sommige kleinere, open-source modellen bijna even goed als de enorme, dure modellen, wat aantoont dat de kloof kleiner wordt.

Waarom Dit Belangrijk Is

Het paper beweert dat dit de eerste benchmark van deze soort is. Voorheen testten we AI voornamelijk op hoe goed het cybersecurity-feiten uit het hoofd kon leren. Nu hebben we een manier om te testen of AI een misdaad daadwerkelijk kan onderzoeken door bewijsmateriaal te sorteren en een complexe keten van gebeurtenissen te doorgronden.

Kortom: De auteurs bouwden een realistische "misdaadplek" en een set "detective-puzzels" om te zien of AI-agenten kunnen leren cybersecurity-onderzoekers te worden. De resultaten tonen aan dat AI weliswaar beter wordt, maar nog een lange weg te gaan heeft voordat het menselijke beveiligingsanalisten kan vervangen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →