← Nieuwste papers
💬 NLP

Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations

Dit artikel introduceert AuditBench, een uitgebreide benchmark-dataset die meer dan 50 beveiligingsscenario's op Linux- en Windows-systemen beslaat, om de prestaties, foutprofielen en verklarende vermogens van vijf grensverleggende LLM's over vier kritieke incidentrespons-taken te evalueren en te analyseren.

Oorspronkelijke auteurs: Aniket Anand, Yiwei Hou, Daniel Fields, Alex Kantchelian, David Tao, Kurt Thomas, Grant Ho

Gepubliceerd 2026-06-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Aniket Anand, Yiwei Hou, Daniel Fields, Alex Kantchelian, David Tao, Kurt Thomas, Grant Ho

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de hoofd van de beveiliging bent van een enorme, bruisende stad. Elke dag registreren duizenden camera's en sensoren (de zogenaamde audit logs) elke voetstap, elke geopende deur en elke startende automotor. Meestal zijn mensen gewoon onderweg naar hun werk of aan het boodschappen doen (onschuldige activiteit). Maar soms sluipt er een dief naar binnen, kraakt hij een slot of steelt hij een kluis (een aanval).

Het probleem? De stad genereert zoveel data dat menselijke beveiligers niet alles kunnen bewaken. Ze raken overweldigd door valse alarmen en missen echte misdaden in de ruis.

Maak kennis met Large Language Models (LLMs). Zie deze als superintelligente, onvermoeibare detective-stagiairs die in enkele seconden miljoenen pagina's aan logs kunnen lezen. Maar voordat we ze aannemen, moeten we weten: Zijn ze echt goed in het oplossen van misdaden, of raken ze in paniek en beschuldigen ze onschuldige mensen?

Dit artikel introduceert AuditBench, een "eindexamen" dat specifiek is ontworpen om deze AI-detectives te testen op hun vermogen om beveiligingslogs te onderzoeken.

Het Examen: AuditBench

De onderzoekers hebben een testpakket gebouwd met 51 verschillende scenario's.

  • De "Klas" (Lab Data): Ze creëerden 25 fictieve scenario's op virtuele computers, waarbij alles werd gesimuleerd van een hacker die bestanden steelt tot een normale gebruiker die simpelweg software installeert.
  • De "Echte Wereld" (OpTC Data): Ze namen 26 complexe scenario's uit een enorme, real-world dataset (DARPA OpTC) die al over een bekende "ground truth" (het antwoordmodel) beschikte.

Het examen bestond uit vier hoofdtaken, als een checklist voor een detective:

  1. De Triage (Classificatie): "Is dit alarm een echte misdaad of een vals alarm?"
  2. De Schuilplaats (Persistentie): "Heeft de crimineel een geheime achterdeur opgezet om voor altijd in het systeem te blijven?"
  3. De Ontsnappingsroute (Laterale Beweging): "Is de crimineel van de ene computer naar de andere gesprongen om de infectie te verspreiden?"
  4. De Roof (Data-exfiltratie): "Heeft de crimineel gevoelige bestanden gestolen en naar buiten verzonden?"

De Resultaten: Wat de AI wel (en niet) goed deed

De onderzoekers testten vijf top-tier AI-modellen (inclusief reuzen zoals GPT-5 en Gemini 2.5 Pro) tegen dit examen. Hier is wat ze vonden, vertaald naar alledaagse termen:

1. Het probleem van de "Paranoïde Detective"
De meeste AI-detectives waren overdreven achterdochtig. Ze waren als een beveiliger die iemand met een tas ziet en er direct van uitgaat dat het een bom is.

  • Het resultaat: De AI's waren erg goed in het opsporen van de "Roof" (het stelen van data), maar erg slecht in het negeren van onschuldige mensen. Ze markeerden een enorme hoeveelheid normale activiteit als "aanvallen", wat zorgde voor een vloedgolf aan valse alarmen.

2. Groter is niet altijd beter
Je zou denken dat de grootste, duurste AI-modellen de beste detectives zouden zijn. Verrassend genoeg was dat niet altijd het geval.

  • Het resultand: Soms presteerden de kleinere, goedkopere modellen net zo goed, of zelfs beter, dan de enorme modellen. Het blijkt dat je voor deze specifieke taak niet altijd een supercomputer nodig hebt; een slim, compact model kan de klus ook klaren.

3. De taal van de logs maakt uit
De onderzoekers voerden de AI de logs op twee manieren:

  • Ruwe Logs: Het rommelige, ongeëditeerde transcript van alles wat er is gebeurd (zoals een ruwe audio-opname van een chaotische kamer).
  • Edge Representation: Een opgeschoonde, samengevatte versie die de verbanden tussen gebeurtenissen benadrukt (zoals een whiteboard van een detective met touwtjes die verdachten met elkaar verbinden).
  • Het resultaat: Voor sommige modellen maakte de "opgeschoonde" versie hen veel slimmer en sneller. Voor anderen was de ruwe data prima. Het hangt af van de "leerstijl" van het model.

4. De "Prompt" is de instructiehandleiding
Hoe je de AI een vraag stelt, verandert het antwoord. De onderzoekers probeerden twee verschillende manieren om de instructies (prompts) te schrijven.

  • Het resultaat: Een prompt die één AI-detective briljant maakte, kon een andere AI onhandig maken. Er is geen "one-size-fits-all" instructiehandleiding. Je moet de instructies afstemmen op de specifieke AI die je gebruikt.

5. De "Redenering" van de AI was vaak goed
Wanneer de AI wel een echte aanval correct detecteerde, was de uitleg meestal uitstekend. De AI kon precies aanwijzen welk bestand of welk commando het bewijs van de misdaad vormde.

  • De adder onder het gras: Wanneer de AI het fout had (de valse alarmen), was de redenering vaak gebaseerd op vreemde namen of hoog volume.
    • Voorbeeld: Als een bestand de naam delete_logs.bat had, nam de AI aan dat het een crimineel was die bewijsmateriaal probeerde te wissen, zelfs als het gewoon een normaal systeemonderhoudsscript was.
    • Voorbeeld: Als een programma 1.000 keer per seconde draaide, dacht de AI: "Dat is verdacht!", zelfs als het gewoon een normale software-update was.

De Belangrijkste Conclusie

Dit artikel zegt niet: "AI kan beveiligingsteams nog niet vervangen." In plaats daarvan zegt het: "Hier is een liniaal om te meten hoe goed AI is bij deze taak, en dit zijn de vallen om te vermijden."

  • Voor beveiligingsteams: Koop niet zomaar de duurste AI. Test kleinere modellen. Wees voorzichtig met de "paranoïde" neiging die valse alarmen creëert.
  • Voor AI-ontwikkelaars: Ga er niet vanuit dat grotere modellen altijd beter zijn. Je moet misschien de manier waarop je data aan hen voert (de "Edge" representatie) veranderen of je instructies (prompts) aanpassen om het beste resultaat te krijgen.
  • Voor iedereen: De AI is een krachtig hulpmiddel, maar er is een mens nodig om het werk te controleren, vooral wanneer de AI te achterdochtig wordt tegenover onschuldige mensen.

De onderzoekers stellen al hun data, code en examenvragen beschikbaar aan het publiek, zodat anderen deze digitale detectives kunnen blijven testen en verbeteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →