← Nieuwste papers
💻 computer science

OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection

Dit paper introduceert OrgForge-IT, een verifieerbaar synthetisch benchmark voor het detecteren van interne bedreigingen door LLM's, dat middels een deterministische simulatie-engine cross-artifact inconsistenties oplost en inzicht biedt in de prestaties van modellen via een uitgebreide leaderboard en analyse.

Oorspronkelijke auteurs: Jeffrey Flynt

Gepubliceerd 2026-03-25
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jeffrey Flynt

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🕵️‍♂️ De Grote Uitdaging: Het Vinden van de Naald in de Hooiberg

Stel je voor dat je een gigantische berg hooi hebt (dat is de data van een groot bedrijf: e-mails, inlogpogingen, Slack-berichten). Ergens in die berg zit een naald (een bedreiging, zoals een hacker of een boze werknemer).

Vroeger hadden onderzoekers een oude kaart van zo'n hooiberg (de CERT-dataset). Maar die kaart had twee grote problemen:

  1. Hij was verouderd: Hij toonde alleen oude hooibergen, niet de moderne, digitale ones van vandaag.
  2. Hij was onbetrouwbaar: Omdat de kaart zelf door een computer was bedacht, konden er fouten in staan. Bijvoorbeeld: op de kaart staat dat iemand om 03:00 uur een deur opendeed, maar in de logboeken staat dat die deur om 09:00 uur open was. Dit soort tegenstrijdigheden maken het moeilijk om te weten wie de "goede" kaart is.

🏗️ De Oplossing: OrgForge-IT (De Perfecte Simulatie)

De auteur, Jeffrey Flynt, heeft iets nieuws gebouwd: OrgForge-IT.

In plaats van een computer te laten "dromen" over wat er gebeurt, heeft hij een onfeilbare regisseur (een deterministische engine) gemaakt.

  • De Regisseur: Deze regisseur weet exact wat er gebeurt. Hij schrijft de feiten op in een geheim boekje (de Ground Truth).
  • De Acteurs: De AI-modellen (de grote taalmodellen) spelen alleen de rollen. Ze schrijven de dialogen (Slack-berichten, e-mails) op basis van wat de regisseur heeft beslist.

De analogie: Stel je voor dat je een film draait. De regisseur (de engine) bepaalt dat de schurk om 14:00 uur de kluis openbreekt. De acteurs (de AI) schrijven daarover een script. Omdat de regisseur het script heeft bedacht, weet je 100% zeker dat de schurk echt om 14:00 uur de kluis openbrak. Er zijn geen fouten of tegenstrijdigheden. Dit maakt OrgForge-IT de eerste "eerlijke" testomgeving voor AI in beveiliging.

🎭 Het Toneelstuk: Vier Lastige Trucs

De test bevat vier specifieke scenario's die slimme AI's moeten oplossen, maar die domme AI's (of menselijke bewakers) vaak laten vallen:

  1. De Spookinlog (Ghost Login): Iemand logt in, maar doet daarna niets. Geen e-mail, geen bestand geopend.
    • De valstrik: De AI moet niet kijken naar wat er wel gebeurt, maar naar wat er niet gebeurt. "Iemand logde in, maar werkte niet. Dat is verdacht."
  2. De Vishing-aanval (Telefoonbedrog): Een hacker belt iemand (Chris) en doet zich voor als de IT-afdeling. Chris geeft zijn wachtwoord op. De hacker logt dan in op het account van Chris.
    • De valstrik: De AI moet zien dat Chris slachtoffer is, niet de dader. Veel AI's denken: "Er is iets raars gebeurd op Chris' account, dus Chris is de boosdoener." De slimme AI's zien: "Nee, Chris is het slachtoffer; de hacker is de boosdoener."
  3. De Drie-Fase Diefstal: Een hacker steelt data in drie stappen over drie dagen: 1. Bestanden kopiëren, 2. In een zip-bestand doen, 3. Naar een cloud-dienst sturen.
    • De valstrik: Als je alleen naar één dag kijkt, zie je niets. Je moet de hele week in één oogopslag kunnen zien om het patroon te herkennen.
  4. Vertrouwen Opbouwen: Een hacker stuurt eerst een vriendelijke e-mail om contact te leggen. Pas dagen later komt de aanval.
    • De valstrik: De AI moet het geheugen hebben om de vriendelijke e-mail van vandaag te koppelen aan de aanval van overmorgen.

🏆 De Wedstrijd: De Top 10 AI's

De auteur heeft 10 verschillende AI-modellen (zoals Claude, Llama, Mistral, Devstral) laten spelen in deze test. Het resultaat was verrassend:

  1. De "Triage" (De eerste filter): Alle AI's waren ongeveer even goed in het vinden van verdachte mensen. Ze zeiden allemaal: "Hey, hier is iets raars aan de hand."
  2. De "Verdict" (Het oordeel): Hier viel het verschil.
    • Groep A (De Slimme): Deze AI's (zoals Devstral en Claude Opus) keken goed naar de details. Ze zagen dat Chris het slachtoffer was en zeiden: "Chris is onschuldig, de hacker is de schuldige."
    • Groep B (De Gemiddelde): Deze AI's zagen ook dat er iets raars was, maar zeiden: "Chris is verdacht!" Ze maakten een fout in het toewijzen van de schuld.

⚠️ Het Grootste Probleem: Te Veel Valse Alarmen

Dit is misschien wel het belangrijkste punt van het paper:
Stel je voor dat je een alarm hebt dat elke dag 40 keer afgaat, terwijl er niemand is. Dat is nutteloos, zelfs als het soms wel een inbreker detecteert.

  • De beste AI's gaven maar 1 of 2 valse alarmen.
  • Slechte AI's (zoals Llama 3.3) gaven 41 valse alarmen op dezelfde hoeveelheid echte bedreigingen.

Conclusie: Een AI die 100% van de misdaden oplost, maar ook 40 onschuldige mensen per dag opsluit, is een slechte beveiligingsagent. Je hebt een agent nodig die niet alleen slim is, maar ook nauwkeurig is.

🧠 De Leerlessen voor de Toekomst

  1. Oordeel is belangrijker dan detectie: Het vinden van een probleem is makkelijk; het begrijpen wie er schuldig is, is moeilijk.
  2. De context is koning: AI's moeten kunnen kijken over meerdere dagen en verschillende bronnen heen (e-mail + telefoon + inloggegevens).
  3. De "Vocabulaire-val": Als je een AI vraagt om een lijst met "verdachte gedragingen" te maken, en je gebruikt een heel strakke lijst met specifieke woorden, doet de AI het goed. Geef je de AI een vrijere opdracht ("Vertel me wat er mis is"), dan gebruikt hij andere woorden. De test scoort dan "fout", terwijl de AI het eigenlijk wel goed begrepen had. Het paper pleit daarom voor een betere manier van scoren die ook de betekenis bekijkt, niet alleen de exacte woorden.

🚀 Samenvatting

OrgForge-IT is een eerlijk, foutloos toneelstuk dat is bedacht door een regisseur, waarin AI's hun detective-vaardigheden kunnen bewijzen. Het laat zien dat veel AI's goed zijn in het zien van verdachte activiteiten, maar vaak falen in het begrijpen van wie de echte dader is en wie het slachtoffer. En het waarschuwt: een AI die te veel valse alarmen geeft, is in de echte wereld onbruikbaar, hoe slim hij ook lijkt.

Het paper is open source, dus iedereen kan deze "testbaan" gebruiken om hun eigen beveiligings-AI's te trainen en te testen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →