Seclens: Role-specific Evaluation of LLM's for security vulnerablity detection
Het paper introduceert SecLens-R, een nieuw evaluatiekader voor het detecteren van kwetsbaarheden door LLM's dat prestaties meet aan de hand van rol-specifieke prioriteiten van verschillende belanghebbenden in plaats van één enkel geaggregeerd cijfer.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je op zoek bent naar de perfecte veiligheidscontroleur voor je bedrijf. Je hebt een enorme lijst met kandidaten (de AI-modellen) en je wilt weten wie de beste is.
Tot nu toe keken bedrijven naar één enkel cijfer op een ranglijst, net als bij een schoolrapport. "Deze AI heeft een 8, die heeft een 7." Maar in de echte wereld werkt dat niet zo goed. Waarom? Omdat iedereen in het bedrijf een heel ander doel heeft.
Dit paper, getiteld SecLens, zegt: "Stop met kijken naar één cijfer. Kijk naar wie er kijkt."
Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen.
1. Het Probleem: De "Één Cijfer" Valstrik
Stel je voor dat je een auto wilt kopen.
- De veiligheidsinspecteur (de CISO) wil een auto die nooit crasht, zelfs niet als je tegen een muur rijdt. Hij wil geen enkele kans op een ongeluk.
- De financiële controller (de Chief AI Officer) wil een auto die zuinig is, niet te duur in onderhoud en snel genoeg is om op tijd op het werk te komen.
- De chauffeur (de Hoofd Engineering) wil een auto die makkelijk te besturen is, niet te veel waarschuwingen geeft (geen valse alarmen) en snel reageert.
Als je nu kijkt naar één "algemeen cijfer" voor de auto, zou je misschien denken dat de snelste auto de beste is. Maar voor de veiligheidsinspecteur is die snelste auto misschien gevaarlijk omdat hij te vaak crasht. Voor de chauffeur is een auto die te vaak remt (veel valse alarmen) een hel.
SecLens zegt: "We moeten voor elke persoon een eigen rapport maken."
2. De Oplossing: De "SecLens" Brillen
De auteurs hebben een nieuw systeem bedacht, genaamd SecLens-R. Stel je voor dat dit een set van vijf verschillende brillen is. Als je door een andere bril kijkt, zie je een heel ander beeld van dezelfde AI.
Ze hebben 5 rollen gedefinieerd, elk met hun eigen "bril":
De CISO (De Hoofdveiligheidsman):
- Zijn vraag: "Kan ik dit vertrouwen? Ziet hij de dodelijke gevaren?"
- Zijn bril: Hij kijkt alleen naar gevaarlijke fouten. Als de AI één kritieke beveiligingslek mist, is hij ontevreden. Hij vindt het niet erg als de AI soms roept dat er een probleem is waar er geen is (een valse alarm), zolang hij maar niets mist.
- Vergelijking: Hij is als een brandweerman die liever 10 keer uitrukt voor een nep-brand dan één keer te laat komt bij een echt vuur.
De Hoofd Engineering (De Chef van de Programmeurs):
- Zijn vraag: "Helpt dit mijn team of vertraagt het hen?"
- Zijn bril: Hij haat valse alarmen. Als de AI elke regel code als "gevaarlijk" markeert, stoppen de programmeurs met werken. Hij wil een AI die alleen roept als het echt nodig is, snel werkt en goedkoop is.
- Vergelijking: Hij is als een chef-kok die een kok wil die niet elke minuut schreeuwt "Er is vuur!", maar wel precies weet waar het vuur is als het er echt is.
De Chief AI Officer (De Strategische Baas):
- Zijn vraag: "Is dit slim en betaalbaar?"
- Zijn bril: Hij kijkt naar de balans tussen kwaliteit en prijs. Kan de AI zelfstandig werken zonder te crashen? Is het geld het waard?
De Onderzoeker:
- Zijn vraag: "Begrijpt deze AI waarom het een fout is?"
- Zijn bril: Hij wil diep in de techniek duiken. Hij wil weten of de AI de juiste naam voor het probleem kan geven en of zijn redenering klopt.
De AI als Acteur (De Robot-test):
- Zijn vraag: "Kan deze AI zelfstandig werken zonder vast te lopen?"
- Zijn bril: Hij test of de AI zijn instructies goed volgt en niet in paniek raakt als het moeilijk wordt.
3. Het Grote Verassing: Hetzelfde Model, Verschillende Scores
De auteurs hebben 12 van de slimste AI-modellen getest op 406 beveiligingstaken. Het resultaat was verbazingwekkend: Hetzelfde model kan een A krijgen voor de ene rol en een D voor de andere.
Voorbeeld 1: GPT-5.4
- Voor de Hoofd Engineering krijgt hij een A (76.7). Waarom? Omdat hij heel voorzichtig is. Hij zegt zelden dat er een fout is, maar als hij het zegt, is het bijna altijd waar. Geen valse alarmen!
- Voor de CISO krijgt hij een D (48.4). Waarom? Omdat hij te voorzichtig is. Hij mist veel echte, gevaarlijke lekken. Voor de veiligheidsman is dat een ramp.
Voorbeeld 2: Qwen3-Coder
- Voor de Hoofd Engineering een A (76.3).
- Voor de CISO een D (45.2).
- Conclusie: Deze AI is een "stilte-keeper". Hij roept niet veel, maar mist daardoor de grote gevaren.
Voorbeeld 3: Claude Haiku 4.5
- Deze staat niet bovenaan de algemene ranglijst (8e plek), maar scoort 2e voor de CISO (71.2). Waarom? Omdat hij heel goed is in het vinden van alle soorten gevaren, zelfs de rare en gevaarlijke. Hij mist bijna niets.
4. De Les voor Bedrijven
De belangrijkste boodschap van dit paper is: Er bestaat geen "beste" AI.
Als je een AI kiest voor je beveiliging, moet je eerst vragen: "Wie gaat er naar het rapport kijken?"
- Wil je dat je programmeurs niet gestoord worden? Kies dan een AI die een hoge score heeft voor de Hoofd Engineering.
- Wil je dat er geen enkele hack mogelijk is? Kies dan een AI met een hoge score voor de CISO, ook al kost dat wat meer tijd en geld.
Samenvatting in één zin
Net zoals je niet dezelfde auto koopt voor een racewedstrijd als voor een gezinsvakantie, moet je ook niet dezelfde AI kiezen voor beveiliging als voor snelle code-checks; SecLens helpt je de juiste auto te kiezen voor de juiste bestuurder.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.