← Nieuwste papers
💻 computer science

RealVuln: Benchmarking Rule-Based, General-Purpose LLM, and Security-Specialized Scanners on Real-World Code

Dit paper introduceert RealVuln, het eerste open-source benchmark dat regelgebaseerde SAST-tools, algemene LLM's en gespecialiseerde beveiligingsscanners vergelijkt op echte kwetsbaarheden in Python-code, waarbij gespecialiseerde scanners zoals Kolega.Dev en geavanceerde LLM's zoals Claude Sonnet 4.6 significant beter presteren dan traditionele regelgebaseerde tools.

Oorspronkelijke auteurs: John Pellew, Faizan Raza

Gepubliceerd 2026-04-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: John Pellew, Faizan Raza

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De RealVuln-test: Wie is de beste 'veiligheidscontroleur' voor computercode?

Stel je voor dat je een enorme bibliotheek bouwt. In deze bibliotheek staan boeken (computerprogramma's) vol met verborgen valkuilen: deuren die op slot kunnen blijven, ramen die niet dichtgaan, en geheime gangen waar inbrekers doorheen kunnen komen.

De vraag is: Wie is de beste bewaker om al deze gevaarlijke plekken te vinden?

Dit is precies wat het nieuwe onderzoek RealVuln heeft onderzocht. De onderzoekers hebben een grote test gehouden om te kijken welke van de drie soorten 'bewakers' het beste werkt in de echte wereld.

Hier is hoe de test eruitzag, vertaald naar begrijpelijke taal:

1. De Drie Teams van Bewakers

De onderzoekers hebben 15 verschillende bewakers uitgenodigd om dezelfde bibliotheek te inspecteren. Ze werden in drie teams verdeeld:

  • Team 1: De Regel-Checkers (De oude school)

    • Hoe ze werken: Dit zijn de klassieke scanners. Ze hebben een lijstje met regels: "Als je de zin 'open deur' ziet, is dat gevaarlijk." Ze kijken niet echt naar de betekenis, ze zoeken alleen naar specifieke patronen.
    • Analogie: Het is alsof ze een zoektocht doen met een vergrootglas, maar ze zoeken alleen naar de letters "Gevaar". Als de tekst "Gevaar" niet in de zin staat, maar de deur toch open staat, zien ze het niet.
    • Resultaat: Ze vonden heel weinig. Ze waren te star.
  • Team 2: De Slimme Algemene Genieën (De AI's)

    • Hoe ze werken: Dit zijn de grote, algemene kunstmatige intelligenties (zoals Claude of Gemini). Ze zijn niet specifiek getraind om hackers te stoppen, maar ze zijn heel slim in het begrijpen van taal en context. Ze lezen de code alsof het een verhaal is.
    • Analogie: Dit zijn super-intelligente bibliothecarissen die alles begrijpen. Ze kunnen zien: "Oh, deze deur is open, zelfs als er niet staat 'open deur'." Ze zijn veel slimmer dan Team 1.
    • Resultaat: Ze deden het veel beter dan Team 1, maar ze maakten soms nog fouten of misten nog steeds een paar gevaarlijke plekken.
  • Team 3: De Gespecialiseerde Veiligheidsexperts (De Nieuwe Kool)

    • Hoe ze werken: Dit zijn AI-systemen die specifiek zijn gebouwd voor beveiliging. Ze gebruiken de slimheid van de grote AI's, maar ze hebben ook een speciaal gereedschapskistje en een plan dat alleen gericht is op het vinden van hackers.
    • Analogie: Dit zijn de professionele brandweermannen die niet alleen slim zijn, maar ook precies weten waar brand kan ontstaan, zelfs als het er niet uitziet als een brand. Ze hebben een speciale training voor dit ene doel.
    • Resultaat: Dit team won de wedstrijd met afstand. Ze vonden het meeste, zelfs de lastigste valkuilen.

2. De Grote Test (De Bibliotheek)

Om eerlijk te zijn, hebben ze geen willekeurige bibliotheek gebruikt. Ze hebben 26 bibliotheken genomen die opzettelijk vol zaten met valkuilen (zoals een "Capture The Flag" spel voor hackers).

  • Er zaten 676 echte gevaren in.
  • Er zaten ook 120 nep-gevaren in (plekken die er gevaarlijk uitzagen, maar veilig waren). Dit was een valstrik: als een bewaker hierop reageerde, maakte hij een fout (een "vals alarm").

3. De Uitslag: Wat was het resultaat?

De onderzoekers keken niet alleen naar wie het meeste vond, maar ook naar wie de minste fouten maakte. Ze gaven de winnaars een score.

  • De Winnaar: Het gespecialiseerde team (Kolega.Dev) won met een score van 73. Ze vonden 80% van alle gevaren. Ze maakten wel wat meer vals alarm dan de anderen, maar in de beveiliging is het beter om te veel te controleren dan één echte hacker te missen.
  • De Runner-up: De slimme algemene AI's (Claude Sonnet) kwamen op de tweede plaats met een score van 52. Ze vonden ongeveer de helft van de gevaren.
  • De Laatste: De oude regel-checkers (Semgrep en anderen) scoorden rond de 17. Ze vonden maar een klein beetje van de gevaren.

De belangrijkste les:
De oude manier van werken (alleen zoeken naar patronen) is niet meer genoeg. Algemene slimme AI's zijn een grote stap vooruit, maar de allerbeste resultaten krijg je alleen als je AI's specifiek bouwt voor beveiliging.

4. Waarom is dit belangrijk voor jou?

Stel je voor dat je een huis bouwt.

  • Team 1 kijkt alleen of de ramen dicht zijn. Als de deur openstaat, zien ze het niet.
  • Team 2 kijkt naar het hele huis en zegt: "Hier lijkt het wel open." Maar ze missen soms de kelderdeur.
  • Team 3 is een professionele beveiligingsinspecteur die elke hoek, elke kier en elke sleutel controleert.

De onderzoekers zeggen: "Als je echt veilig wilt zijn, moet je Team 3 gebruiken."

5. Een eerlijke wedstrijd

Een van de coolste dingen aan dit onderzoek is dat het eerlijk was.

  • De onderzoekers hebben alles openbaar gemaakt: de code, de antwoorden en de regels.
  • Zelfs een van de onderzoekers werkt voor het winnende bedrijf (Kolega), maar ze hebben alles openbaar gemaakt zodat iedereen kan controleren of ze niet bedrogen hebben.
  • Ze hebben een live dashboard gemaakt (een soort scorebord op internet) waar iedereen kan zien hoe de bewakers het doen.

Conclusie

De boodschap is simpel: Beveiliging is te belangrijk om het aan oude regels of algemene slimme computers over te laten. We hebben speciale beveiligings-experts nodig die slim genoeg zijn om de hele context te begrijpen, maar die ook weten waar ze moeten zoeken.

Dit onderzoek is als een startlijn voor de toekomst: het laat zien wie er nu wint, maar het nodigt ook uit om de test te verbeteren en nieuwe bewakers toe te voegen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →