← Nieuwste papers
💻 computer science

Code-Augur: Agentic Vulnerability Detection via Specification Inference

Code-Augur is een nieuw agentisch kwetsbaarheidsdetectiekader dat de betrouwbaarheid en effectiviteit van autonome LLM's verbetert door expliciet beveiligingsspecificaties uit code af te leiden en deze continu te verfijnen door middel van runtime-falsificatie, waardoor kritieke kwetsbaarheden in real-world open-source projecten worden blootgelegd die andere methoden missen.

Oorspronkelijke auteurs: Zhengxiong Luo, Mehtab Zafar, Dylan Wolff, Abhik Roychoudhury

Gepubliceerd 2026-06-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhengxiong Luo, Mehtab Zafar, Dylan Wolff, Abhik Roychoudhury

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar licht overmoedige detective inhuurt om een enorme, complexe fabriek te inspecteren op veiligheidsrisico's. Deze detective is een AI-agent.

In het verleden, als deze AI-detective zei: "Deze machine is veilig," moest je hen op hun woord geloven. Je wist niet waarom ze dachten dat het veilig was, of welke aannames ze hadden gedaan. Als ze een verborgen gevaar misten omdat ze aannamen dat een onderdeel van staal was terwijl het eigenlijk van plastic was, zou je dat pas merken wanneer de machine ontplofte.

CODE-AUGUR is een nieuw systeem dat dit probleem oplost. Het verandert de manier waarop de AI-detective werkt door de detective te dwingen zijn aannames op te schrijven en ze vervolgens onmiddellijk te proberen te weerleggen.

Zo werkt het, onderverdeeld in eenvoudige stappen:

1. De detective schrijft een "Veiligheidsbelofte"

In plaats van alleen naar de code te kijken en "Veilig" of "Onveilig" te zeggen, is de AI-detective nu verplicht om een specifieke regel, of een Security Specification, te schrijven wanneer hij besluit dat een stuk code veilig is.

  • De Analogie: Stel je voor dat de detective naar een brug kijkt en zegt: "Deze brug is veilig." Onder het oude systeem was dat het einde van het verhaal. Onder CODE-AUGUR moet de detective een briefje op de brug plakken met de tekst: "Ik ga ervan uit dat deze brug 10 ton kan dragen."
  • Het Resultaat: Dit "briefje" is in feite een regel code (een assertion) die direct in de software is ingebed. Dit verandert het onzichtbare denkproces van de detective in een zichtbare, testbare regel.

2. De "Advocaat van de Duivel" probeert het te breken

Zodra de detective de regel heeft geschreven, wordt er een tweede hulpmiddel ingehuurd, een Fuzzer (denk aan een chaotische, meedogenloze stress-tester). Zijn enige taak is om de regel van de detective te proberen te breken.

  • De Analogie: De Fuzzer is als een sloopexpert die probeert met een vrachtwagen van 15 ton over die brug te rijden om te zien of hij instort.
  • De Twee Uitkomsten:
    • Uitkomst A (De brug stort in): De Fuzzer vindt een manier om de regel te breken. Dit betekent dat de detective ongelijk had. De brug is niet veilig, en er is een echt kwetsbaarheid gevonden.
    • Uitkomst B (De regel was fout): De Fuzzer breekt de regel, maar de brug stort niet daadwerkelijk op een gevaarlijke manier in. Dit betekent dat de "briefje" van de detective te strikt was of de situatie verkeerd begreep. De detective past vervolgens de regel aan om deze nauwkeuriger te maken.

3. De Lus van Verbetering

Dit proces creëert een continue lus: Redeneren → Regel Schrijven → Proberen te Breken → Regel Repareren of Bug Vinden.

Door dit te doen, vindt het systeem niet alleen bugs; het dwingt de AI om zijn begrip van hoe de code zou moeten werken af te stemmen op hoe de code daadwerkelijk functioneert. Als de AI een slechte aanname maakt, wordt dit onmiddellijk door de Fuzzer gevangen.

Wat hebben ze gevonden?

De onderzoekers hebben dit systeem (genaamd CODE-AUGUR) getest op echte softwareprojecten. Dit zijn de belangrijkste resultaten die zij rapporteerden:

  • Beter dan de concurrentie: Het vond aanzienlijk meer bugs (tussen de 34% en 370% meer) dan andere topniveau AI-beveiligingstools.
  • Nieuwe Ontdekkingen: Het vond 22 gloednieuwe kwetsbaarheden in populaire open-source software waar nog niemand vanaf wist.
  • Impact in de echte wereld: Ontwikkelaars hebben deze 16 nieuwe bugs al gerepareerd of bevestigd. Sommige van deze ontdekkingen leverden zelfs "bug bounty"-beloningen op (geldprijzen voor het vinden van beveiligingslekken).
  • Lange-termijn Waarde: De "regels" (invariants) die de AI opschrijft, zijn duurzaam. Ze blijven in de code aanwezig, zelfs nadat de audit is voltooid. In één casestudy bij een GPS-softwareproject hielpen deze regels ontwikkelaars om een hele familie van gerelateerde bugs op te lossen, waardoor dezelfde fout in de toekomst werd voorkomen.

Waarom dit ertoe doet

Het paper betoogt dat het simpelweg hebben van een AI die bugs vindt, niet genoeg is. We moeten weten waarom het denkt dat iets veilig is. CODE-AUGUR maakt het denken van de AI transparant, testbaar en zelfcorrigerend. Het verandert een "black box" AI in een partner die zijn logica opschrijft, wordt getest en leert van zijn fouten, wat softwarebeveiliging veel betrouwbaarder maakt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →