← Nieuwste papers
💻 computer science

Security in a Workflow: Exploring Role-Based Agentic Architectures for Vulnerability Handling

Dit artikel stelt een op rollen gebaseerde agentische workflow voor en evalueert deze, bestaande uit Planner-, Analyzer-, Fixer- en Verifier-agents, om de kloof tussen geïsoleerde LLM-beveiligingstaken en de praktijk in de echte industrie te overbruggen, waarbij een detectie-accuratesse van 44% voor kwetsbaarheden en een fix-accuratesse van 19% wordt aangetoond op 25 real-world C/C++ kwetsbaarheden.

Oorspronkelijke auteurs: Srijita Basu, Miroslaw Staron

Gepubliceerd 2026-06-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Srijita Basu, Miroslaw Staron

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een heel oud, complex huis probeert te repareren (een softwareprogramma geschreven in C of C++) met verborgen scheuren en zwakke plekken (beveiligingskwetsbaarheden). In het verleden had je misschien één slimme detective ingehuurd (een standaard AI) om naar het huis te kijken, de scheuren te vinden en ze allemaal tegelijk te proberen te dichten. Soms kreeg deze detective het goed, maar vaak raakte hij overweldigd, miste hij subtiele aanwijzingen of dichtte hij de verkeerde muur af.

Dit artikel stelt een andere aanpak voor: het inhuren van een gespecialiseerd team van agenten in plaats van één eenzame detective. Ze werken samen in een strikte lopende band, waarbij iedereen een specifieke taak heeft.

Hier is hoe het team werkt, gebruikmakend van de bevindingen uit het artikel:

1. De Teamrollen (De "Agentic Workflow")

De onderzoekers zetten een digitaal team op met vier verschillende rollen, vergelijkbaar met een bouwploeg:

  • De Planner (De Projectleider): Voordat iemand begint met graven, scant deze agent de blauwdrukken (de code) om duidelijke probleemgebieden te spotten. Deze agent repareert niets; hij wijst het team alleen naar de gebieden die er verdacht uitzien, zoals "Controleer de achterdeur" of "Kijk naar de fundering."
    • Belangrijkste bevinding: Het artikel stelde vast dat het hebben van deze "Projectleider" cruciaal was. Wanneer zij deze rol verwijderden, daalde het vermogen van het team om problemen te vinden met bijna de helft.
  • De Analyzer (De Inspecteur): Dit is de hoofddetective. Zij nemen de aanwijzingen van de Planner en de ruwe code en om uit te zoeken wat er precies kapot is, waarom het kapot is en hoe een inbreker naar binnen zou kunnen komen.
    • Belangrijke bevinding: De onderzoekers probeerden deze agent een hoogtechnologische metaaldetector te geven (een tool genaamd CodeQL) om te helpen bij het vinden van scheuren. Verrassend genoeg hielp de metaaldetector niet altijd; soms gaf het te veel valse meldingen, wat de Inspecteur in verwarring bracht. De beste resultaten kwamen voort uit het feit dat het AI-model zelf diep nadacht, in plaats van zwaar te vertrouwen op de extra tool.
  • De Fixer (De Reparateur): Zodra de Inspecteur zegt: "Het deurkozijn is aan het rotten," probeert de Fixer een nieuwe deur te bouwen. Zij schrijven de code om het gat te dichten.
    • Belangrijkste bevinding: Dit was de moeilijkste taak. Hoewel het team redelijk was in het vinden van het probleem (ongeveer 44% accuraat), was het daadwerkelijk correct repareren veel moeilijker (slechts 19% accuraat). Vaak dichtte de Fixer wel het gat, maar maakte hij per ongelage iets anders in de buurt kapot of voegde onnodige onderdelen toe.
  • De Verifier (De Veiligheidsinspecteur): Nadat de reparatie is voltooid, controleert deze agent het werk. Zij vragen: "Heb je het rot echt gerepareerd? Heb je het huis veiliger gemaakt, of heb je alleen de scheur overgeschilderd?"
    • Belangrijkste bevinding: Deze rol was vrij goed in het opsporen van fouten en ontdekte ongeveer 69% van de fouten in de reparaties.

2. Het Experiment

De onderzoekers testten dit team op 25 echte beveiligingslekken die werden gevonden in populaire C/C++ software (zoals software die wordt gebruikt in veiligheidskritische systemen). Ze gebruikten drie verschillende "hersenen" (AI-modellen) om de teamleden aan te sturen.

Ze vergeleken twee versies van het team:

  1. Team A: Alleen de vier rollen die met elkaar communiceren.
  2. Team B: Dezelfde vier rollen, maar de Inspecteur kreeg de CodeQL metaaldetector om de scheuren te helpen vinden.

3. Wat ze ontdekten

  • De "Manager" is het belangrijkst: Het belangrijkste deel van het proces was de Planner. Zonder een manager om het team te begeleiden waar ze moesten kijken, raakte de AI de weg kwijt. Met de manager presteerde het team net zo goed als een top-tier commerciële AI (GPT-5.5) bij het vinden van de bugs.
  • Tools zijn geen wondermiddel: Het geven van een fancy tool (CodeQL) aan de Inspecteur maakte hen niet automatisch beter. Sterker nog, het maakte het soms erger omdat de AI moeite had met het interpreteren van de gegevens van de tool. Het artikel suggereert dat voor programmeertalen op laag niveau (zoals C), de AI slim genoeg moet zijn om de aanwijzingen zelf te prioriteren.
  • Vinden versus Vinden: Het is veel makkelijker voor AI om een beveiligingslek te vinden dan om het te repareren. Het team vond de bugs ongeveer 44% van de tijd, maar repareerde ze slechts 19% van de tijd correct.
  • De menselijke touch is nog steeds nodig: Omdat de "Reparateur" (Fixer) vaak fouten maakte of onnodige wijzigingen aanbracht, concludeert het artikel dat je in echte beveiliging niet de AI het volledige proces kunt laten beheren. Je hebt een mens nodig die over de schouder van de AI meekijkt, de reparaties controleert en zeker weet dat het huis daadwerkelijk veilig is.

De Kernboodschap

Dit artikel beweert niet dat AI nu in staat is om software volledig zelfstandig te beveiligen. In plaats daarvan laat het zien dat het organiseren van AI in een gestructureerd team met duidelijke rollen een betere manier is om met beveiliging om te gaan dan één AI alles te laten doen. Echter, zelfs met een geweldig team blijft het "repareren" een lastig onderdeel, en zijn menselijke experts essentieel om het werk te verifiëren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →