← Nieuwste papers
🤖 AI

MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt Evolution

MulVul is een retrieval-augmented multi-agent framework dat de beperkingen van kwetsbaarheidsdetectie door een enkel model en handmatige prompt engineering aanpakt door een coarse-to-fine routeringsstrategie en een nieuw cross-model prompt evolutie-mechanisme te hanteren om een aanzienlijk hogere nauwkeurigheid te bereiken over diverse typen kwetsbaarheden.

Oorspronkelijke auteurs: Zihan Wu, Jie Xu, Yun Peng, Chun Yong Chong, Xiaohua Jia

Gepubliceerd 2026-01-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zihan Wu, Jie Xu, Yun Peng, Chun Yong Chong, Xiaohua Jia

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je op zoek bent naar specifieke soorten bugs in een enorme bibliotheek met computercode. Dit is een beetje zoals het zoeken naar een speld in een hooiberg, maar de "spelden" komen in duizenden verschillende vormen, maten en kleuren voor.

Het artikel introduceert een nieuw systeem genaamd MulVul om dit probleem op te lossen. Hier is hoe het werkt, uitgelegd via eenvoudige analogieën:

Het Probleem: Eén maat past niet iedereen

Stel je voor dat je één zeer slimme detective inhuurt om elke soort misdaad in een stad te vinden.

  • Het probleem: Sommige misdaden zijn als bankovervallen (die kennis van sloten en alarmen vereisen), terwijl andere als identiteitsfraude zijn (die kennis van sociale manipulatie vereisen). Een enkele detective kan uitstekend zijn in het ene, maar verschrikkelijk in het andere.
  • De oude manier: Eerdere AI-tools probeerden één "superdetective" te gebruiken om alles tegelijk te vangen. Omdat er zoveel verschillende soorten codekwetsbaarheden zijn (meer dan 130 types!), raakt deze enkele detective vaak in de war, mist dingen, of slaat vals alarm.
  • Het handmatige probleem: Je zou kunnen proberen om voor elk type kwetsbaarheid een specifieke set instructies (een "prompt") voor de AI te schrijven. Maar met honderden types is het schrijven en testen van deze instructies met de hand onmogelijk—het kost te veel tijd en is te duur.

De Oplossing: MulVul (Het gespecialiseerde team)

MulVul verandert het spel door een team van specialisten te gebruiken in plaats van één generalist. Het werkt in twee hoofdfasen:

1. De "Router" (De verkeersregelaar)

Wanneer een stuk code arriveert, gaat het niet naar iedereen. Eerst gaat het naar een Router Agent.

  • Wat het doet: De Router bekijkt de code en vraagt: "Wat voor soort problemen is dit waarschijnlijk?" De Router hoeft niet de exacte bug te kennen; het hoeft alleen maar de brede categorie te raden (bijv. "Dit lijkt op een geheugenfout" of "Dit lijkt op een injectie-aanval").
  • De truc: Het gebruikt een Retrieval Tool. Denk hierbij aan de Router die door een enorme, georganiseerde encyclopedie van eerdere misdaden bladert om vergelijkbare gevallen te vinden voordat hij een gok doet. Dit helpt om te voorkomen dat hij willekeurig gokt.
  • Het resultaat: Het kiest de top 3 meest waarschijnlijke categorieën en stuurt de code alleen naar de specialisten die die specifieke categorieën afhandelen. Dit bespaart tijd en geld.

2. De "Detectors" (De forensische experts)

Zodra de Router de code naar de juiste specialisten stuurt, nemen de Detector Agents het over.

  • Wat ze doen: Dit zijn zeer gespecialiseerde agents. De een kijkt alleen naar geheugenfouten; een ander kijkt alleen naar injectie-aanvallen.
  • De truc: Net als de Router gebruiken ook zij een Retrieval Tool. Maar zij zijn slimmer. Ze zoeken naar "contrastieve" voorbeelden. Stel je een detective voor die het verhaal van een verdachte vergelijkt met zowel een echt verhaal van een soortgelijke misdaad als een vals verhaal van een soortgelijke misdaad, om de minuscule verschillen te ontdekken. Dit helpt hen om de exacte bug aan te wijzen zonder in de war te raken door vergelijkbaar uitziende code.
  • Isolatie: Cruciaal is dat deze detectives alleen werken. Ze praten niet met elkaar. Als één detective een fout maakt, verspreidt dit zich niet naar de anderen, wat een kettingreactie van fouten voorkomt.

Het geheime ingrediënt: "Cross-Model Prompt Evolution"

Het schrijven van de instructies (prompts) voor deze AI-agents is het moeilijkste deel. Als je één AI vraagt om instructies voor zichzelf te schrijven, kan deze in een lus terechtkomen, waarbij de AI denkt dat zijn eigen slechte ideeën goed zijn.

MulVul gebruikt een slim twee-AI-systeem om dit op te lossen:

  1. De Generator (De architect): Eén AI (zoals Claude) probeert de instructies te schrijven en te verbeteren. Het raadt: "Misschien als ik het zo zeg, doet de AI het beter."
  2. De Executor (De tester): Een andere AI (zoals GPT-4o) probeert die instructies daadwerkelijk op te volgen om bugs te vinden. Het rapporteert terug: "Die instructie werkte goed" of "Die werkte niet."
  3. De lus: De Generator gebruikt deze feedback om betere instructies te schrijven, en de Tester controleert ze opnieuw. Omdat het verschillende modellen zijn, kan de "architect" de "tester" niet foppen door een slecht idee als goed te presenteren. Dit creëert een cyclus van constante verbetering totdat de instructies perfect zijn.

De Resultaten

De auteurs hebben dit systeem getest op een enorme dataset van echte codekwetsbaarheden (genaamd PrimeVul).

  • De score: MulVul behaalde een score van 34,79%, wat 41,5% beter is dan de beste eerdere methode.
  • Waarom het ertoe doet: Het vond meer echte bugs en gaf minder valse meldingen aan dan alles wat eerder is getest.
  • De "Evolution" boost: Het deel waar de twee AI's de instructies samen verbeterden, maakte het systeem 51,6% beter dan wanneer mensen de instructies handmatig hadden geschreven.

Samenvatting

MulVul is als een hoogtechnologisch beveiligingsbedrijf dat niet vertrouwt op één overwerkte bewaker. In plaats daarvan gebruikt het een slimme verkeersregelaar om verdachten naar de juiste forensische expert te sturen, en die experts gebruiken een bibliotheek van eerdere zaken om het puzzelstukje op te lossen. Om ervoor te zorgen dat de experts precies weten wat ze moeten doen, gebruikt het bedrijf twee verschillende AI-breinen om constant hun regelboeken te herschrijven en te perfectioneren, zodat ze de meest gevaarlijke bugs met hoge nauwkeurigheid kunnen vangen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →