CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability
Dit artikel introduceert CVE-Factory, een multi-agent framework dat spaarse CVE-metadata automatisch omzet in hoogwaardige, uitvoerbare beveiligingstaken om de LiveCVEBench-benchmark en een grootschalige trainingsdataset te creëren, waardoor de kwetsbaarheidsdetectiecapaciteiten van code-agenten aanzienlijk worden verbeterd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een beveiligingsbewaker bent die probeert een nieuwe robot te leren hoe hij kapotte sloten op een miljoen verschillende deuren moet repareren. Het probleem is dat de enige instructies die je hebt, kleine, vaag geformuleerde post-itnotities zijn met de tekst: "Deur 404 is kapot", zonder te vertellen hoe hij kapot is, hoe de deur eruitziet, of welke gereedschappen je nodig hebt om hem te repareren.
Dit is de huidige staat van het AI-beveiligingsonderzoek. We hebben lijsten met kwetsbaarheden (zogenaamde CVE's), maar ze zijn slechts schaarse datapunten. Om AI-agenten te trainen om ze te repareren, hebben we volledige "trainingskits" nodig: een werkend model van de kapotte deur, een test om te bewijzen dat hij kapot is, en een geverifieerde oplossing.
CVE-Factory is een nieuw systeem dat fungeert als een super-efficiënt, geautomatiseerd bouwteam. Het neemt die kleine, vage post-itnotities en bouwt er direct een complete, werkende trainingskit van voor de robot.
Hier is hoe het werkt, met behulp van eenvoudige analogieën:
1. Het Probleem: De "Vage Post-itnotitie"
Op dit moment moeten beveiligingsexperts deze trainingskits handmatig bouwen. Ze lezen een kwetsbaarheidsrapport, vinden de software, zetten een nep-computermilieu op, breken het opzettelijk, schrijven een test om de breuk op te vangen, en schrijven vervolgens de oplossing.
- De Realiteit: Dit kost experts meer dan 10 uur per deur. Het is te langzaam en te duur om dit voor duizenden deuren te doen.
- Het Resultaat: AI-robots hebben onvoldoende oefenmateriaal, waardoor ze slecht blijven in beveiliging.
2. De Oplossing: De "Assemblagelijn" (CVE-Factory)
De auteurs hebben CVE-Factory gebouwd, wat lijkt op een gespecialiseerde fabriek met een lopende band. In plaats van dat één persoon de hele klus doet, hebben ze het proces opgesplitst in zes distincte stations, elk beheerd door een gespecialiseerde AI-agent.
Denk eraan als een high-tech auto-reparatiewerkplaats waar geen enkele monteur probeert alles tegelijk te doen:
- Station 1: De Detective (Analyzer)
De AI leest de vage post-itnotitie en gaat een webzoektocht uitvoeren om de blauwdrukken, het specifieke automodel en het exacte kapotte onderdeel te vinden. Het creëert een duidelijk "dossier". - Station 2: De Architect (Generator)
Met behulp van het dossier schrijft deze AI de instructies voor de robot: "Hier is de kapotte deur. Hier is een test om te bewijzen dat hij kapot is. Zo ziet een perfecte oplossing eruit." - Station 3: De Bouwer (Builder)
Deze AI bouwt de daadwerkelijke omgeving. Het zet de "nep-computer" (met behulp van Docker-containers) op om er precies zo uit te zien als de echte software. Cruciaal is dat het dit bouwt zonder de oplossing of de test te zien, zodat het niet cheat. Het bouwt gewoon de scène. - Station 4: De Inspecteur (Validator)
Voordat iemand probeert het te repareren, controleert deze agent: "Is de deur in deze nep-ruimte echt kapot? Werkt de test?" Als de ruimte niet goed is ingesteld, stuurt hij het terug naar de Bouwer om het te repareren. - Station 5: De Monteur (Solver)
Deze agent probeert de deur te repareren met behulp van de instructies. Het past de patch toe en voert de test uit. - Station 6: De Hoofd Kwaliteitscontrole (Checker)
De eindbaas. Het voert een volledige end-to-end controle uit. Werkt de oplossing echt? Heeft de robot per ongeluk iets anders kapot gemaakt? Is de test echt, of heeft de robot de resultaten gewoon nep gemaakt?
De Geheime Ingrediënt: Als er iets misgaat op een station, geeft het systeem niet zomaar op. Het heeft een "feedback-lus". Als de Inspecteur zegt: "De deur is niet kapot", stuurt hij de taak terug naar de Bouwer om de deur opnieuw te bouwen, niet naar een nieuwe persoon. Dit zorgt ervoor dat het eindproduct van hoge kwaliteit is.
3. De Resultaten: Expertniveau Snelheid
Het team testte deze fabriek tegenover menselijke experts die al 215 van deze trainingskits hadden gebouwd.
- Nauwkeurigheid: De kits van de fabriek waren 95% zo goed als de kits van de menselijke experts.
- Snelheid: Mensen doen er 5–24 uur over per kit. De fabriek doet er ongeveer 48 minuten over.
- Schaal: Met 20 arbeiders die tegelijkertijd draaien, bouwde de fabriek alle 215 kits in minder dan 5 uur. Een menselijk team zou er weken over hebben gedaan.
4. De Nieuwe Speeltuin: LiveCVEBench
Omdat de fabriek zo snel is, hielden de auteurs niet op bij 215. Ze bouwden een nieuwe, voortdurend bijwerkende speeltuin genaamd LiveCVEBench.
- Het bevat 190 beveiligingstaken uit de echte wereld.
- Het bestrijkt 14 verschillende programmeertalen (niet alleen Python).
- Het omvat opkomende bedreigingen, zoals kwetsbaarheden in AI-tools zelf.
- Het wordt automatisch bijgewerkt naarmate er nieuwe kwetsbaarheden worden ontdekt, in tegenstelling tot oude benchmarks die in de tijd zijn bevroren.
5. Het Trainen van de Robot
Tot slot gebruikten ze de fabriek om meer dan 1.000 trainingstaken te creëren om een AI-model (Qwen3-32B) te leren.
- Voor training: De AI kon slechts 5,3% van de beveiligingstaken oplossen.
- Na training: Het steeg naar 35,8%, en sloeg veel grotere, duurdere modellen.
- Bonus: De vaardigheden die het leerde, waren niet alleen voor beveiliging; het werd ook beter in algemene coderingstaken.
Samenvatting
CVE-Factory is een multi-agent systeem dat de creatie van hoogwaardige beveiligingstrainingdata automatiseert. Het zet schaarse, saaie kwetsbaarheidsrapporten om in volledige, interactieve "ontsnappingskamer"-stijl uitdagingen voor AI-agenten. Het bewijst dat door een complexe baan op te splitsen in kleinere, gespecialiseerde stappen en AI-agenten samen te laten werken, we expertniveau trainingdata kunnen genereren op een schaal en snelheid die mensen simpelweg niet kunnen evenaren. Dit stelt ons in staat om slimmere, veiligere AI-agenten sneller dan ooit tevoren te trainen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.