RuleForge: Automated Generation and Validation for Web Vulnerability Detection at Scale
Het paper introduceert RuleForge, een AWS-systeem dat automatisch detectieregels voor webkwetsbaarheden genereert op basis van gestructureerde Nuclei-sjablonen en deze valideert met een innovatief 'LLM-as-a-judge'-systeem dat de vals-positieve ratio met 67% verlaagt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat de digitale wereld een enorme stad is, en hackers zijn als diefstalplanners die elke dag nieuwe manieren bedenken om in huizen te breken. Elke keer als ze een nieuwe sleutel of een nieuwe manier vinden om een raam open te krijgen, wordt dit bekendgemaakt als een CVE (een kwetsbaarheid).
Het probleem? Er zijn zoveel nieuwe inbraakplannen dat de beveiligingsteam van Amazon (AWS) niet meer kan bijbenen. In 2025 kwamen er meer dan 48.000 nieuwe plannen binnen. Het is alsof je probeert duizenden sloten te maken met je handen, terwijl er elke seconde een nieuw slot wordt ontworpen.
Hier komt RuleForge om de hoek kijken. Het is een slimme robot die deze taak overneemt. Hier is hoe het werkt, vertaald naar alledaagse taal:
1. De Robot die Sloten Maken (Automatische Regels)
Normaal gesproken moeten beveiligingsexperts handmatig een "regelset" schrijven voor elke nieuwe inbraakpoging. Dat is een regelmatige klus. RuleForge doet dit automatisch.
- De Input: De robot leest beschrijvingen van de inbraakplannen (die vaak in een gestructureerd formaat staan, genaamd Nuclei templates).
- De Actie: Met behulp van een zeer slimme AI (een Large Language Model) schrijft de robot direct de instructies: "Als je deze specifieke code ziet, is het een inbraakpoging!"
2. Het 5x5 Spel (Meerdere Opties)
Stel je voor dat je een puzzel probeert op te lossen. Als je maar één keer probeert, heb je misschien pech. RuleForge is slimmer:
- Het maakt 5 verschillende versies van de regels tegelijkertijd.
- Elke versie krijgt 5 kansjes om zichzelf te verbeteren als ze fouten maken.
- Het is alsof je 5 detectives tegelijkertijd laat zoeken naar de beste manier om de dief te vangen, en de slimste detective mag het werk doen.
3. De "Rechter" AI (LLM-as-a-Judge)
Dit is het coolste deel. Hoe weet je of de regels die de robot schrijft goed zijn?
- Het oude probleem: Soms denkt de robot dat hij iets goed heeft, maar is het juist heel fout.
- De oplossing: RuleForge heeft een tweede AI ingeschakeld die fungeert als een rechter. Deze rechter kijkt niet alleen of het antwoord goed is, maar vraagt zich af: "Hoe groot is de kans dat deze regel een onschuldige burger per ongeluk als dief aanwijst?" en "Hoe groot is de kans dat hij een echte dief laat gaan?"
- Het resultaat: Deze rechter geeft een score. Als de score te laag is, krijgt de schrijvende AI feedback: "Je bent te streng, je schrikt onschuldige mensen af, probeer het nog eens." Hierdoor zijn er 67% minder foutmeldingen (onschuldige mensen worden niet meer als boosdoeners gezien).
4. De Testbaan (Validatie)
Voordat een regel de echte wereld in gaat, doorloopt hij een strenge testbaan:
- Synthetische Test: De regel wordt getest op nep-inbraakpogingen en normale verkeer.
- De Rechter: De AI-rechter geeft een vertrouwensscore.
- De Echte Wereld: De regel wordt getest op een enorme hoeveelheid echt internetverkeer (miljarden records). Als hij te veel onschuldige mensen "opblaast", valt hij af.
- Menselijke Controle: Uiteindelijk kijkt een menselijke beveiligingsexpert nog even snel of alles klopt.
5. Wat als de instructies vaag zijn? (Ongestructureerde Data)
Tot nu toe kon de robot alleen lezen uit de strakke "Nuclei templates". Maar wat als de informatie over een inbraakpoging staat in een lang, rommelig blogbericht?
- RuleForge heeft getest of het ook die rommelige teksten kan lezen. Het werkt, maar niet perfect (ongeveer 40% succes). Het is alsof de robot probeert een recept te volgen uit een krantje waar de tekst half weggeveegd is; soms lukt het, soms niet.
6. De Agent (De Slimme Assistent)
De auteurs hebben ook gekeken naar een "Agent". Stel je voor dat de robot niet alleen een slotenmaker is, maar een hoofdagent die weet welke specialist hij moet bellen.
- Is het een hack op een website? Bel de web-specialist.
- Is het een virus op een computer? Bel de proces-specialist.
- Is het iets raars? Bel dan de menselijke expert.
Dit maakt het systeem veel flexibeler voor de toekomst.
De Grote Les
De belangrijkste les uit dit verhaal is: AI is slim, maar soms te zelfverzekerd.
Als je een AI vraagt: "Ben je zeker dat dit goed is?", zegt hij vaak "Ja, 90% zeker", zelfs als het fout is.
Maar als je vraagt: "Wat kan er misgaan met dit antwoord?", wordt hij veel nuchterder en accurater. Door de AI te laten twijfelen en fouten te zoeken, wordt hij een betere beveiligingsmedewerker.
Kortom: RuleForge is een slimme, zelflerende machine die helpt om de stad (het internet) veilig te houden door duizenden sloten per seconde te maken, maar die altijd eerst een strenge rechter en een menselijke expert laat kijken voordat ze de deur op slot doen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.