A ModernBERT-Based Web Application Firewall for Multi-Class HTTP Attack Detection
Dit artikel stelt een op ModernBERT gebaseerde Web Application Firewall voor die dataset-label lekkage veroorzaakt door endpoint-bias tegengaat via een endpoint-agnostische preprocessing-pipeline, waarbij een nauwkeurigheid van meer dan 99,7% en een lage latentie wordt bereikt bij het detecteren van multi-class HTTP-aanvallen zonder afhankelijk te zijn van request-paden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het internet is een uitgestrekt netwerk van digitale gesprekken, waarbij webapplicaties fungeren als de poortwachters voor alles van online bankieren tot sociale media. Om deze toegangspoorten veilig te houden, staan beveiligingssystemen die bekend staan als Web Application Firewalls wacht te houden, waarbij ze elk bericht inspecteren dat probeert binnen te komen. Decennialang hebben deze bewakers vertrouwd op een eenvoudige methode: het controleren van inkomende berichten tegen een lange lijst van bekende patronen, vergelijkbaar met een uitsmijter die een gastenlijst controleert aan de hand van een foto-identiteitsbewijs. Hoewel dit goed werkt voor vertrouwde dreigingen, heeft het moeite wanneer aanvallers hun kwaadaardige code maskeren met complexe trucs of wanneer ze geheel nieuwe manieren verzinnen om in te breken. In de afgelopen jaren hebben wetenschappers kunstmatige intelligentie ingezet om deze bewakers te helpen het subtiele verschil te leren tussen een onschuldig verzoek en een gevaarlijk een, in de hoop dreigingen te ontdekken die geen enkel regelboekje ooit zou kunnen voorspellen. Echter, een nieuwe studie onthult dat de zeer instrumenten die bedoeld zijn om deze AI-systemen te onderwijzen, een geheim gebrek verborgen hielden, wat onderzoekers ertoe aanzet te twijfelen aan hoeveel van de "intelligentie" daadwerkelijk echt was.
Een team van onderzoekers van de Sri Krishna College of Engineering and Technology in India zette zich in om een slimmere firewall te bouwen, maar ze moesten eerst een puzzel oplossen die de resultaten van eerdere experimenten had vertekend. Ze begonnen met het onderzoeken van een enorme collectie van bijna tweehonderdduizend gelabelde webverzoeken, een dataset die door velen is gebruikt om AI-modellen te trainen om veelvoorkomende aanvallen te detecteren zoals SQL-injectie, cross-site scripting en command-injectie. Dit zijn specifieke soorten digitale indringingen waarbij aanvallers proberen gegevens te stelen, gebruikerssessies te kapen of servers over te nemen. Terwijl het team dieper in de data dook, ontdekten ze een opmerkelijke afkorting. De labels die aangaven of een verzoek een aanval of veilig was, werden niet bepaald door de werkelijke inhoud van het bericht, maar door het adres waarnaar het bericht werd verzonden. In deze dataset, als een bericht naar een inlogpagina werd verzonden, werd het bijna altijd als een aanval gelabeld, terwijl berichten naar een pagina voor het uploaden van bestanden bijna altijd als veilig werden gelabeld. Een AI-model dat op deze data werd getraind, leerde niet om gevaarlijke code te herkennen; het memoriseerde simpelweg welke webpagina's geassocieerd waren met problemen, een truc die bekend staat als label leakage.
Om dit op te lossen, ontwikkelden de onderzoekers een nieuwe manier om de data voor te bereiden, waarbij ze de adresinformatie verwijderden zodat de AI gedwongen werd om alleen naar de inhoud van het bericht zelf te kijken. Ze voegden ook stappen toe om verborgen lagen tekst te decoderen die aanvallers gebruiken om hun commando's te maskeren, waardoor de AI de ware aard van het verzoek zag. Met deze schone data trainden ze een modern taalmodel, een type kunstmatige intelligentie dat ontworpen is om context en nuance te begrijpen, om als de nieuwe firewall te fungeren. In tegen tegenstelling tot oudere modellen die alleen korte fragmenten tekst konden lezen, kon dit nieuwe systeem langere, complexere berichten verwerken zonder belangrijke details te verliezen. De onderzoekers testten dit nieuwe systeem vervolgens op een leakage-vrije testset van 19.896 verzoeken, gecreëerd via group stratified splitting om ervoor te zorgen dat er geen adresgebaseerde afkortingen meer aanwezig waren.
De resultaten waren opmerkelijk. De nieuwe firewall identificeerde de aard van bijna elk onderzocht bericht correct, met een nauwkeurigheidspercentage van 99,74 procent. Het onderscheidde succesvol tussen onschadelijk verkeer en gevaarlijke aanvallen zoals SQL-injectie, cross-site scripting en command-injectie met een niveau van precisie dat de traditionele methoden ver overtrof. Nog indrukwekkender was de snelheid; het systeem kon een enkel webverzoek analyseren in slechts 12 milliseconden, snel genoeg om live websites te beschermen zonder ze te vertragen. De studie toonde ook aan dat wanneer de onderzoekers de adresgebaseerde afkortingen verwijderden, de prestaties van oudere machine learning-modellen aanzienlijk daalden, wat bewees dat zij op dezelfde gebrekkige patronen hadden vertrouwd. In contrast hiermee behield het nieuwe systeem zijn hoge nauwkeurigheid, wat aantoonde dat het werkelijk had geleerd om de structuur van een aanval te herkennen in plaats van alleen te gokken op basis van de bestemming.
Dit werk doet meer dan alleen een beveiligingsinstrument verbeteren; het verandert hoe wetenschappers de veiligheid van webapplicaties evalueren. Door te bewijzen dat eerdere hoge scores vaak het resultaat waren van een datafout in plaats van echte intelligentie, hebben de onderzoekers een nieuwe, strengere standaard voor testen vastgesteld. Ze toonden aan dat voor een AI werkelijk betrouwbaar te zijn, deze getraind moet worden om de context van waar een bericht naartoe gaat te negeren en zich volledig te concentreren op wat het bericht daadwerkelijk zegt. Het team heeft al een werkend prototype van dit systeem gebouwd, waarbij ze snelle, regelgebaseerde controles combineren met hun deep-learningmodel om een hybride verdediging te creëren die de complexe, evoluerende dreigingen van het moderne web kan afhandelen. Hun bevindingen suggereren dat de toekomst van webbeveiliging niet ligt in grotere lijsten met regels, maar in systemen die de subtiele, verschuivende taal van digitale aanvallen kunnen begrijpen, mits ze vanaf het begin de juiste lessen krijgen geleerd.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.