A ModernBERT-Based Web Application Firewall for Multi-Class HTTP Attack Detection
Dieses Paper schlägt eine auf ModernBERT basierende Web Application Firewall vor, die durch eine endpunktagnostische Vorverarbeitungspipeline durch Endpoint-Bias verursachte Label-Leakage im Datensatz mildert und dabei über 99,7 % Genauigkeit sowie geringe Latenzzeiten bei der Erkennung von Multi-Class-HTTP-Angriffen erreicht, ohne sich auf Request-Pfade zu verlassen.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Das Internet ist ein riesiges Netzwerk digitaler Gespräche, in dem Webanwendungen als Torwächter für alles von Online-Banking bis hin zu sozialen Medien fungieren. Um diese Tore sicher zu halten, stehen Web Application Firewalls – Sicherheitssysteme, die jede Nachricht prüfen, die versucht einzudringen – Wache. Seit Jahrzehnten verlassen sich diese Wächter auf eine einfache Methode: Sie gleichen eingehende Nachrichten mit einer langen Liste bekannter Muster ab, ganz ähnlich wie ein Türsteher, der eine Gästeliste mit einem Lichtbildabgleich prüft. Während dies bei bekannten Bedrohungen gut funktioniert, stößt dieses Verfahren an seine Grenzen, wenn Angreifer ihren bösartigen Code durch komplexe Tricks tarnen oder wenn sie völlig neue Wege erfinden, um einzubrechen. In den letzten Jahren haben Wissenschaftler die künstliche Intelligenz herangezogen, um diesen Wächtern dabei zu helfen, die subtilen Unterschiede zwischen einer harmlosen Anfrage und einer gefährlichen zu erlernen, in der Hoffnung, Bedrohungen aufzuspüren, die kein Regelwerk jemals vorhersehen könnte. Doch eine neue Studie zeigt nun, dass genau die Werkzeuge, die dazu bestimmt waren, diese KI-Systeme zu lehren, ein geheimes Problem verborgen haben, was Forscher dazu veranlasst, die Frage aufzuwerfen, wie viel der „Intelligenz“ tatsächlich echt war.
Ein Team von Forschern vom Sri Krishna College of Engineering and Technology in Indien setzte sich das Ziel, eine intelligentere Firewall zu bauen, musste aber zuerst ein Rätsel lösen, das die Ergebnisse früherer Experimente verzerrt hatte. Sie begannen mit der Untersuchung einer massiven Sammlung von fast zweihunderttausend etikettierter Webanfragen – ein Datensatz, der von vielen verwendet wurde, um KI-Modelle zum Erkennen gängiger Angriffe wie SQL-Injection, Cross-Site Scripting und Command Injection zu trainieren. Dies sind spezifische Arten digitaler Intrusionen, bei denen Angreifer versuchen, Daten zu stehlen, Benutzersitzungen zu kapern oder die Kontrolle über Server zu übernehmen. Als das Team tiefer in die Daten eintauchte, entdeckte es eine erschreckende Abkürzung. Die Etiketten, die angaben, ob eine Anfrage ein Angriff oder sicher war, wurden nicht durch den eigentlichen Inhalt der Nachricht bestimmt, sondern durch die Adresse, an die die Nachricht gesendet wurde. In diesem Datensatz galt: Wenn eine Nachricht an eine Login-Seite gesendet wurde, wurde sie fast immer als Angriff etikettiert, während Nachrichten, die an eine Datei-Upload-Seite gesendet wurden, fast immer als sicher deklariert wurden. Ein KI-Modell, das mit diesen Daten trainiert wurde, lernte nicht, gefährlichen Code zu erkennen; es merkte sich schlichtweg, welche Webseiten mit Problemen assoziiert waren – ein Trick, der als Label Leakage (Etiketten-Leckage) bekannt ist.
Um dies zu beheben, entwickelten die Forscher eine neue Methode zur Datenaufbereitung, bei der die Adressinformationen entfernt wurden, damit die KI gezwungen wird, sich nur auf den Inhalt der Nachricht selbst zu konzentrieren. Sie fügten zudem Schritte hinzu, um verborgene Textebenen zu dekodieren, die Angreifer nutzen, um ihre Befehle zu tarnen, um sicherzustellen, dass die KI die wahre Natur der Anfrage sieht. Mit diesen bereinigten Daten trainierten sie ein modernes Sprachmodell – eine Art künstliche Intelligenz, die darauf ausgelegt ist, Kontext und Nuancen zu verstehen – um als die neue Firewall zu fungieren. Im Gegensatz zu älteren Modellen, die nur kurze Textausschnitte lesen konnten, konnte dieses neue System längere, komplexere Nachrichten verarbeiten, ohne wichtige Details zu verlieren. Die Forscher testeten dieses neue System anschließend an einem leckagefreien Testdatensatz von 19.896 Anfragen, der mittels geschichteter Gruppenaufteilung erstellt wurde, um sicherzustellen, dass keine adressbasierten Abkürzungen mehr existierten.
Die Ergebnisse waren beeindruckend. Die neue Firewall identifizierte die Art fast jeder untersuchten Nachricht korrekt und erreichte eine Genauigkeitsrate von 99,74 Prozent. Sie unterschied erfolgreich zwischen harmlosem Datenverkehr und gefährlichen Angriffen wie SQL-Injection, Cross-Site Scripting und Command Injection mit einer Präzision, die herkömmliche Methoden weit übertraf. Noch beeindruckender war die Geschwindigkeit: Das System konnte eine einzelne Webanfrage in nur 12 Millisekunden analysieren – schnell genug, um Live-Websites zu schützen, ohne diese zu verlangsamen. Die Studie zeigte auch, dass die Leistung älterer Machine-Learning-Modelle signifikant sank, wenn die Forscher die adressbasierten Abkürzungen entfernten, was bewies, dass diese auf dieselben fehlerhaften Muster vertraut hatten. Im Gegensatz dazu behielt das neue System seine hohe Genauigkeit bei, was demonstrierte, dass es tatsächlich gelernt hatte, die Struktur eines Angriffs zu erkennen, anstatt nur basierend auf dem Ziel zu raten.
Diese Arbeit verbessert nicht nur ein Sicherheitstool; sie verändert die Art und Weise, wie Wissenschaftler die Sicherheit von Webanwendungen bewerten. Indem sie bewiesen, dass frühere hohen Punktzahlen oft das Ergebnis eines Datenfehlers und nicht echter Intelligenz waren, haben die Forscher einen neuen, strengeren Standard für Tests etabliert. Sie zeigten, dass eine KI erst dann wirklich zuverlässig ist, wenn sie darauf trainiert wird, den Kontext, wohin eine Nachricht geht, zu ignorieren und sich stattdessen vollständig darauf zu konzentrieren, was die Nachricht tatsächlich aussagt. Das Team hat bereits einen funktionierenden Prototyp dieses Systems gebaut, der schnelle, regelbasierte Prüfungen mit ihrem Deep-Learning-Modell kombiniert, um eine hybride Verteidigung zu schaffen, die den komplexen, sich entwickelnden Bedrohungen des modernen Webs begegnen kann. Ihre Erkenntnisse legen nahe, dass die Zukunft der Websicherheit nicht in größeren Listen von Regeln liegt, sondern in Systemen, die die subtile, sich wandelnde Sprache digitaler Angriffe verstehen können – vorausgesetzt, sie werden von Anfang an richtig unterrichtet.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.