← Neueste Arbeiten
💻 computer science

Parser-Free Querying of Security Logs

Das Papier stellt Sieve vor, ein System, das auf großen Sprachmodellen basiert, die durch automatisch extrahierten Kontext aus Logformaten fundiert sind, um ausführbaren Code für Sicherheitsabfragen in natürlicher Sprache zu generieren und damit die Fehlerquoten bei der komplexen zeitlichen und ereignisübergreifenden Loganalyse im Vergleich zur manuellen Skriptierung erheblich zu senken.

Ursprüngliche Autoren: Evan Luo, Julien Piet, David Wagner

Veröffentlicht 2026-05-22
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Evan Luo, Julien Piet, David Wagner

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein Sicherheitsdetektiv, der versucht, ein Verbrechen aufzuklären. Sie haben einen massiven Haufen Beweismittel: Millionen von Seiten handschriftlicher Notizen, Quittungen und Protokolle, die von verschiedenen Personen (Servern, Firewalls, Benutzerkonten) hinterlassen wurden. Das Problem ist, dass jeder in seiner eigenen unordentlichen, inkonsistenten Handschrift schreibt. Eine Person schreibt Daten als „1. Jan.", eine andere als „01/01" und eine dritte einfach als „Montag". Manche Notizen sind auf Haftnotizen geschrieben, andere auf Servietten, und die Tintenfarben variieren.

Um einen Fall zu lösen, müssen Sie spezifische Fragen stellen wie: „Zeigen Sie mir jedes Mal, wenn jemand versucht hat, zwischen 2 und 4 Uhr morgens in das Gebäude einzubrechen."

Der alte Weg: Der überarbeitete Bibliothekar

Traditionell versuchen Sicherheitsteams, dieses Problem zu lösen, indem sie ein Team von Bibliothekaren (Parsern) einstellen, die jede einzelne Notiz lesen, den Handschriftstil herausfinden und alles in eine perfekte, einheitliche Tabellenkalkulation umschreiben.

  • Das Gute: Sobald die Tabellenkalkulation fertig ist, sind Fragen schnell und einfach zu beantworten.
  • Das Schlechte: Es dauert ewig, die Tabellenkalkulation zu erstellen. Jedes Mal, wenn eine neue Person beginnt, Notizen in einer leicht anderen Weise zu schreiben, müssen die Bibliothekare anhalten, den neuen Stil erlernen und die Regeln neu schreiben. Wenn eine neue Art von Notiz auftaucht, die niemand zuvor gesehen hat, bricht das gesamte System zusammen, bis die Bibliothekare es repariert haben.

Die Alternative: Der Grep-Detektiv

Die andere Option ist, die Bibliothekare ganz zu überspringen. Sie greifen sich einfach eine Lupe (ein Werkzeug wie grep) und durchsuchen die rohen, unordentlichen Notizen selbst.

  • Das Gute: Sie können sofort beginnen. Kein Warten auf Bibliothekare.
  • Das Schlechte: Sie müssen genau wissen, wie jeder mögliche Handschriftstil aussieht. Wenn Sie eine Variation des Wortes „Einbruch" übersehen, verpassen Sie den Hinweis. Außerdem ist es unglaublich schwierig, komplexe Fragen wie „Finden Sie Personen, die innerhalb von 60 Sekunden durch zwei verschiedene Türen eingetreten sind" zu beantworten, indem man Zeilen von Text manuell durchsucht.

Die neue Lösung: Sieve (Der intelligente Übersetzer)

Die Arbeit stellt Sieve vor, ein System, das wie ein superintelligenter Übersetzer funktioniert, der sofort ein benutzerdefiniertes Werkzeug für Sie schreiben kann.

So funktioniert Sieve, anhand einer einfachen Analogie:

  1. Die Anfrage: Sie stellen Sieve eine Frage in einfacher englischer Sprache: „Finden Sie alle IP-Adressen, die in einem 5-Minuten-Fenster mehr als 10 Mal versucht haben, einzubrechen."
  2. Der schnelle Scan: Anstatt das ganze Millionen-Seiten-Buch zu lesen, blättert Sieve schnell durch die ersten paar Seiten, um zu sehen, wie die Handschrift aussieht. Es erstellt eine winzige „Spickzettel" der verschiedenen Schreibweisen der Notizen (z. B. „Oh, manchmal sagen sie 'Fehlgeschlagenes Passwort', manchmal sagen sie 'Authentifizierungsfehler'").
  3. Der Code-Schreiber: Sieve sendet Ihre Frage und diesen winzigen Spickzettel an eine sehr intelligente KI (ein Large Language Model). Die KI liest nicht das ganze Buch; sie verwendet den Spickzettel einfach, um ein benutzerdefiniertes Computerskript (wie ein kleines Roboterprogramm) zu schreiben, das speziell darauf ausgelegt ist, nach Ihrer Antwort zu suchen.
  4. Die Ausführung: Dieses benutzerdefinierte Skript wird auf den rohen Notizen ausgeführt. Da es von der KI basierend auf dem Spickzettel geschrieben wurde, weiß es genau, wie man „Fehlgeschlagenes Passwort" und „Authentifizierungsfehler" findet und wie man sie zählt.
  5. Das Ergebnis: Das Skript liefert Ihnen die Antwort. Wenn das Skript einen Fehler macht (wie einen Tippfehler), erkennt Sieve den Fehler, teilt ihn der KI mit und bittet sie, das Skript neu zu schreiben. Es versucht bis zu vier Mal, bis es richtig liegt.

Warum das eine große Sache ist

Die Arbeit testete dies an 133 verschiedenen Sicherheitsfragen über 5 verschiedene Arten von Protokollen. Hier ist, was sie fanden:

  • Bei schwierigen Fällen ist es schlauer als Menschen: Wenn die Fragen einfach waren (wie „finden Sie das Wort 'Fehler'"), war Sieve genauso gut wie ein menschlicher Experte, der ein schnelles Skript schreibt. Aber wenn die Fragen schwierig waren (wie „finden Sie Muster über die Zeit und verschiedene Personen hinweg"), machte Sieve dreimal weniger Fehler als Menschen, die versuchten, Skripte von Grund auf neu zu schreiben.
  • Es braucht keinen perfekten Bibliothekar zuerst: Sieve benötigt keine vorgefertigte Tabellenkalkulation. Es arbeitet direkt an den unordentlichen rohen Notizen.
  • Einfach ist besser: Die Arbeit ergab, dass Sie keine ausgeklügelte, teure KI benötigen, um die Handschriftstile zuerst herauszufinden. Ein einfacher, schneller Algorithmus, der nur zählt, wie oft bestimmte Phrasen auftreten, funktioniert genauso gut wie die komplexen Methoden.
  • Es ist sicher und zuverlässig: Die KI rät die Antwort nicht einfach; sie schreibt Code, der wie ein normales Computerprogramm ausgeführt wird. Das bedeutet, das Ergebnis ist deterministisch (die gleiche Frage liefert immer die gleiche Antwort), und Sie können den Code einsehen, um genau zu sehen, wie er funktioniert hat.

Das Fazit

Sieve schließt die Lücke zwischen der Geschwindigkeit der Suche in rohem Text und der Leistungsfähigkeit strukturierter Datenbanken. Es ermöglicht Sicherheitsanalysten, komplexe Fragen in einfacher englischer Sprache zu stellen und sofort genaue Antworten zu erhalten, ohne auf Ingenieure warten zu müssen, die ein neues Datenbankschema erstellen, oder ohne selbst mit dem Schreiben komplexer Skripte zu kämpfen. Es verwandelt das „unordentliche Notizbuch" auf die fly in eine durchsuchbare Datenbank, eine Frage nach der anderen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →