← Neueste Arbeiten
💻 computer science

CelerLog: Fast Log Parsing via Dynamic Routing

CelerLog ist ein schneller und effektiver Log-Parser, der einen dynamischen Routing-Mechanismus einsetzt, um Logs in statistische und semantische Gruppen zu klassifizieren, wobei die meisten repetitiven Muster mit effizienten statistischen Methoden verarbeitet werden, während LLM-Inferenz für komplexe Fälle reserviert bleibt, wodurch im Vergleich zu bestehenden State-of-the-Art-Ansätzen eine überlegene Leistung mit deutlich reduzierter Latenz und geringeren Kosten erreicht wird.

Ursprüngliche Autoren: Shiwen Shan, Yintong Huo, Minxing Wang, Zhiying Wu, Yuxin Su, Zibin Zheng

Veröffentlicht 2026-05-26
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Shiwen Shan, Yintong Huo, Minxing Wang, Zhiying Wu, Yuxin Su, Zibin Zheng

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind der Manager einer riesigen, chaotischen Bibliothek, in der jede Sekunde Millionen von Büchern (Log-Nachrichten) von verschiedenen Autoren geschrieben werden. Ihre Aufgabe besteht darin, diese Bücher in ordentliche Kategorien einzuteilen, damit Sie später spezifische Informationen finden können. Dieser Vorgang wird als Log-Parsing bezeichnet.

Die Arbeit stellt ein neues System namens CelerLog vor, das ein Hauptproblem löst: Wie man diese Bücher schnell und kostengünstig sortiert, ohne an Genauigkeit zu verlieren.

So funktioniert es, unter Verwendung einfacher Analogien:

Das Problem: Der „Ein-Größe-für-alle"-Fehler

Früher gab es zwei Möglichkeiten, diese Bücher zu sortieren:

  1. Der schnelle Roboter (Syntaxbasiert): Dieser Roboter ist unglaublich schnell. Er betrachtet die Form der Wörter und sortiert sie basierend auf Mustern. Allerdings ist er etwas dumm. Wenn ein Buch einen seltsamen, komplexen Satz enthält, gerät der Roboter in Verwirrung und macht Fehler.
  2. Der weise Professor (LLM-basiert): Dies ist ein superintelligenter KI-Professor. Er kann die Bedeutung jedes Satzes verstehen, egal wie komplex er ist. Er macht niemals einen Fehler. Doch es gibt einen Haken: Der Professor ist langsam, teuer anzustellen und wird leicht müde. Wenn Sie den Professor bitten, jedes einzelne Buch in der Bibliothek zu lesen, dauert es ewig und kostet ein Vermögen.

Die Erkenntnis: Nicht jedes Buch braucht einen Professor

Die Autoren der Arbeit stellten beim Blick in die Bibliothek etwas Interessantes fest.

  • 98 % der Bücher sind sehr repetitiv. Sie alle sagen dasselbe, nur mit unterschiedlichen Zahlen oder Namen (z. B. „Benutzer John hat sich angemeldet", „Benutzer Mary hat sich angemeldet", „Benutzer Bob hat sich angemeldet"). Dies sind dichte Gruppen.
  • Nur 2 % der Bücher sind einzigartig, seltsam oder Einmal-Ereignisse, die keinem Muster folgen. Dies sind spärliche Gruppen.

Die Autoren erkannten: Warum sollte man den teuren, langsamen Professor beauftragen, die 98 % der Bücher zu lesen, die nur repetitiv sind? Ein schneller Roboter könnte diese problemlos bewältigen. Der Professor sollte nur für die seltenen, verwirrenden 2 % hinzugezogen werden.

Die Lösung: CelerLog (Der intelligente Verkehrspolizist)

CelerLog fungiert wie ein dynamischer Verkehrspolizist am Eingang der Bibliothek. Es verwendet ein System der „dynamischen Weiterleitung" (Dynamic Routing), um zu entscheiden, wohin jedes Buch geht:

  1. Der Check-in (Routing): Wenn Bücher eintreffen, scannt der Verkehrspolizist sie schnell.

    • Wenn das Buch aussieht, als würde es zu einer großen, repetitiven Menge gehören (eine dichte Gruppe), winkt der Polizist es auf die „Schnelle Spur".
    • Wenn das Buch einzigartig, einsam oder seltsam aussieht (eine spärliche Gruppe), schickt der Polizist es auf die „Langsame Spur", um den weisen Professor zu konsultieren.
  2. Die Schnelle Spur (Statistischer Prozessor):

    • Hier erledigt ein einfaches, superschnelles statistisches Werkzeug die Arbeit. Es betrachtet die Menge der repetitiven Bücher und sagt: „Okay, jeder hier sagt 'Angemeldet', außer dem Namen am Ende. Lassen Sie uns einfach die Namen durch einen leeren Platz ersetzen."
    • Ergebnis: Es ist sofortig und kostenlos.
  3. Die Langsame Spur (LLM-Prozessor):

    • Hier darf der weise Professor (die KI) endlich arbeiten. Doch da der Verkehrspolizist den langweiligen Teil herausgefiltert hat, muss der Professor nur einen winzigen Bruchteil der gesamten Bücher lesen.
    • Ergebnis: Der Professor bleibt zufrieden, die Kosten bleiben niedrig, und die komplexen Bücher werden perfekt sortiert.

Die Ergebnisse: Ein Gewinn für beide Seiten

Die Arbeit testete dieses System an 14 verschiedenen „Bibliotheken" (Datensätzen) und stellte fest, dass CelerLog ein Game-Changer ist:

  • Geschwindigkeit: Es ist 8- bis 18-mal schneller als die Verwendung des Professors für alles. In einigen Fällen ist es sogar 1,5-mal schneller als der alte schnelle Roboter, weil der alte Roboter versuchte, zu clever zu sein und scheiterte.
  • Kosten: Es spart eine enorme Menge an Geld. Es verwendet 80 % bis 94 % weniger „Tokens" (die Währung, mit der die KI bezahlt wird) und ruft den Professor 86 % bis 90 % seltener auf.
  • Genauigkeit: Trotz der höheren Geschwindigkeit ist es tatsächlich genauer als die alten Methoden. Es verpasst nicht die komplexen Details, die der schnelle Roboter früher verpasste, und es macht nicht die Fehler, die der Professor manchmal macht, wenn er überfordert ist.

Zusammenfassung

CelerLog ist wie ein intelligenter Filter. Es erkennt, dass die meisten Ihrer Daten langweilig und repetitiv sind, und behandelt diesen Teil mit einem billigen, schnellen Werkzeug. Es spart die teure, intelligente KI nur für die seltenen, schwierigen Fälle auf. Auf diese Weise erhalten Sie das Beste aus beiden Welten: die Geschwindigkeit eines Roboters und die Intelligenz eines Professors, ohne den Preis für beides zu zahlen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →