CelerLog: Fast Log Parsing via Dynamic Routing
CelerLog は、動的ルーティング機構を用いてログを統計的グループと意味的グループに分類し、反復パターンの大部分を効率的な統計的手法で処理しつつ、複雑なケースにのみ LLM 推論を割り当てる高速かつ効果的なログパーサーであり、これにより既存の最先端手法と比較して大幅に遅延とコストを削減しながら卓越した性能を実現する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、毎秒何百万冊もの本(ログメッセージ)が異なる著者によって書き込まれている、巨大で混沌とした図書館の管理者だと想像してください。あなたの仕事は、後で特定の情報を検索できるように、これらの本を整理されたカテゴリに分類することです。このプロセスはログパースと呼ばれます。
この論文は、CelerLogという新しいシステムを紹介しています。これは、精度を損なうことなく、これらの本を迅速かつ安価に分類するという重大な課題を解決します。
以下に、簡単な比喩を用いてその仕組みを説明します。
問題:「万能型」の過ち
以前、これらの本を分類する方法は2つありました。
- 高速ロボット(構文ベース): このロボットは驚くほど高速です。単語の形状を見て、パターンに基づいて分類します。しかし、少し愚鈍です。奇妙で複雑な文が含まれる本があると、ロボットは混乱し、間違いを犯します。
- 賢明な教授(LLM ベース): これは超スマートな AI 教授です。どんなに複雑な文であっても、その意味を理解できます。決して間違いを犯しません。しかし、欠点があります。教授は遅く、雇うには高価で、すぐに疲れてしまいます。図書館のすべての本を教授に読ませようとすれば、時間がかかりすぎ、莫大な費用がかかります。
洞察:すべての本に教授は必要ない
論文の著者たちは、図書館を調査する中で興味深いことに気づきました。
- 98% の本は非常に反復的です。これらはすべて同じことを言っていますが、数字や名前が異なるだけです(例:「ユーザー John がログインしました」、「ユーザー Mary がログインしました」、「ユーザー Bob がログインしました」)。これらは高密度グループです。
- わずか 2% の本のみが、パターンに従わない、ユニークで奇妙な、あるいは単発的なイベントです。これらは低密度グループです。
著者たちは気づきました。なぜ、単に反復的な 98% の本を読むために、高価で遅い教授を雇う必要があるのでしょうか? これらの処理は、高速ロボットが容易にこなせます。教授は、稀で混乱を招く 2% の場合にのみ呼び出すべきです。
解決策:CelerLog(スマートな交通整理員)
CelerLog は、図書館の入り口にいる動的な交通整理員のように機能します。各本がどこへ行くかを決定する「動的ルーティング」システムを使用します。
チェックイン(ルーティング): 本が到着すると、交通整理員はそれを素早くスキャンします。
- もし本が、大勢の反復的な群衆(高密度グループ)に属しているように見える場合、整理員はそれを**「高速レーン」**へ通します。
- もし本が、ユニークで孤独、あるいは奇妙(低密度グループ)に見える場合、整理員はそれを**「低速レーン」**へ送り、賢明な教授に確認させます。
高速レーン(統計プロセッサ):
- ここでは、シンプルで超高速な統計ツールが作業を行います。反復的な本の群衆を見て、「さて、ここにいる全員は末尾の名前を除いて『ログインしました』と言っていますね。名前を空白に置き換えましょう」と言います。
- 結果: 瞬時で、無料です。
低速レーン(LLM プロセッサ):
- ここでは、賢明な教授(AI)がようやく作業を開始します。しかし、交通整理員が退屈なものをフィルタリングしてくれたおかげで、教授が読む必要があるのは、総本のほんのわずかな部分だけです。
- 結果: 教授は満足し、コストは低く抑えられ、複雑な本は完璧に分類されます。
結果:ウィンウィンの状況
この論文は、14 種類の異なる「図書館」(データセット)でこのシステムをテストし、CelerLog がゲームチェンジャーであることを発見しました。
- 速度: すべてを教授に任せる方法に比べて8 倍から 18 倍高速です。場合によっては、従来の高速ロボットよりも1.5 倍高速です。なぜなら、従来のロボットはあまりにも賢くなろうとして失敗していたからです。
- コスト: 莫大な金額を節約します。AI の通貨である**「トークン」の使用量を 80% から 94% 削減し、教授を呼び出す回数を86% から 90% 削減**します。
- 精度: 高速であるにもかかわらず、従来の方法よりも実際にはより正確です。高速ロボットが以前見逃していた複雑な詳細を見逃さず、教授が圧倒されて時折犯すような間違いも犯しません。
まとめ
CelerLog は、スマートなフィルターのようなものです。データの大部分は退屈で反復的であることを認識し、その部分は安価で高速なツールで処理します。高価で賢い AI を、稀で困難なケースのためにのみ温存します。このようにして、あなたは両方の利点を享受できます。ロボットのような速度と教授のような知性を、両方のコストを支払うことなく手に入れるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。