Detect, Localize, and Explain: Interactive Hierarchical Log Anomaly Analytics with LLM Augmentation
本論文は、選択的 LLM 拡張と人間によるループ内改善を通じて、精密な異常検出、局所化、および説明を可能にするために、新規の階層型ログ抽象化とモジュール型オーケストレーション・フレームワークを活用するインタラクティブ可視化システム「Krone-viz」を提示する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが探偵で、ある犯罪を解決しようとしていると想像してください。しかし、いくつかの証言録ではなく、あなたに渡されるのは、混沌とした、途切れることのないラジオ放送の1万ページにわたる書き起こしテキストです。すべての文は会話の小さな断片ですが、それらはすべて1つの平坦なリストに無秩序に混ざり合っています。これがコンピュータの「ログ」が通常持つ姿です:システムが何をしているかを伝える無限のテキストのストリームですが、人間が理解するには信じられないほど難しい形式で記されています。
この論文は、この混沌を整理するための新しい方法であるKrone(およびその可視化ツールKrone-viz)を紹介しています。以下に、簡単な比喩を用いてその仕組みを説明します。
1. 問題:「平坦な」リスト対「物語」
現在のほとんどのツールは、ログを材料の平坦なリストのように扱います。ケーキが焦げたら、単に「ケーキがダメだ」と言うだけです。どの材料が間違っていたのか、いつ悪化したのか、なぜそうなったのかは教えてくれません。
- 従来の方法: 1万行のログエントリの平坦なリストを見て、クラッシュの原因となったたった1つのタイプミスを見つけようとする試みです。これは、すべての単語が1行に書かれている小説の中から、特定の文を見つけようとするようなものです。
- Krone の方法: Krone は、コンピュータが単にランダムなことをしているのではなく、物語の構造に従っていることを認識します。すべての行動には、誰(実体)、何(行動)、結果(状態)という3つの要素があります。
2. 解決策:ログのための「家系図」の構築
Krone は、その散らかった平坦なリストを取り出し、階層的な家系図(Krone-Tree と呼ばれる)に整理します。
- 比喩: 散らかったレゴブロックの山を、「車輪」、「窓」、「ドア」という箱に分類すると想像してください。次に、それらの箱を「車の部品」にまとめ、さらにそれらを「車全体」にまとめます。
- 仕組み: Krone は AI(大規模言語モデル、LLM)を使用してログを読み、「ああ、このログエントリは『セッション』(誰)が『開いた』(何)そして『開始された』(結果)に関するものだ」と判断します。これにより、すべてのログエントリがより大きな図の中でどこに位置するかを正確に把握できるマップが構築されます。
3. 探偵仕事:「分割統治法」
ログがこの木構造に整理されると、Krone はすべてのブロックを一つずつチェックするわけではありません。問題を発見するための、賢明で段階的な戦略を使用します。
- 「軽量」フィルター: まず、Krone はスペルチェックのような単純で高速なルールチェッカーを使用してログをスキャンします。ログエントリが正常に見える場合は、それを無視します。これは、明確な ID を持つ人々を警備員が素早く通すようなものです。
- 「AI」探偵: 単純なチェッカーが何か奇妙なものを発見した場合、初めて高価で超賢明な AI 探偵(LLM)が調査のために呼び出されます。
- 「ボトムアップ」戦略: Krone は、最小の詳細(「開始」や「失敗」のような「状態」レベル)からチェックを開始します。そこで問題が見つかった場合、即座に停止します。問題がすでに発見されているため、より大きな「行動」レベルや「実体」レベルをチェックする時間を無駄にしません。これにより、莫大なコストと計算資源を節約できます。
4. 「チートシート」:学びながら進める
Krone の最も素晴らしい機能の一つは、学習したことを記憶する点です。
- 比喩: 探偵がノートを持ち歩いていると想像してください。今日「壊れたドアの蝶番」に関する謎を解決したら、それを記録します。次に「壊れたドアの蝶番」を見たとき、高価な AI 探偵を再び呼ぶ必要はありません。ノートを参照するだけです。
- 仕組み: Krone は知識ベースを構築します。特定の種類のログシーケンスを分析し、それが正常(または異常)であると判断したら、その結果を保存します。後で同じシーケンスが現れた場合、Krone はその答えを再利用します。これにより、システムは時間とともに速く、かつ安価になります。
5. 可視化ツール:Krone-viz
この論文では、人間のエンジニアがこれらすべてをリアルタイムで観察できるダッシュボードKrone-vizを紹介しています。
- できること:
- ツリーの視覚化: 平坦なログが整理された家系図へと変化する様子を見ることができます。
- 不具合の特定: 木のどの「枝」が破損しているかを正確に確認できます。
- 説明の閲覧: AI がなぜ何かを間違っていると判断したのか、平易な英語で説明を記述します。
- AI の修正: AI が誤った場合、それを修正できます。システムはその修正から学習し、「ノート」を更新することで、同じ過ちを繰り返さないようにします。
まとめ
要約すると、Kroneはコンピュータのログを混沌としたテキストの壁として扱うのをやめ、代わりに構造化された物語として整理します。そして、エラーを発見するために「まず確認し、後で問い合わせる」という賢明な戦略を使用し、その発見を記憶することで、時間とともにより賢く、より安価になります。Krone-vizは、人間がこのプロセスを見守り、AI の推論を理解し、必要に応じて修正するための窓です。
注:この論文では、このシステムが従来の手法よりも優れており、コストが低いことを証明するために、標準的なデータセットである HDFS(一種のファイルストレージシステムログ)で特別にテストされました。現時点では、医療診断やその他の特定の産業での使用は主張されていません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。