← 最新の論文
💻 computer science

Parser-Free Querying of Security Logs

本論文は、自動的に抽出されたログ形式の文脈に基づいた大規模言語モデルを活用して自然言語によるセキュリティクエリの実行可能コードを生成するシステム「Sieve」を導入し、複雑な時系列およびイベント間ログ分析におけるエラー発生率を、手動スクリプトと比較して大幅に低減することを示しています。

原著者: Evan Luo, Julien Piet, David Wagner

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Evan Luo, Julien Piet, David Wagner

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが犯罪を解決しようとするセキュリティ探偵だと想像してください。あなたの手元には、サーバー、ファイアウォール、ユーザーアカウントなど、異なる人々によって残された数百万ページに及ぶ手書きのメモ、領収書、ログという膨大な証拠の山があります。問題は、誰もがそれぞれ自分勝手な乱雑で不統一な筆跡で書いていることです。ある人は日付を「Jan 1」と書き、別の人は「01/01」と書き、さらに別の人は単に「Monday」と書きます。メモは付箋に書かれているものもあれば、ナプキンのものもあり、インクの色も様々です。

事件を解決するには、「午前 2 時から 4 時の間に誰かが建物への侵入を試みたすべての事例を示せ」といった具体的な質問をする必要があります。

旧来の方法:過労の図書館員

従来、セキュリティチームはこの問題を解決するために、図書館員(パーサー)のチームを雇い、すべてのメモを読み、筆跡のスタイルを特定し、すべてを完璧で統一されたスプレッドシートに書き直すことで対応しようとしました。

  • 良い点: スプレッドシートが完成すれば、質問に答えるのは迅速で簡単です。
  • 悪い点: スプレッドシートを作るのに永遠の時間がかかります。新しい人が少し異なる方法でメモを書き始めるたびに、図書館員たちは停止し、新しいスタイルを学び、ルールを書き直さなければなりません。誰も見たことのない新しいタイプのメモが現れた場合、図書館員が修正するまでシステム全体が機能しなくなります。

代替案:grep 探偵

もう一つの選択肢は、図書館員を完全にスキップすることです。あなたは単に虫眼鏡(grep のようなツール)を手に取り、生々しく乱雑なメモを自分でスキャンします。

  • 良い点: すぐに始められます。図書館員を待つ必要はありません。
  • 悪い点: 考えられるすべての筆跡スタイルが正確にどのようなものかを知る必要があります。「侵入(break-in)」という言葉のバリエーションを一つでも見逃せば、その手がかりを見逃すことになります。また、「60 秒以内に 2 つの異なるドアから入った人物を見つけよ」といった複雑な質問は、テキストの行を手動でスキャンするだけでは極めて困難です。

新しい解決策:Sieve(賢い翻訳者)

この論文は、あなたのために即座にカスタムツールを作成できる超賢い翻訳者のようなシステム、Sieve を紹介します。

Sieve がどのように機能するか、簡単な比喩を用いて説明します。

  1. 質問: あなたは Sieve に平易な英語で質問をします。「5 分間のウィンドウ内で 10 回以上侵入を試みたすべての IP アドレスを特定せよ。」
  2. 迅速なスキャン: Sieve は百万ページに及ぶ本全体を読むのではなく、最初の数ページを素早くめくって筆跡がどのようなものかを確認します。メモが書かれるさまざまな方法の小さな「チートシート」を作成します(例:「ああ、時には'Failed password'と言い、時には'Auth failure'と言うんだ」)。
  3. コード作成者: Sieve はあなたの質問とこの小さなチートシートを非常に賢い AI(大規模言語モデル)に送ります。AI は本全体を読むのではなく、チートシートを使って、あなたの答えを探すために特別に設計されたカスタムコンピュータスクリプト(小さなロボットプログラムのよう)を作成します。
  4. 実行: このカスタムスクリプトは生々しいメモ上で実行されます。AI がチートシートに基づいて作成したスクリプトなので、「Failed password」と「Auth failure」の両方を正確に見つけ、それらを数える方法を知っています。
  5. 結果: スクリプトが答えを返します。スクリプトがミス(タイプミスなど)をした場合、Sieve はそのエラーを検知し、AI に伝え、スクリプトの書き直しを依頼します。正しくなるまで最大 4 回試行します。

これが画期的な理由

この論文は、5 種類の異なるログにわたる 133 の異なるセキュリティ質問でこの手法をテストしました。その結果は以下の通りです。

  • 難しいケースでは人間よりも賢い: 質問が単純な場合(例:「'error'という単語を見つけよ」)、Sieve は即席のスクリプトを作成する人間の専門家と同程度に優れていました。しかし、質問が難しい場合(例:「時間と異なる人々をまたぐパターンを見つけよ」)、Sieve はゼロからスクリプトを作成しようとした人間よりも3 倍少ない間違いしか犯しませんでした。
  • 完璧な図書館員を事前に必要としない: Sieve は事前に作られたスプレッドシートを必要としません。乱雑な生々しいメモに直接機能します。
  • シンプルである方が優れている: 論文は、筆跡スタイルを特定するために高価で凝った AI を使う必要はないことを発見しました。特定のフレーズが現れる頻度を数えるだけのシンプルで高速なアルゴリズムは、複雑な方法と同じくらい効果的に機能します。
  • 安全で信頼性が高い: AI は単に答えを推測するのではなく、通常のコンピュータプログラムのように実行されるコードを作成します。つまり、結果は決定論的(同じ質問には常に同じ答えが返る)であり、その仕組みをコードを見て正確に確認できます。

結論

Sieve は、生テキストを検索する速さと構造化データベースの強力な機能の間の溝を埋めます。これにより、セキュリティアナリストは平易な英語で複雑な質問をし、エンジニアが新しいデータベーススキーマを構築するのを待つことなく、また複雑なスクリプトを自分で書くのに苦労することなく、即座に正確な答えを得ることができます。Sieve は、一度に一つの質問ごとに、「乱雑なノート」をその場で検索可能なデータベースに変えるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →