← 最新の論文
💬 NLP

Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations

本論文は、LinuxおよびWindowsシステムにおける50以上のセキュリティシナリオにわたる包括的なベンチマークデータセットであるAuditBenchを紹介し、4つの重要なインシデント対応タスクにおける5つの最先端LLMの性能、エラープロファイル、および説明能力を評価および分析するものである。

原著者: Aniket Anand, Yiwei Hou, Daniel Fields, Alex Kantchelian, David Tao, Kurt Thomas, Grant Ho

公開日 2026-06-10
📖 1 分で読めます☕ さくっと読める

原著者: Aniket Anand, Yiwei Hou, Daniel Fields, Alex Kantchelian, David Tao, Kurt Thomas, Grant Ho

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大で賑やかな都市のセキュリティ責任者だと想像してください。毎日、何千ものカメラやセンサー(これらは監査ログと呼ばれます)が、あらゆる足跡、ドアの開閉、車のエンジンの始動を記録しています。ほとんどの場合、人々はただ仕事に行ったり、食料品を買ったりしているだけです(正常な活動)。しかし時には、泥棒が忍び込み、鍵を開け、金庫を盗んでいくこともあります(攻撃)。

問題は、都市が膨大な量のデータを生成するため、人間の警備員がそのすべてを見守ることができないことです。彼らは誤報に圧倒されたり、ノイズの中に隠れた本当の犯罪を見逃したりしてしまいます。

ここに、**大規模言語モデル(LLM)**が登場します。これらは、数百万ページのログを数秒で読み解くことができる、超スマートで疲れを知らない「デキる新人刑事」のようなものです。しかし、彼らを雇う前に、私たちは知っておく必要があります。彼らは本当に犯罪を解決できるのか、それともただパニックに陥って無実の人を犯人と決めつけるだけなのか?

この論文は、これらのAI刑事たちがセキュリティログを調査する能力があるかどうかをテストするために特別に設計された「最終試験」、AuditBenchを紹介するものです。

試験:AuditBench

研究者たちは、51種類の異なるシナリオを含むテストスイートを作成しました。

  • 「教室」(ラボデータ): 彼らは、ハッカーがファイルを盗むことから、通常のユーザーが単にソフトウェアをインストールすることまで、あらゆる事象をシミュレートした25の仮想コンピュータ上のシナリオを作成しました。
  • 「現実世界」(OpTCデータ): 彼らは、すでに既知の「正解(グラウンドトゥルース)」が存在する、大規模で現実的なデータセット(DAR_PA OpTC)から26の複雑なシナリオを取り入れました。

この試験には、刑事のチェックリストのような4つの主要なタスクがありました:

  1. トリアージ(分類): 「このアラートは本当の犯罪か、それとも誤報か?」
  2. 潜伏先(永続性): 「犯罪者はシステム内に永遠に留まるための秘密のバックドアを設置したか?」
  3. 脱出ルート(横展開): 「犯罪者は感染を広げるために、あるコンピュータから別のコンピュータへと移動したか?」
  4. 強奪(データ持ち出し): 「犯罪者は機密ファイルを盗み、外部へ送信したか?」

結果:AIが得意なこと(そして苦手なこと)

研究者たちは、5つのトップクラスのAIモデル(GPT-5やGemini 2.5 Proのような巨人を含む)をこの試験でテストしました。以下に、その結果を日常的な言葉に翻訳して示します。

1. 「被害妄想の刑事」問題
ほとんどのAI刑事は、過剰に疑い深い傾向がありました。それは、バッグを持っている人を見て、すぐに爆弾が入っていると決めつける警備員のようです。

  • 結果: AIは「強奪(データの持ち出し)」を見つけるのは得意でしたが、無実の人を無視することには非常に劣っていました。彼らは大量の正常な活動を「攻撃」としてフラグ立てし、誤報の洪水を作り出しました。

2. 「大きいことは必ずしも善ではない」
最大で最も高価なAIモデルが、最高の刑事であると考えるかもしれません。しかし驚いたことに、必ずしもそうではありませんでした

  • 結果: 時には、より小さくて安価なモデルの方が、巨大なモデルと同等、あるいはそれ以上のパフォーマンスを発揮しました。結局のところ、この特定の仕事においては、必ずしもスーパーコンピュータは必要ではなく、スマートでコンパクトなモデルでも十分に機能する場合があるのです。

3. ログの「言語」が重要である
研究者は、2つの方法でAIにログを入力しました。

  • 生ログ(Raw Logs): 起きたことのすべてを記録した、編集されていない未加工の書き起こし(混沌とした部屋の生録音のようなもの)。
  • エッジ表現(Edge Representation): イベント間のつながりを強調した、整理・要約されたバージョン(容疑者同士を線で結んだ探偵のホワイトボードのようなもの)。
  • 結果: 一部のモデルにとって、「整理された」バージョンは彼らをより賢く、より速くしました。他のモデルにとっては、生データでも問題ありませんでした。それは、モデルの「学習スタイル」によります。

4. 「プロンプト」は取扱説明書である
AIへの質問の仕方が、回答を変えてしまいます。研究者は、指示(プロンプト)の書き方を2通り試しました。

  • 結果: あるAI刑事を天才たらしめるプロンプトが、別のAIを不器用にしてしまうこともありました。「万能な取扱説明書」というものは存在しません。使用する特定のAIに合わせて、指示を微調整する必要があります。

5. AIの「推論」はしばしば優秀であった
AIが実際に攻撃を正しく検知したとき、その説明は通常、非常に優れていました。AIは、その犯罪を証明する正確なファイルやコマンドを指し示すことができました。

  • 落とし穴: AIが間違っていたとき(誤報のとき)、その推論はしばしば**「奇妙な名前」「高い頻度」**に基づいたものでした。
    • 例: もしファイル名が delete_logs.bat であった場合、AIはそれが証拠隠滅を図る犯罪者によるものだと判断しましたが、実際にはそれは単なる通常のシステムクリーンアップスクリプトでした。
    • 例: もしプログラムが1秒間に1,000回実行された場合、AIは「これは怪しい!」と考えましたが、実際にはそれは単なる通常のソフトウェアアップデートでした。

大きな教訓

この論文は、「AIがセキュリティチームに取って代われる」と言っているわけではありません。代わりにこう言っています。**「これが、AIがこの仕事においてどれほど優れているかを測るための『定規』であり、避けるべき『罠』である」**と。

  • セキュリティチームへ: 最も高価なAIをただ買うだけではいけません。より小さなモデルをテストしてください。「パラノイア(被害妄想)」的な傾向が誤報を生むことに注意してください。
  • AI開発者へ: モデルが大きければ大きいほど良いとは限らないと考えてください。最高の結果を得るためには、データの与え方(エッジ表現)を変えたり、指示(プロンプト)を微調整したりする必要があるかもしれません。
  • すべての人へ: AIは強力なツールですが、特にAIが不当に疑い深くなったときには、人間によるダブルチェックが必要です。

研究者たちは、他の人々がこれらのデジタル刑事たちをテストし、改善し続けられるよう、すべてのデータ、コード、および試験問題を公開しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →