✨ 要約🔬 技術概要
あなたは、巨大でハイテクな港湾の警備員になったと想像してください。毎日、何千ものアラームが鳴り響きます。ドアが開いた、ライトが点滅した、倉庫で奇妙な音がした……。あなたの仕事は、それらのアラームが単にセンサーの上を歩いている猫によるものなのか、それとも本当に泥棒が侵入していることを意味しているのかを見極めることです。
現代のセキュリティシステム(この論文にあるようなもの)は、AI(大規模言語モデル、LLM)という「超知能型AIアシスタント」を使用して、あなたをサポートしています。しかし、これらのAIアシスタントには悪い癖があります。時として**「幻覚(ハルシネーション)」を起こすのです。たった一つの無害な不具合に対して、港全体をロックダウンするように自信満々に指示したり、実際にはLinuxサーバーに関するアラームであるにもかかわらず、Windowsコンピューター向けの解決策を提案したりすることがあります。彼らは賢いのですが、 「文脈(コンテキスト)」**が欠けているのです。彼らは港の歴史を知りませんし、膨大なノイズに混乱してしまいます。
ここに「DEFENGRAPH」が登場します。
DEFENGRAPHを、単なる新しいAIではなく、AIと共に働く**「超強力な司書であり探偵」**と考えてください。これは、2種類の特定のメモリから構築された「脳」をAIに与えるものです。
1. 2つのライブラリ(静的および動的知識グラフ)
DEFENGRAPHは、港のセキュリティを網羅した、相互に接続された巨大なマップ、すなわち**「知識グラフ」**を構築します。それは巨大な家系図のようなもので、人物の代わりに、コンピューター、アラーム、ハッカー、そして警備員を繋いでいます。
静的ライブラリ(歴史書): このマップの部分には、常に重要となるすべての情報が含まれています。港のレイアウト、典型的な攻撃パターン、そして過去に警備員が同様の問題をどのように解決したかを知っています。これは「組織としての記憶」です。
動的ライブラリ(ライブフィード): この部分は「ライブニュースティッカー」です。新しいアラームが入るたびにリアルタイムで更新されます。もしハッカーが現在特定のサーバーへの侵入を試みているなら、このライブラリは「今まさに」その状況を知っています。
2. 探偵のプロセス(仕組み)
新しいアラームが鳴ると、DEFENGRAPHは以下のようにAIをサポートします。
ステップ1:探索(グラフ・リトリーバル): 単に推測するのではなく、システムはマップを参照します。接続関係を辿るのです。「このアラームはサーバーAに関するものだ。サーバーAは何と通信している? 先週、サーバーAに何が起きた? 以前、ハッカーがこれを試みたことはあるか?」 混沌としたライブラリ全体ではなく、関連する小さな断片(サブグラフ)を抽出します。
ステップ2:フィルタリング(LLMコンテキスト・フィルター): 時として、マップが余計な情報(例えば、3年前にユーザーがパスワードを変更した記録など、今日の脅威とは無関係なもの)を多く引き出してしまうことがあります。AIは**「ふるい」**として機能し、「グレーのノイズ」を濾過して、現在の状況に実際に重要な「ブルー」のクリティカルな情報だけを残します。
ステップ3:再ランク付け(推論リランカー): 次に、システムはAIに問いかけます。「残された手がかりの中で、今最も重要なものはどれか?」 AIは、情報の新しさや、それがストーリーにどれだけ合致しているかに基づいてスコアを付けます。
ステップ4:アクション(防御生成): 最後に、AIはこのクリーンで、フィルタリングされ、ランク付けされた情報を使用して、警備員のための具体的かつ安全な計画を作成します。「すべてをロックダウンせよ」と言う代わりに、「昨日見られたパターンと一致するため、この特定のIPアドレスをブロックせよ」といった具体的な指示を出します。
なぜこれが重要なのか?
研究者たちは、攻撃チーム(レッドチーム)が偽の海事港への侵入を試み、防御チーム(ブルーチーム)がそれを阻止しようとする「サイバーレンジ(模擬環境)」でこのシステムをテストしました。
彼らは、DEFENGRAPHがない場合、AIがしばしば誤った判断を下したり、不適切な行動(軽微な不具合に対してネットワーク全体を遮断するなど)を提案したりすることを発見しました。しかし、DEFENGRAPHを使用すると:
より賢くなった: AIは、真の脅威をより高い頻度で正しく特定できました。
より正確になった: AIが提案するアクションは、人間の専門家が行うものと一致しました。
幻覚が止まった: 事実を捏造したり、誤ったオペレーティングシステム向けの修正案を提示したりすることがなくなりました。
要するに、DEFENGRAPHは、過去の構造化されたマップと現在のライブフィードを与えることで、賢いが混乱しやすいAIを、**「経験豊富なベテラン」**へと変貌させ、現実に基づいたアドバイスを確実に提供させるのです。
技術要約:DEFENGRAPH
問題提起 大規模言語モデル(LLM)はサイバーセキュリティの意思決定において有望視されているが、高リスクかつ時間とともに進化する環境においては、決定的な限界に直面している。具体的には、ハルシネーション(幻覚)を起こしやすく、時間的推論に苦しみ、特定のシステムコンテキストへの接地性(グラウンディング)を欠いている。従来の検索拡張生成(RAG)のアプローチは、表面的な、あるいは埋め込みベースの類似性に依存しているため、無関係なドキュメント(例:Linuxのアラートに対してWindowsのインシデントチケットを検索してしまう等)を抽出し、LLMの推論を混乱させることが多い。さらに、サイバーセキュリティデータは低信号対雑音比(low signal-to-noise ratio)を特徴としており、膨大な量の良性または誤解を招くログ(例:打ち間違えたパスワード)を含んでいるため、標準的な知識グラフ(KG)検索手法では効果的にフィルタリングできない。核心となる課題は、長期的なドメイン知識と、リアルタイムで進化するイベントコンテキストの両方にLLMの出力を接地させ、忠実で時間的に意識された防御戦略を提供できるシステムを構築することである。
手法:DEFENGRAPHフレームワーク 著者らは、ブルーチームの防御者を支援するために設計された、二層の知識グラフ強化型RAGフレームワークであるDEFENGRAPH を提案している。本システムは、以下のパイプラインを通じて、構造化された知識表現とLLMベースの生成を統合する。
二層知識グラフ構築(Dual-Layer Knowledge Graph Construction):
静的知識グラフ(SKG): サイバーレンジの設計図やドキュメントから派生した、長期的なインフラ知識、システムアーキテクチャ、典型的な攻撃者の振る舞い、および過去の防御プレイブックをエンコードする。
動的知識グラフ(DKG): ライブ演習中に記録された、時間とともに進化するセキュリティイベント、攻撃者の痕跡、および防御者のチケットアクションを捕捉する。ノードにはアラート、チケット、IP、ファイルが含まれ、エッジは時間的および意味的な関係をエンコードする。
グラフベース検索プロセス(Graph-Based Retrieval Process: GRP): SIEM(Wazuh)のアラートを受信すると、システムはクエリグラフを構築し、以下の手法を用いてSKGおよびDKGから関連するサブグラフを検索する:
意味ベースのトリプルマッチング(Semantic-based Triple Matching: STM): 学習済み言語モデルを使用して、クエリと知識ベース間のトリプル(エンティティ、リレーション、エンティティ)をエンコードおよび照合する。
パス伝播スコア(Path Propagation Score: PMC): 隣接するトリプルの特徴を集計してパス照合スコアを計算し、最も関連性の高い経路を特定する。
サブグラフ構成(Subgraph Composition): 最も一致度の高いパスをマージしてサブグラフを構成し、周囲のコンテキストを捉えるために2ホップ隣接ノードをサンプリングする。
LLMベースのコンテキストフィルタリングと再ランキング: 検索されたサブグラフに内在するノイズに対処するため、DEFENGRAPHは2つのLLM駆動型モジュールを採用している:
コンテキストフィルタ(Contextual Filter: CF): 取得されたパスを特定のアラートコンテキストに対して評価し、最も関連性の高いエンティティとパスを選択することで、無関係な「グレー」ノードを排除する。
推論リランカー(Reasoning Re-ranker): フィルタリングされたパスを、アラートとの関連性および履歴知識に基づいて再順序付けし、**時間的重み割り当て(Temporal Weight Assignment)**を組み込む。これにより、クエリに近い時間のエンティティに高い重みを割り当て、システムが最近の進化する脅威を優先するようにする。
防御活動の生成(Defense Activity Generation): 最終的にランク付けされた推論パスはLLMのプロンプトに埋め込まれ、人間の防御慣行に沿った、コンテキストを考慮した実行可能な緩和戦略を生成する。
主な貢献
DEFENGRAPHフレームワーク: 静的なドメイン知識と動的なリアルタイムイベントデータを組み合わせ、コンテキストを考慮した防御戦略を生成する、新しい時間的KG-RAGフレームワーク。
ACDCサイバーレンジデータセット: 海事ポート環境をシミュレートしたライブRed vs. Blueチーム演習から派生した、包括的なサイバーセキュリティデータセットの構築と公開。これには、820万件以上のファイアウォールログ、610万件のWazuhアラート、326件のインシデントレスポンスチケット、およびRed Teamの痕跡が含まれており、現実的でノイズが多く、不均質なデータソースを代表している。
性能向上: DEFENGRAPHが、複数のモデル(GPT-4o, LLaMA-3, DeepSeek-R1, QWen-3)において、LLMの忠実性と解釈可能性を大幅に向上させ、人間が作成したグランドトゥルース(正解)により密接に一致する防御推奨事項を生成することを実証した。
実験結果 フレームワークはACDCデータセット上で4つの主要なLLMを用いて評価され、LLMのみ、ハイブリッドRAG、およびGraphRAGを含むベースラインと比較された。主な知見は以下の通りである:
推論再現率(Reasoning Recall: RAR): GPT-4oにおいて、DEFENGRAPHは推論再現率を61.45%(SKGのみ)から73.49%(フル構成)へと向上させた。同様の向上が他のモデル(例:LLaMA-3: 46.99% → 61.45%)でも観察された。
チケットアクション再現率(Ticket-Action Recall: TAR): システムは、グランドトゥルースの防御アクションのより高い割合を回収した。GPT-4oにおいて、TARは52.17%から72.46%に増加した。
適合率と故障率(Precision and Fault Rates): 適合率(TAP)は緩やかな上昇(GPT-4oで24.49% → 29.24%)を見せたが、システムは低い故障アクション率(4%未満)を維持しており、エラーは主に人間による識別が容易な過剰反応や偽陽性であった。
コールドスタートの堅牢性: 事前チケット履歴がないシナリオ(DKGのリセット)においても、システムは強力な推論能力を維持したが、アクションの再現率は低下した。これは、精密なアクションの整合性における動的コンテキストの重要性を浮き彫りにしている。
アブレーション研究: 実験結果は、両方の静的および動的KGが不可欠であることを確認した。DKGを除去するとTARが約20%低下し、SKGを除去すると約25%の低下を招いた。これは、歴史的な構造とリアルタイムのコンテキストの両方の必要性を示している。
意義 本論文は、DEFENGRAPHを、接地された時間的意識を持つサイバーセキュリティ意思決定支援のための最先端のソリューションとして位置づけている。侵入検知、攻撃追跡、または脅威インテリジェンスの構造化に焦点を当てた従来のKGベースのシステムとは異なり、DEFENGRAPHは実行可能でチケットに整合した緩和ステップ の生成を直接の対象としている。二層のグラフとLLMベースのフィルタリングおよび再ランキングを統合することで、本フレームワークは、ノイズの多い構造化されたドメインにおける従来のRAGの脆弱性に対処し、LLMが静的なシステムトポロジーと攻撃の動的な進化の両方を反映した忠実な推論を提供することを可能にする。著者らは、このアプローチが、KGによる理解と、ブルーチームにとって運用上有用なレスポンスガイダンスとの間の溝を埋めるものであると主張している。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×