SCOPE: Rethinking Attack Analysis as Uncertainty-Aware Security Reasoning under Incomplete Observations
本論文は、行動中心のグルーピング、分布的TTPマッピング、およびTop-Kビタビ・シーケンス推論を統合することで、不完全な観測下においても一貫した攻撃行動を再構成し、精度と堅牢性の両面で既存のベースラインを凌駕する、不確実性を考慮した学習不要のフレームワークであるSCOPEを提案する。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
デジタル世界において、セキュリティチームはコンピュータやサーバからのデータの流れに絶えずさらされています。これらのログは、ファイルの開封、プログラムの開始、接続の確立といった、マシンが行うあらゆる動作を記録しています。長年、サイバーセキュリティの目標は、これら散在するメモを繋ぎ合わせ、攻撃の全体像を把握することでした。課題は、これらのメモがしばしば不完全であることです。攻撃者は、足跡を隠したり、ログを削除したり、イベントの順序をかき乱したりすることに長けています。さらに、単一のコンピュータ上の動作は、文脈に応じて多くの異なる意味を持ち得ます。例えば、プログラムの開始は、無害なアップデートであることもあれば、窃盗の始まりであることもあります。従来の手法は、既知の脅威に対して特定のパターンを照合することでこれを解決しようとしますが、証拠が乱れていたり、攻撃者が使い慣れたツールを予期せぬ新しい方法で使用したりした場合、しばしば失敗します。
韓国の佳成(カチョン)大学の研究チームは、この問題に対する新しい考え方を提案しました。彼らはそのシステムを「SCOPE」と呼んでいます。すべてのログエントリを硬直した箱に押し込めようとする代わりに、SCOPEは分析を「不確実性下での推論」のプロセスとして扱います。このシステムは、受け取るデータに欠陥や不完全さがあることを受け入れ、欠落した断片があっても崩壊しないモデルを構築します。研究者たちは、真のイベントシーケンスがすでに文書化されている35種類の既知の攻撃シナリオを用いて、このシステムをテストしました。その結果、デジタル証拠の半分が失われていたとしても、SCOPEは既存の手法よりもはるかに高い精度で攻撃の全体的な経路を再構成できることが分かりました。より重要なことに、このシステムは、既知の構成要素が新しい順序で配置されている限り、これまで見たことのない複雑な攻撃パターンを特定することができました。
ログ分析における核心的な困難は、個々のイベント自体が小さすぎて、それ単体では物語を語れないという点にあります。単一のログエントリはファイルの作成を示しているかもしれませんが、なぜそれが行われたのかまでは説明しません。これを解決するために、研究者たちはまず、関連するイベントをより大きく意味のある塊へとグループ化します。彼らは、時間的に近くで発生したイベント、同じコンピュータプロセスに関わるイベント、あるいは同じファイルやネットワーク接続に触れるイベントを探します。これにより、単なる孤立したファイル変更のリストではなく、パスワードを盗もうとするハッカーの動きといった、攻撃における一貫したステップを表す「行動グループ」が作成されます。このグルーピングは堅牢(ロバスト)に設計されています。途中のイベントが欠落したり削除されたりしても、残りの断片が共有された文脈によって結びついているため、システムは依然としてそのグループを認識することができます。
これらのグループが形成されると、次にシステムは「各グループが実際に何を意味しているのか」を判断するという課題に直面します。かつての手法では、システムはグループに対して「パスワード窃取」のような単一のラベルを割り当てようとしてきました。もしそのラベルが間違っていれば、分析全体が破綻してしまいます。SCOPEはこの罠を回避するため、同時に複数の可能性を保持し続けます。各行動グループに対して、異なる尤度(ゆうど)を持つ潜在的なラベルのリストを生成します。すぐに最終決定を下すのではなく、全体像を検討してから答えを出すために、これらの選択肢を不確実な状態のまま保持します。このアプローチは、ある行動が次に何が起こるかによって、異なるものに見え得るという事実を認めているのです。
最終ステップは、これらのグループを完全な連鎖へと繋ぐことです。研究者たちは、攻撃の論理的な流れと物理的な接続という2つの主要な要因に基づいて、ある行動が別の行動にどれほど適切に続くかをスコアリングする方法を用いています。彼らは、データを盗む前にシステムへのアクセス権を得るなど、特定の種類の動作は通常、特定の順序で行われることを知っています。また、あるステップで作られたファイルが次のステップで使用されるといった、物理的なリンクも探ります。これらの論理的および物理的な手がかりを組み合わせることで、システムは証拠が欠落している箇所を埋めることができます。もしステップが欠落していても、システムは停止しません。単に生存しているステップ同士を接続し、その「跳躍」が通常より大きいことを認めつつも、それが可能であることを示します。これにより、タイムラインの一部が消去されていても、連続した物語を再構成することが可能になります。
研究者たちは、正確に何が起きたかの正解(グラウンド・トゥルース)の記録を含む35の攻撃シナリオのデータセットを用いて、このアプローチをテストしました。彼らは、特定のパターンを探すルールベースのシステム、接続をマッピングするグラフベースのシステム、そして物語を推測するために大規模言語モデルを使用するシステムを含む、いくつかの主要な手法と比較しました。SCOPEはそれらすべてを凌駕しました。トップ5の推測の中に、攻撃で使用された特定のテクニックを正しく特定できた割合は約84%でした。イベントの全シーケンスを再構成する能力を測定した際、スコアは0.68に達し、これは次に優れた手法よりも大幅に高い数値でした。
最も重要な発見の一つは、システムが欠落したデータをどのように扱ったかという点です。研究者たちは、攻撃者が足跡を消すことに成功したシナリオを模して、最大50%のログイベントがランダムに削除された状況をシミュレートしました。他のシステムのパフォーマンスがデータの消失とともに急激に低下した一方で、SCOPEは安定していました。証拠の半分が失われていても、約0.57の再構成スコアを維持しており、これはすべてのデータが存在する場合の最高スコアをも上回っていました。これは、不確実性について推論し、生存している証拠の断片を繋ぎ合わせるという同システムの能力が、現実世界のデータ損失に対して極めて高い耐性を持っていることを示唆しています。
また、このシステムは新しい攻撃の組み合わせを認識する能力も示しました。サイバーセキュリティの世界では、攻撃者は既知のツールを取り入れ、それを新しい方法で使用することがよくあります。従来のシステムは、特定の既知のシーケンスのみに学習されているため、ここで失敗することが多いのです。しかし、SCOPEは特定のシーケンスを記憶することに依存していません。代わりに、異なる攻撃ステップ間の適合性を理解しています。テストにおいて、SCOEは、トレーニングデータには一度も一緒に現れなかった既知のテクニックの整合性のある連鎖を、正常に再構成しました。「コヒーレント・ノベル(整合性のある新規性)」率は0.83に達し、これは、それらの新しい組み合わせが発生したケースの83%において、正しく特定し連結できたことを意味します。これは、個々の構成要素さえ馴染みのあるものであれば、未知の脅威に対しても知識を一般化できることを示しています。
SCOPEの設計における重要な選択は、人工知能の使い方です。研究者たちは、自然言語を理解できるタイプの人工知能である大規模言語モデルを使用しましたが、それは「行動グループを平易なテキストで記述する」という一つの特定のタスクのためだけに限定されました。モデルは、攻撃が何であるか、あるいは各断片がどのように適合するかについての最終決定を下すことはありません。それらの決定は、ステップ間の接続をスコアリングする、決定論的な数学的プロセスによって行われます。この分離により、システムがデータに基づかない詳細を「幻覚(ハルシネーション)」として捏造することを防いでいます。言語モデルはあくまで「翻訳者」として機能し、生のコンピュータログをスコアリング・システムが理解できる記述へと変換し、一方でスコアリング・システムが最終的な連鎖の厳格な審判としての役割を果たします。
研究者たちは、自分たちの研究が制御されたデータセットに基づいていること、そして現実のエンタープライズ環境ははるかに複雑であることを認めています。彼らは、このシステムが低レベルの検知トリガーの代替物ではなく、むしろそれらのトリガーが生成するデータを理解するためのツールであると述べています。このシステムは、不完全でノイズの多い実際のログの性質に合わせて設計されており、証拠が断片化されている場合でも、攻撃のナラティブ(物語)を復元する方法を提供します。攻撃分析を単純なパターンマッチングではなく、「不確実性下での推論」の問題として扱うことで、研究者たちは、攻撃者が足跡を隠すために用いる策略に対して、より強固なフレームワークを作り上げました。その結果は、攻撃分析の未来が、より多くのデータを見つけることではなく、残されたデータを用いていかに効果的に推論するかにあることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。