From Telemetry to Techniques: Behavior-Centric MITRE ATTCK Technique Classification Through Sysmon Event Correlation
本論文は、Sysmonテレメトリを用いたMITRE ATT&CKテクニック分類のための振る舞い中心のフレームワークを提示し、GUIDベースのイベント相関が、時間的相関や従来の機械学習手法よりも、敵対的活動の特定において優れていることを実証するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、犯罪を解決しようとしている探偵だと想像してください。ただし、指紋や足跡を探すのではなく、コンピュータが残した膨大な、混沌としたデジタル上の足跡を追っています。この分野はサイバーセキュリティと呼ばれ、「犯罪現場」はコンピュータの内部ログブックです。長い間、探偵たちは特定の既知の「似顔絵」――例えば特定のファイル名や既知のハッカーのアドレス――を探すことで犯人を捕まえようとしてきました。しかし、現代のハッカーは巧妙であり、常に服を着替えたり仮面を被ったりして姿を変えます。そのため、こうした古い「似顔絵」による手法は失敗することがよくあります。
これらの変幻自在の者たちを捕まえるために、科学者たちは今、異なるアプローチを試みています。単一の足跡を見るのではなく、足跡が語る「物語」を見ようとしているのです。このように考えてみてください。もし、ある人物が銀行に入り、金庫へ走り、窓を割り、最後にバッグを持って走り去るのを見たら、その人物の名前を知らなくても、銀行強盗が行われていることは分かります。必要なのは、行動のシーケンス(順序)を見ることです。この論文は、乱雑なコンピュータログの山を、攻撃者が何をしているのかを示す明確で読み取り可能な物語へとどのように変換するかを探求し、そしてスマートなコンピュータプログラムを用いて、攻撃者が具体的にどのような「手口」を使っているのかを特定する方法について論じています。
デジタル探偵の新しいツールキット
コンピュータセキュリティの世界には、MITRE ATT&CKと呼ばれる有名なプレイブック(手順書)があります。これは、ハッカーがシステムに侵入するために使うあらゆる異なるトリックをまとめた、巨大な百科事典のようなものです。これは単に「悪党」をリストアップするだけではありません。「パスワードの窃取」、「ファイルの隠蔽」、あるいは「他のコンピュータへの横展開(ラテラルムーブメント)」といった、彼らの具体的な動きを分類しています。この研究の目的は、コンピュータの生の活動ログを見て、「ああ、何が起きているか分かった。これは『資格情報のダンプ(Credential Dumping)』の手口だ」とか、「これは『横展開(Lateral Movement)』の手口だ」と言えるシステムを構築することでした。
研究者たちは、Sysmonという特殊なツールを使用しました。Sysmonは、瞬きをすることのない、コンピュータ内部の非常に観察力の鋭い監視カメラだと想像してください。それは、すべてのプログラムの起動、作成されたすべてのファイル、インターネットへのすべての接続、そしてシステム設定へのすべての変更を記録します。しかし、ここに問題があります。Sysmonは「すべて」を記録しますが、それは非常にノイズが多く、乱雑な方法で行われます。それは、都市のあらゆる人の瞬き、呼吸、歩みを記録する監視カメラのようなものですが、誰が誰と一緒に歩いているのか、あるいはどのような順序で動いているのかまでは教えてくれません。単一の瞬きだけを見ても、何も学ぶことはできません。映画の全体を見る必要があるのです。
大きな問い:どのように点と点を結びつけるのか?
研究者たちは、シンプルかつ極めて重要な問いを投げかけました。「これらの散らばった足跡を、どのようにすれば一貫した物語として最も良く結びつけることができるのか?」
彼らは、イベント同士をリンクさせる2つの主要な方法をテストしました。
- 「親は誰か?」メソッド(GUIDベース): コンピュータ内では、すべてのプログラムに固有のID番号があります。あるプログラムが別のプログラムを開始するとき、それは親が子供を持つようなものです。研究者たちは、これらのイベントを「家系図」を辿ることでリンクさせようと試みました。もしプログラムAがプログラムBを開始し、プログラムBがファイルを開いたなら、それらは同じ「家族」に属するため、それらのイベントを関連付けました。これは、時刻に関係なく、家族の家系図を辿ることで犯罪グループを追跡するようなものです。
- 「何が先に起きたか?」メソッド(時間ベース): このメソッドは、単純に時間によってイベントをリンクさせます。もし2つのことが1秒以内に発生した場合、研究者たちはそれらが関連していると仮定しました。これは、「これら2人が同じ時間に同じ部屋にいたのだから、協力関係にあるに違いない」と言うようなものです。
実験:コンピュータに物語を読ませる
これらの手法をテストするために、研究者たちは本物の銀行に本物のハッカーが侵入するのを待つことはしませんでした。代わりに、安全で制御された実験室を設置し、Atomic Red Teamというツールを使用して攻撃をシミュレートしました。彼らはMITRE ATT&CKのプレイブックにある特定のトリックを演じ、実際の攻撃と全く同じに見える数千のSysmonログを生成しました。
その後、これらのログを2種類の「生徒」コンピュータに投入しました。
- 伝統的な生徒たち: これらは古典的な機械学習モデル(Random ForestやLightGBMなど)です。これらはパターンを見つけるのは得意ですが、データが非常にクリーンで整理されている必要があります。
- スーパー・リーダー(超読解者): これらはTransformer(具体的にはSecBERTやSecureBERT)と呼ばれる高度なAIモデルです。これらは、インターネット全体を読み込み、言葉やシーケンスの意味と文脈を理解するエキスパートであるコンピュータのようなものです。彼らは一文を読み、その背後にある物語を理解することができます。
また、研究者たちは**クラス不均衡(Class Imbalance)**という厄介な問題にも対処しなければなりませんでした。データの中では、あるトリック(「System Binary Proxy Execution」など)は何百回も発生する一方で、別のトリック(「Subvert Trust Controls」など)は数回しか発生しません。これは、90%の生徒の名前が「ジョン」で、一人だけ「ゾーイ」という名前の生徒がいる教室のようなものです。教師が名前を当てる訓練を受けると、教師は毎回「ジョン」と答えて高いスコアを出しますが、決して「ゾーエ」を学ぶことはありません。研究者たちは、希少なトリックの例を人工的に増やす手法(SMOTEと呼ばれる技術)や、特殊な数学(Focal Lossと呼ばれるもの)を用いて、コンピュータに希少なものへ特別な注意を払わせるなど、さまざまな方法でこれを修正しようとしました。
結果:家系図の勝利、そして「やりすぎないこと」の重要性
何百回ものシミュレーションを実行した後、結果は明白かつ驚くべきものでした。
1. 「家系図」メソッドが優れている
GUIDベースの相関関係(プロセスの家系図を辿る方法)は、時間ベースの相関関係(単に時間を参照する方法)を一貫して上回りました。
- 理由: 論文は、単に時間が近いだけでは、2つのイベントが関連していることを証明するには不十分であると示唆しています。コンピュータは1秒間に数百万の無関係なことを行う可能性があります。しかし、プログラムAがプログラムBを「開始した」のであれば、それは強固で壊れることのないリンクです。「家系図」メソッドは、イベント間の真の関係を保持したため、AIにとってより明確な物語を提供することができました。
- スコア: 「家系図」メソッドを用いた最高のモデル(SecureBERT)は、0.586の精度(約58.6%の確率で正解)を達成しました。一方、「時間」メソッドを用いた最高のモデルは、わずか0.504にとどまりました。
2. 「スーパー・リーダー」が「伝統的な生徒」に勝つ
高度なAIモデル(SecureBERT)は、伝統的な機械学習モデルを一貫して上回りました。
- スコア: 「家系図」メソッドを用いたSecureBERTは、0.586の精度を記録しました。最高の伝統的モデル(LightGBM)は、0.501でした。
- 理由: 「スーパー・リーダー」は、より複雑な文脈を理解することに長けていました。個々の部分は無害に見えたとしても、特定のイベントのシーケンスが「ハッキング」を意味することを理解できたのです。
3. 驚きの展開:AIに教えすぎないこと
研究者たちは、クラス不均衡(希少なトリックの問題)を修正することが、AIの学習を助けると予想していました。彼らは伝統的なモデルに対して、SMOTEを用いて追加の例を作成することを試み、それはうまく機能しました。
- しかし、 高度な「スーパー・リーダー」(SecureBERT)については、「何もしないこと」が実は最善の戦略でした。
- 特殊な数学(Focal Loss)を用いて、希少なトリックに特別な注意を払うよう強制した場合、AIの全体的なパフォーマンスは逆に低下しました。
- 発見: ベースラインのモデル(不均衡を修正するための特別なトリックを加えない標準的なAI)が、最も高い精度(0.586)と最高の全体的なバランスを実現しました。論文は、家系図メソッドによって生成された複雑で相関のある物語があまりに豊かで意味深であったため、AIは強制されたり「過剰に修正」されたりすることなく、自然に希少なトリックを学習できたことを示唆しています。
これが将来に意味すること
この論文は、サイバーセキュリティのすべてを解決したと主張しているわけではありません。ハッカーが100%捕まるようになったと言っているわけでもありません。むしろ、「どのようにデータを整理するか」が、「どのコンピュータプログラムを使って読むか」よりも重要であることを示唆しています。
イベントを単なるタイムスタンプではなく、その「家系図」(プロセスの関係性)を通じてリンクさせることで、攻撃者が何をしているのかについての、より豊かで正確な物語を作成できます。そして、これらの豊かな物語を高度なAIモデルに投入することで、人工的に注意を向けさせずとも、特定のハッカーの手口をこれまで以上に上手く認識できるようになるのです。
また、この研究は一つの限界も明らかにしています。これらの結果は、シミュレートされた攻撃を用いた制御された実験室で見出されたものです。研究者たちは、現実世界のコンピュータ環境はより乱雑で複雑であることを認めています。したがって、これは有望な新しい方向性ではありますが、次のステップは、これらの「家系図」による物語が、単なるテストラボではなく、実際のオフィスで人々が実際にコンピュータを使用している場面でも通用するかどうかを確認することです。
要約すると、この論文は、デジタルな泥棒を捕まえるためには、時計を見るのではなく、彼らが誰と一緒に歩いているかを見るべきであると教えています。そして時には、最も賢いコンピュータとは、過度な干渉を受けることなく、自らのペースで学習することを許されたコンピュータなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。