From IOCs to Regex: Automating CTI Operationalization for SOC with LLMs
本論文は、サイバー脅威インテリジェンス報告書から抽出された侵害指標(IOC)を、LLM を活用して自動で正規表現に変換するシステム「IOCRegex-gen」を提案し、その高い精度と実用性を検証したものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
🕵️♂️ 物語の舞台:サイバー犯罪の「探偵」たち
サイバーセキュリティの現場(SOC)では、毎日、世界中から「脅威情報レポート(CTI)」という探偵の報告書が届きます。
「犯人は、こんなファイル名(11.bat)や、こんなレジストリキー(HKCU\...)を使って、パソコンに忍び込んだよ」という**「犯人の足跡(IOC)」**が書かれています。
この足跡を元に、セキュリティシステムに「犯人を見つけたらすぐにアラートを出せ!」という**「検索ルール」**を作る必要があります。
🚧 現在の問題点:手作業の限界
これまで、このルール作りは人間の分析官が手書きで行っていました。
しかし、ここには 3 つの大きな問題がありました。
- 時間がかかりすぎる: レポートを読み、ルールを書くのに数時間〜数日かかる。
- ミスが多い: 疲れから、ルールに誤字があったり、重要な部分を見逃したりする。
- 柔軟性がない: 犯人は毎回、ファイル名を少し変えて(
11.bat→22.bat)くるのに、手書きのルールは「完全一致」しか見つけられないことが多かった。
そこで、「AI に全部やらせればいいじゃないか!」という試みが始まりました。しかし、これまでの AI は「足跡(IOC)」を抜き出すことまではできましたが、「検索ルール(正規表現)」を正しく作ることができませんでした。
🍳 料理に例えると:
- IOC(足跡): 「卵とベーコンがある」という食材リスト。
- 検索ルール(正規表現): 「卵とベーコンを使ったオムレツのレシピ」。
- これまでの AI: 「卵とベーコンがある」というリストは出せるけど、「オムレツのレシピ(検索ルール)」は作れない。だから、結局人間がレシピを書き起こさなきゃいけなかったのです。
🤖 解決策:新しい AI システム「IOCRegex-gen」
この論文では、「IOCRegex-gen」という新しい AI システムを提案しています。これは、単にリストを作るだけでなく、「完璧な検索ルール(レシピ)」を自動で作成することができます。
このシステムには、2 つのすごい「魔法」が仕込まれています。
1. 「固定部分」と「変化する部分」を見分ける魔法
犯人は、システム固有の場所(例:C:\Users\Public\)は変えませんが、ファイル名(例:11.bat)は変えます。
- 人間なら: 「あ、この部分は変えるな、ここは変えるぞ」とわかります。
- 普通の AI: 「全部同じように扱っちゃう」か、「何を変えればいいかわからず、全部を固定しようとして失敗する」ことがあります。
IOCRegex-gen の魔法:
AI が、過去の膨大なデータ(グラフデータベース)を参照して、「これは Windows の標準的な場所だから固定、これは犯人が勝手に決めた名前だから変化」と、自動で見分けてルールに組み込みます。
🎭 例え話:
犯人が「東京駅(固定)」から「新宿駅(固定)」へ移動し、途中で「A さん(変数)」と「B さん(変数)」に会ったとします。
このシステムは、「東京→新宿」のルートは必ず守るけど、「誰と会ったか」は問い詰めない、という賢いルールを作ります。
2. 「何度も試行錯誤して完璧にする」魔法
AI が作ったルールは、最初から完璧ではありません。
- 「ルールが間違っている!」
- 「もっと広すぎたり、狭すぎたりする!」
IOCRegex-gen の魔法:
AI がルールを作った後、**「自動テスト」**を繰り返します。
- チェック: 「このルールで、本当の犯人の足跡に合うかな?」
- 修正: 「あ、合わない!ここを直して!」と AI に指示を出します。
- 過剰な一般化チェック: 「ルールが『何でもあり』になっていないか?」(例:「どんなファイルでも OK」なんてルールは危険なので NG)。
この**「試行錯誤(ループ)」**を何回も行って、最も精度の高いルールだけを採用します。
🏆 結果:驚異的なパフォーマンス
このシステムを実際のデータ(3,000 件以上のレポートと、実際の攻撃データ)でテストしたところ、以下のような素晴らしい結果が出ました。
- 見逃し率 99.1%: 本当の攻撃を 99.1% の確率で見つけました。
- 誤報率 0.8%: innocent なファイルを「犯人だ!」と間違えることが、1000 件中 8 件以下でした。
- 人間との比較: 従来の AI に直接「ルールを作って」と頼むだけだと、精度が 30% 以上も劣りました。
💡 まとめ:なぜこれが重要なのか?
この研究は、**「AI が人間の代わりに、複雑で繊細なセキュリティルールを作る」**という、長年の課題を解決しました。
- 人間: 「疲れてミスをする」「時間が足りない」という悩みから解放されます。
- セキュリティ: 攻撃が起きても、すぐに高精度なルールが作られ、被害を最小限に抑えられます。
一言で言うと:
「探偵(分析官)が、AI に『犯人の足跡から、どんな変装をしても見逃さない最強の網(検索ルール)』を自動で編ませて、世界中のサイバー犯罪を素早く捕まえる仕組みを作った!」
これが、この論文が伝えたい「未来のセキュリティ」の姿です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。