← 最新の論文
🤖 machine learning

Constructing Multi-label Hierarchical Classification Models for MITRE ATT&CK Text Tagging

本論文は、古典的な機械学習手法を用いてMITRE ATT&CKのテキストタグ付けを自動化するマルチラベル階層型分類フレームワークを紹介するものであり、GPT-4oを大幅に上回る精度(タクティクスレベルで94%、テクニックレベルで82%)を達成しつつ、複雑なLLMベースのアーキテクチャを必要としない。

原著者: Andrew Crossman, Jonah Dodd, Viralam Ramamurthy Chaithanya Kumar, Riyaz Mohammed, Andrew R. Plummer, Chandra Sekharudu, Deepak Warrier, Mohammad Yekrangian

公開日 2026-01-22
📖 1 分で読めます☕ さくっと読める

原著者: Andrew Crossman, Jonah Dodd, Viralam Ramamurthy Chaithanya Kumar, Riyaz Mohammed, Andrew R. Plummer, Chandra Sekharudu, Deepak Warrier, Mohammad Yekrangian

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、サイバー攻撃に関する膨大な、混沌とした物語の図書室を整理しようとしている司書だと想像してください。新しい物語(「脅威レポート」)が入ってくるたびに、他の司書が後で検索できるように、特定のカテゴリーに分類する必要があります。

サイバーセキュリティの世界では、このファイリングシステムは MITRE ATT&CK と呼ばれています。これは、巨大な2段式のファイルキャビネットのようなものです:

  1. 上の引き出し(タクティクス / 戦術): 「なぜ悪党はこれを行ったのか?」という問いに答えます(例:「パスワードを盗みたかった」「足跡を隠したかった」など)。
  2. 下の引き出し(テクニック / 手法): 「どのようにしてそれを行ったのか?」という問いに答えます(例:「特定の種類のフィッシングメールを使用した」「特定のソフトウェアの脆弱性を利用した」など)。

長年、セキュリティの専門家たちは、これらのレポートを読み、正しい引き出しに手動で分類しなければなりませんでした。それは遅く、退屈で、ヒューマンエラーが起こりやすい作業でした。この論文は、彼らの代わりにファイリングを行うための「ロボット助手」を構築することについて書かれています。

「ボトムアップ型」の構築

巨大で複雑なロボットを一から作ろうとする(「トップダウン型」のアプローチ)代わりに、著者たちはブロックを積み上げるように、ステップ・バイ・ステップでシステムを構築しました。前のブロックがしっかりしていることを確認してから、段階的に複雑さを加えていったのです。

  1. ステップ 1: シンプルな分類器(「単一ラベル」ロボット)
    まず、文章を見て一つの「なぜ(タクティクス)」を推測する、シンプルな機械学習モデルを教え込みました。彼らはこれを、有名なAIチャットボットである GPT-4o と比較テストしました。

    • 結果: シンプルなロボットが勝ちました。シンプルなロボットは約 82% の正解率を出しましたが、GPT-4o は 59% でした。著者たちは、この特定の構造化されたタスクにおいては、洗練された複雑なAIよりも、シンプルで古典的なツールの方が優れていることを発見しました。
  2. ステップ 2: マルチラベル分類器(「複数ラベル」ロボット)
    現実の世界は単純ではありません。一つの文章には、攻撃の理由が複数含まれていることがよくあります。そこで、彼らはロボットをアップグレードし、一つの「なぜ」ではなく、上位3つの「なぜ」を推測できるようにしました。

    • 結果: これにより、精度は 94% まで向上しました。
  3. ステップ 3: 階層型分類器(「完全なファイリング」ロボット)
    最後に、彼らは「なぜ(タクティクス)」と「どのように(テクニック)」を同時に推測するようにロボットを教えました。もしロボットが「なぜ」を「パスワードの窃取」だと推測したら、次に具体的な「どのように(例:キーロギング)」を探します。

    • 結果: このシステムは、「なぜ + どのように」の組み合わせにおいて 82% の精度を達成しました。

「秘伝のソース」(なぜ機能するのか)

著者たちは、最新の最も高価な「生成AI」や複雑なニューラルネットワークを使用しませんでした。代わりに、古典的な機械学習(具体的には「TF-IDF」を用いた「確率的勾配降下法」)を使用しました。

これを例えるなら、食料品店へ行くために超複雑で高価なフェラーリを作るのではなく、非常に信頼性が高く効率的な自転車を作ったようなものです。これなら目的を果たせますし、より速く、コストも低く、修理も簡単です。

また、彼らはプライバシー保護のロック(ハッシング)を追加しました。例えば、彼らがこのロボットを世界に公開したいと考えているものの、学習に使った「秘密のレシピ(データ)」を共有することには懸念がある場合を想像してください。彼らは、元の材料が見えないようにデータを難読化(スクランブル)しながら、ロボットがそこから学習できる方法を編み出しました。これにより、彼らは安全にロボットを一般に公開することができました。

「新しい図書室」テスト

彼らのロボットが本当に賢いかどうかを確認するために、単に学習したストーリーでテストするだけでなく、見たことがまったくない金融脅威(銀行に特化したもの)に関する全く新しいストーリーを与えました。

  • 結果: 最初、ロボットは混乱しました(新しいストーリーが以前のものとは異なっていたため)。しかし、これらの新しいストーリーを使ってほんの少しだけ追加学習を行うと、すぐにそれらを正しく分類できるようになりました。これは、このロボットが柔軟であり、膨大な量の新しいデータを必要とせずに、新しい状況に適応できることを証明しています。

大きな教訓

この論文は、問題を解決するために必ずしも最も高価で複雑なAIが必要なわけではない、と結論づけています。タスクを小さく管理可能なステップに分解し、信頼できる古典的なツールを使用することで、彼らは以下の特性を持つシステムを構築しました:

  • 特定の仕事において、トップクラスのAIチャットボット(GPT-4o)よりも高精度である。
  • 実行がより速く、安価である。
  • 一般に共有しても安全である。
  • 非常に少ない追加学習で、新しいタイプのデータに適応できる。

彼らは、他のセキュリティチームが自身のサイバー脅威レポートを整理できるように、この「ロボット司書」を GitHub で無料で公開しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →