Evaluating Open-Source LLMs for Multi-Label ATT&CK Technique Classification on CTI Reports
本論文は、人間がアノテーションを行った2,076文からなるデータセットを導入し、7つのオープンソースLLMを評価することで、複雑な非構造化サイバー脅威インテリジェンスレポートにおけるマルチラベルATT&CK分類の新たな経験的ベースラインを確立しており、それらのモデルはパラメータサイズと性能の間に正の相関があるものの、マイクロ平均F1スコアが0.22という低値を示したことから、現在のモデルは生産レベルのデプロイメントには依然として不十分であることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、混沌とした犯罪者が書いた千ページに及ぶ乱雑な日記(これをCTIレポートと呼びます)を読もうとしているセキュリティガードだと想像してください。この日記には、単に「車を盗んだ」とは書かれていません。「鍵を開け、エンジンをホットワイヤー(直結)して、銀行へ車を走らせ、それからセキュリティカメラの記録を消去した」といった具合に書かれています。
あなたの仕事は、すべての文章を読み、その文章に正しい「犯罪コード」をMITRE ATT&CKという膨大なルールブックからタグ付けすることです。このルールブックには、あらゆる攻撃手法に対応する211種類の異なるコードがあります。問題は、一つの文章の中に複数の犯罪が含まれていることがよくあり、その表現も非常にトリッキーであることです。
長い間、コンピュータはこの作業が苦手でした。彼らは単純で短いメモしか読めないロボットのようなものでした。文章が複雑になると、ロボットは混乱してしまったのです。
その後、**大規模言語モデル(LLM)**が登場しました。これらは、文脈やニュアンスを理解できる、非常に賢く博識な「インターン」のようなものだと考えてください。人々は、これらのAIインターンがついに、あの乱雑な日記を読み解き、完璧に犯罪をタグ付けできるようになると期待していました。
この論文は、これら7人のオープンソースのインターンに対する「成績表」です。 研究者たちは、これらのAIインターンが本当に実務に就ける準備ができているのか、それともまだ経験不足なのかを検証しました。
以下に、彼らが何を行い、何を見出したのかを分かりやすく説明します。
1. テスト: 「実戦形式」の試験
これまでのAIインターンのテストは、簡単で答えが一つしかないクイズ(例:「犯罪者は鍵を使った」→ タグ:ロックピッキング)を与えるようなものでした。
研究者たちは、「それは現実のやり方ではない」と考えました。そこで、より難易度が高く、現実的な試験を作成しました。
- 彼らは、人間の専門家によって書かれた83件の実際の、乱雑なセキュリティレポートを使用しました。
- それらを2,076個の個別の文章に分解しました。
- 人間の専門家が、すべての文章に対して正しい犯罪コードを手動でタグ付けしました。コードがない文章もあれば、1つの文章に最大9つまでのコードが含まれるものもありました。
- これが、AIを採点するための「解答集(正解データ)」となりました。
2. 出場者
彼らは、7つの異なるオープンソースAIモデルを選びました。
- これらのモデルを、さまざまなサイズの「学生」と考えてください。小さなモデル(80億の「脳細胞」またはパラメータ)もあれば、巨大なモデル(2360億)もあります。
- 彼らは、以下の異なる「モード」でテストを行いました。
- Zero-Shot(ゼロショット): 指示を与えるだけ。
- Few-Shot(フューショット): 学習のために、いくつかの例を先に与える。
- Chain-of-Thought(思考の連鎖): 回答する前に、ステップ・バイ・ステップで「思考を書き出す」よう求める。
- Temperature(温度): AIの「創造性」のつまみを上げたり下げたりする(0 = 厳格なロボット、0.5 = 少しクリエイティブ)。
3. 結果: インターンはまだ学習中である
結果は、厳しい現実を突きつけるものでした。
- スコア: 最も優れたAIモデルでさえ、22%のスコア(100%が満点とする基準)しか獲得できませんでした。
- 比喩: ある学生が難しい期末試験を受けて、Dマイナスを取った状況を想像してください。合格はしていますが、ほとんどの答えを外しています。
- サイズの影響(主に): 最も大きく複雑なモデル(「巨人」たち)は、総じて小さなモデルよりも成績が良かったです。明確な相関関係がありました。脳が大きいほど、スコアがわずかに向上するという関係です。
- 「魔法の設定」は機能しなかった:
- 例を与えること(Few-Shot)は、あまり効果がありませんでした。
- 「ステップ・バイ・ステップで考える」よう求めること(Chain-of-Thought)も、あまり効果がありませんでした。
- 「創造性」のつまみ(Temperature)を変えても、ほとんど差はありませんでした。
- 比喩: それは、学生に違う色の鉛筆を渡したり、「もっと頑張れ」と言ったりするようなものです。もし本人が内容を理解していなければ、スコアは変わりません。
4. たった一つの助けとなったもの:「カンニングペーパー」
研究者たちは、もう一つの方法を試しました。それは、**RAG(検索拡張生成)**という仕組みを導入することでした。
- 比喩: AIに記憶に頼らせるのではなく、試験を受けている間に「公式のルールブック」という開かれた本を参照させる方法です。
- 結果: スコアは22%から32%へと跳ね上がりました。
- これが最大の改善でした。これは、AIが「バカ」だから失敗しているのではなく、目の前に「最新のルール」がないために失敗しているのだということを証明しました。
5. 何が間違っていたのか?
研究者たちは、AIが犯したミスを分析しました。
- 偽陽性(False Positives): AIは「回避(evade)」という言葉を見て、実際には別のことについて述べているにもかかわらず、「ハイジャック」だと推測してしまいました。文脈ではなく、キーワードに基づいて推測してしまったのです。
- 偽陰性(False Negatives): AIは、「ランサムウェアのバイナリをステージングする」ことが実は特定の種類の転送であることを理解できず、犯罪を見逃しました。深い文脈理解が欠けていたのです。
結論
この論文は、現在のオープンソースAIモデルは、複雑なサイバー脅威を分類するための唯一のセキュリティガードを務める準備がまだ整っていないと結論づけています。彼らは(22〜32%というスコアから分かる通り)あまりにも不正確であり、人間の助けなしに現実世界のセキュリティセンターで信頼を置くことはできません。
パフォーマンスを大幅に向上させた唯一の要素は、テスト中に公式のルールブックへのアクセス権を与えること(RAG)でした。質問の仕方(プロンプト)を変えたり、モデルを大きくしたりするだけでは、根本的な問題は解決しませんでした。
要約すると: AIインターンは賢いですが、現在は一人で仕事をこなすにはエラーが多すぎます。彼らが仕事を正しく遂行するためには、人間の監督者と参照マニュアルが必要です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。