TIJERE: A Novel Threat Intelligence Joint Extraction Model Based on Analyst Expert Knowledge
本論文は、サイバーセキュリティ脅威インテリジェンスにおける最先端の性能を達成するために、分析者の専門知識と微調整済み SecureBERT+ をマルチシーケンスラベリングフレームワーク内で活用する新たな結合型実体・関係抽出モデル TIJERE を紹介し、自動化された脅威分析における既存のギャップを解消するため、初の公開済み結合ラベル付きデータセット DNRTI-JE を併せて公開するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが巨大なサイバー犯罪事件を解決しようとしている探偵だと想像してください。あなたは、技術用語と曖昧な記述が混ざり合った、無数の散らかった整理されていない警察報告書(脅威インテリジェンス報告書)を持っています。あなたの目標は、誰が、誰に、いつ、何をしたのかを正確に示す、巨大で整理された地図(ナレッジグラフ)を作成することです。
例えば、「APT29」(ハッカーグループ)が「Mimikatz」(ツール)を使用して、「XYZ Bank」(被害者)を攻撃したという事実を突き止める必要があります。
この論文は、この探偵作業を自動化するための新しいツール「TIJERE」を紹介します。その仕組みを簡単に説明します。
課題:「パイプライン」対「ジョイント」アプローチ
以前、コンピュータはこの問題を 2 つの別々の段階(工場の組立ラインのように)で解決しようとしました:
- ステップ 1:人物、グループ、ツールのすべての名前を見つける(固有表現認識)。
- ステップ 2:それらの名前を見て、それらがどのように関連しているかを推測する(関係抽出)。
欠点:ステップ 1 で小さな間違い(例えば、ツールを人物と誤認する)が発生すると、その誤りがステップ 2 に引き継がれ、地図全体を台無しにしてしまいます。また、サイバー報告書の文はしばしば散らかりがちです。ある文は「APT29 がツール A を使用して銀行 X を攻撃した」と述べていますが、同時に「ツール A は APT29 によって使用された」とも示唆しています。同じ言葉が異なる役割で現れる場合、特にどの接続がどれに該当するかについて、コンピュータは混乱します。
解決策:TIJERE(「専門家探偵」システム)
TIJERE は、2 つのステップを単一の統合された頭脳内で同時に行うことでゲームを変えます。しかし、生のテキストに頼るだけでなく、人間の専門家のように振る舞うための 3 つの巧妙なトリックを使用します。
1. 「専門家知識」のチートシート(ドメイン専門特徴)
次のような文を読んでいると想像してください:「APT29 が Mimikatz を使用した」。
- 通常のコンピュータは、「APT29」と「Mimikatz」を単なるランダムな単語として扱います。それが何であるか分からないため、「Mimikatz」を人名だと考えるかもしれません。
- TIJEREには特別なチートシートがあります。「APT29」はハッカーグループであり、「Mimikatz」はツールであることを知っています。
- 比喩:これは、コンピュータにすべての物体の種類を強調表示するメガネを渡すようなものです。「ハッカーグループ」と「ツール」を見ると、ハッカーはツールを使うものなので、関係性は「使用」であると即座に判断できます。これにより、曖昧な言葉に混乱することを防ぎます。
2. 「ハイライトペン」(エンティティマスク)
多くの名前が含まれる長く複雑な文では、どの 2 つの名前が互いに話しているのかをコンピュータが把握するのは困難です。
- TIJEREはデジタルハイライトペンを使用します。「APT29」と「Mimikatz」の間の関係を見ると、その 2 つの単語のみをハイライトし、文の残りを「背景ノイズ」に変えます。
- 比喩:これは、混雑した教室で特定の 2 人の生徒に質問するために、他の全員を無視してレーザーポインターを 2 人の生徒に指し示す教師のようなものです。これにより、コンピュータは関連するペアに厳密に集中できます。
3. 「複数コピー」戦略(マルチシーケンスラベリング)
これがこの論文の最大の革新です。通常、コンピュータは文を 1 回読み、すべての関係を一度に推測しようとします。
- TIJEREは、1 つの文を取り、その文内のすべての可能なアイテムのペアに対して個別にカスタマイズされたコピーを作成します。
- 比喩:3 つの容疑者ペアを含む文を持っていると想像してください。コンピュータに一度にパズル全体を解かせるのではなく、TIJERE は文の 3 つの別々のコピーを作成します。
- コピー A は言います:「ここはペア(APT29, Mimikatz)です。彼らの関係は何ですか?」
- コピー B は言います:「ここはペア(APT29, Bank)です。彼らの関係は何ですか?」
- コピー C は言います:「ここはペア(Mimikatz, Bank)です。彼らの関係は何ですか?」
- 問題をこれらの小さく焦点を絞った質問に分解することで、コンピュータは「重複する」関係に圧倒されなくなります。
特別な辞書(SecureBERT+)
サイバーセキュリティ報告書は、「EternalBlue」や「Spear-phishing」のような、通常のコンピュータが十分に理解できない非常に特定の言語を使用します。TIJERE は、**SecureBERT+**と呼ばれる言語モデルの特別なバージョンを使用します。
- 比喩:これは、標準的な英語辞書ではなく、スパイやハッカー向けに書かれた辞書でコンピュータを訓練するようなものです。これにより、サイバー世界の「スラング」を理解できるようになります。
結果:新しい地図と新しいスコアカード
これが機能することを証明するために、著者は 2 つのことを行いました:
- 新しいデータセット(DNRTI-JE)の構築:既存の報告書を取り、名前と関係の両方を手動でラベル付けしました。これは、サイバーセキュリティ分野で「共同ラベル付けされた」データセットが公開された初めての事例です。
- モデルのテスト:TIJERE を他の手法と比較して実行したところ、明確な勝者となりました。
- 名前(エンティティ)を正しく識別した割合は**93%**でした。
- 関係を正しく識別した割合は**98%**でした。
まとめ
TIJERE を、単に報告書を読むだけでなく、関与するキャラクターの種類を理解し、ハイライトペンを使って正しいペアに焦点を当て、複雑な文を単純な一対一のインタビューに分解する、超能力を持った探偵だと考えてください。これを専門的な「ハッカー辞書」と組み合わせることで、これまで以上に正確なサイバー脅威の地図を作成します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。