← 最新の論文
🤖 machine learning

Context-aware Entity-Relation Extraction for Threat Intelligence Knowledge Graphs

本論文は、構造化されていないサイバーセキュリティレポートから正確なエンティティ - 関係のトリプルを抽出する際における既存のパイプラインアプローチの限界を克服し、STIX 2.1 に準拠したベンチマークで顕著な性能向上を実現するために、SecureBERT+ 埋め込みとドメインオントロジーを組み合わせるハイブリッド NLP モデルを活用する、文脈認識型脅威インテリジェンス知識グラフ(CTiKG)フレームワークを導入する。

原著者: Inoussa Mouiche, sherif Saad

公開日 2026-05-18
📖 1 分で読めます☕ さくっと読める

原著者: Inoussa Mouiche, sherif Saad

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがサイバーセキュリティの探偵で、巨大な謎を解こうとしていると想像してください。あなたの手元には、ハッカー、彼らのツール、そして彼らの攻撃について記された、無数の乱雑な手書きの報告書(非構造化テキスト)があります。あなたの目標は、これらの乱雑なメモを、誰が誰とつながっているか、どのようなツールを使用しているか、どこで攻撃を行うかを瞬時に把握できる、清潔で整理された「指名手配ポスター」ボード(ナレッジグラフ)に変えることです。

この論文は、そのボードを構築するための新しい、よりスマートな方法、CTiKG を紹介します。その仕組みを簡単な概念に分解して以下に示します。

問題:「壊れた組み立てライン」

以前、これらのボードを構築しようとする試みは、故障した組み立てラインを運営するようなものでした。

  1. ステップ 1: ロボットが人物や場所の名前(エンティティ)を見つけようとしました。
  2. ステップ 2: 2 番目のロボットが、それらがどのように関連しているか(関係)を把握しようとしました。

問題は、最初のロボットがミス(例えばハッカーの名前の誤認識)を犯すと、2 番目のロボットも混乱してミスをしてしまう点でした。これは「誤差伝播」と呼ばれます。また、これらのロボットは一般的な英語(ウィキペディアの読解など)で訓練されていたため、特定のハッカーのスラングや専門用語を理解できませんでした。彼らは「Mimikatz」という言葉を読み、それが特定のハッキングツールではなく、単なるランダムな単語だと考えてしまうのです。

解決策:「文脈を認識する探偵」(CTiKG)

著者たちは、サイバー脅威の言語を流暢に話す専門的な探偵チームのように機能する新しいシステムを構築しました。彼らはプロセスを主に 3 つの方法で改善しました。

1. 「スーパーリーダー」(より優れたエンティティ認識)

基本的なロボットではなく、彼らは**SecureBERT+**と呼ばれる専門的な脳を使用しました。これは、これまで書かれたすべてのサイバー犯罪報告書を読んだ探偵だと考えてください。

  • アップグレード: この脳に「安全網」(CRF レイヤー)を追加しました。旧システムでは、ロボットが単語を「名前の開始」とラベル付けするものの、「名前の終了」のラベル付けを忘れるなどして、破綻した文を作成することがありました。安全網は、ラベルが常に互いに意味をなすように保証します。それは、周囲のピースが正しくなければはまらないパズルのピースのようです。
  • 結果: このシステムは、テキスト内の 21 種類の異なる「容疑者」(ハッカー、マルウェア、IP アドレスなど)を特定する能力が大幅に向上し、誤りを約 3〜4% 削減しました。

2. 「ルールブック」(より優れた関係抽出)

容疑者が特定されると、システムはドットを結びつける必要があります。

  • アップグレード: 彼らは特定のドメインオントロジーを作成しました。これは、「ハッカーはツールを使用する」あるいは「ツールはコンピュータを標的とする」といった、厳格なルールブックまたはフローチャートだと想像してください。
  • どのように役立つか: AI が少し混乱しても、ルールブックは審判として機能します。AI が「コンピュータ」と「日付」を意味をなさない方法で「関連している」と言おうとした場合、ルールブックがそれを修正します。これにより、接続(関係)が論理的かつ正確であることが保証されます。
  • 結果: これにより、ドットを結びつける精度が最大 8% 向上しました。

3. 「トレーニンググラウンド」(新しいデータ)

新しい探偵たちを教育するために、著者たちは古くて乱雑なデータだけを使用しませんでした。彼らはDNRTI-AUG-STIX2と呼ばれる、新しい超クリーンなトレーニングセットを作成しました。

  • 彼らは既存の報告書を取り、AI が以前に目にしたことのないもので混乱しないよう、稀なタイプのハッカーやツールの例を追加しました(データ拡張)。
  • また、学習プロセスをスムーズにするために、類似のカテゴリ(異なる種類のハッシュコードなど)をマージしました。

結果:より鮮明な画像

著者たちは、これらの新しいデータセットを使用して、新しいシステムを古いシステムと比較テストしました。

  • スコア: 新しいシステムは 0 から 1 のスケールで有意に高いスコアを獲得しました(具体的には、名前発見の F1 スコアが 3〜4% 向上し、接続発見では最大 8% 向上)。
  • 証明: 彼らは 1 種類の報告書だけでテストしたわけではありません。3 つの異なるデータセット(DNRTI-AUG-STIX2、DNRTI、STUCCO)でテストし、どのような種類のサイバー報告書を読んでも機能することを証明しました。

結論

この論文は、ハッカーを阻止したり未来を予言したりすると主張しているわけではありません。代わりに、セキュリティ専門家にとってより優れたツールを構築したと主張しています。「組み立てライン」の誤りを修正し、AI に「ハッカー」の言語を教えることで、彼らは乱雑なテキストを、明確で信頼性の高いサイバー脅威のマップに変えるシステムを構築しました。このマップは、情報が正確で検索しやすいため、セキュリティチームがより迅速かつ情報に基づいた意思決定を行うのを助けます。

著者たちはまた、他の研究者がさらに優れたシステムを構築できるように、新しい「トレーニングデータ」と「ルールブック」を GitHub で共有しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →