← 最新の論文
💻 computer science

Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies

本論文は、大規模言語モデルとドメインオントロジーおよびSHACL制約を組み合わせる新たな手法を提案し、特にハニーポットデータに対して、サイバーセキュリティログから構造化され意味的に妥当な情報を抽出する際の精度と説明可能性を大幅に向上させるAIエージェントを実現するものである。

原著者: Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

公開日 2026-04-28
📖 1 分で読めます☕ さくっと読める

原著者: Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが犯罪を解決しようとする探偵だと想像してください。しかし、明確な警察の報告書の代わりに、あなたには何千ページもの汚れた手書きのメモ、落書き、そして半分しか終わっていない文章が渡されます。これが、サイバーセキュリティの専門家がシステムログを読もうとする際に直面する状況です。これらのログはコンピュータの「日記」であり、行われたすべての行動を記録していますが、しばしば非構造化で混乱しており、専門用語に満ちています。

本論文は、この混沌を整理するのを助ける新しいツールOntoLogXを紹介するものです。これは、探偵(サイバーセキュリティアナリスト)がどのように機能するかを、簡単な概念に分解して説明します。

1. 問題:「散らかった部屋」

これらのログを読む従来の方法は、懐中電灯と固定されたルールリストだけを使って、散らかった部屋から特定の玩具を見つけようとするようなものです。もし玩具が服の山の下に隠れていたり、奇妙な名前でラベル付けされていたりすれば、懐中電灯は見逃してしまいます。

  • 問題点: コンピュータは非構造化で曖昧なログを生成します。古い方法は、確実に「悪者」(悪意のあるイベント)を見つけるのに苦労します。
  • 新しいツール: 著者らは**大規模言語モデル(LLM)**を使用します。LLM を、インターネット上のほぼすべてを読み、自然言語を理解できる超優秀なインターンだと考えてください。しかし、このインターンは少し「夢見がち」です。厳密なルールに縛られていないため、時折事実を捏造したり、事実をわずかに誤ったりすることがあります。

2. 解決策:「建築家」と「検査員」

インターンの夢見がちな傾向を修正するために、著者らはOntoLogXと呼ばれるシステムを構築し、2 つの重要な制御層を追加しました。

  • 建築家(オントロジー): インターンが書き始める前に、システムはオントロジーと呼ばれる厳格な設計図を与えます。これは、特定のブロックセットとルールブックのようなものです。「あなたはこれらの特定のレンガ(クラス)だけを使って家を建て、これら特定のやり方で(関係性)それらを接続しなければならない」と言います。これにより、AI は散らかったログデータをナレッジグラフと呼ばれる整然とした構造化形式に整理することを強制されます。
  • 検査員(SHACL 検証): インターンが構造を構築すると、SHACLと呼ばれるツールを使う厳格な検査員が作業をチェックします。検査員はこう問います。「正しいレンガを使いましたか?屋根を壁に正しく接続しましたか?欠けている扉はありませんか?」
    • 建物が間違っていれば、検査員は「これを修正せよ」というメモ付きでそれをインターンに返します。
    • インターンは再度試みます。このループは、建物が完璧になるまで続きます。

3. プロセス:例から学ぶ

このシステムは、インターンに単に推測させるだけではありません。それはRetrieval Augmented Generationと呼ばれる巧妙なトリックを使用します。

  • インターンが過去の成功した事例の図書館を持っていると想像してください。新しい汚れたログが入ってくると、システムは最も類似した過去の事例(例)を見つけ、それをインターンに見せます。
  • 「以前、この類似したパズルをどのように解決したかを見てほしい。この新しいものを解決する際にも、同じスタイルを使いなさい」と言います。
  • これにより、インターンは「建築家」(オントロジー)が何を求めているかを正確に理解し、はるかに良い結果につながります。

4. 結果:速度ではなく精度

著者らは、このシステムを「古い方法」(建築家も検査員もなしに単にインターンに書かせる方法)と比較してテストしました。

  • 結果: 新しい方法は、はるかに正確でした。より多くの「悪者」を見つけ出し(高い再現率)、より少ない間違いを犯しました(高い精度)。
  • トレードオフ: 論文は明確に、速度よりも品質を優先したと述べています。新しい方法は、作業をチェックし、フィードバックを受け取り、再度試行する必要があるため、少し時間がかかります。しかし、最終的な結果は、サイバー脅威に関するはるかに信頼性の高い、確実なマップとなります。
  • 勝者: テストされたさまざまな AI モデルの中で、Claude 3.5 Sonnetが最も優れたパフォーマンスを発揮しましたが、Llama 3.3のようなオープンソースモデルも非常に良い結果を出しました。

まとめの比喩

サイバーセキュリティのログを読むことが、混沌とした手書きの日記を正式な法的文書に翻訳するようなものであるとすれば:

  • 古い方法: あなたは優秀な翻訳者に「最善を尽くせ」と頼みます。意味は取れるかもしれませんが、形式は散らかり、一貫性がありません。
  • OntoLogX: あなたは翻訳者に厳格な法的テンプレート(オントロジー)を与え、完璧な法的文書の例(Few-shot 例)を見せ、厳格な弁護士(SHACL)にすべての草案を検査させます。草案が完璧でなければ、弁護士は修正のためにそれを戻します。その結果、多少時間がかかっても、毎回完璧な法的文書が生まれます。

重要な教訓: この論文は、「賢い AI」と「厳格なルール」および「品質チェック」を組み合わせることで、散らかったコンピュータログを、サイバー脅威に関する明確で実行可能なインテリジェンスに変換する、はるかに信頼性の高いシステムが構築できることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →