← 最新の論文
🤖 machine learning

LLMs for Zero-Shot Threat Detection via Structured Risk Indicators

本論文は、ユーザーのアクティビティ・タイムラインから構造化され解釈可能なリスク指標を生成するために検索拡張生成を活用した2段階のLLMフレームワークを提案しており、これらの指標の質こそが性能の主要な推進力であることを示すことで、インサイダー脅威およびAPTのゼロショット検知において最先端の性能を達成している。

原著者: Abdullah Alghamdi, Siamak Layeghy, Marius Portmann

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Abdullah Alghamdi, Siamak Layeghy, Marius Portmann

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の組織におけるデジタル要塞において、セキュリティシステムは常に侵入者を監視しています。これらのシステムの中には、コンピュータ間で流れるトラフィックをスキャンし、データストリーム内の不審なパターンを探すものもあります。また、コンピュータ自体に直接入り込み、誰がログインしたか、どのファイルが開かれたか、どのデバイスが接続されたか、どのメールが送信されたかといった内部で起きていることを監視するものもあります。この内部監視は、最も危険な脅威が内部からやってくることが多いため、極めて重要です。攻撃者が正当なパスワードを盗んだり、従業員を説得して会社に反する行動をとらせたりした場合、彼らは通常のユーザーと全く同じようにシステム内を移動することができます。彼らを捕まえるためには、セキュリティチームは、深夜までプロジェクトに取り組んでいる人と、静かに機密データを盗んでいる人を区別しなければなりません。これには、単一の瞬間だけでなく、時間の経過に伴う個人の行動の全容を理解するという作業が必要になります。

クイーンズランド大学の研究チームは、特定の悪質な挙動の例に対して何年もの学習を必要とせずに、コンピュータがこの区別を行えるようにする新しい手法を開発しました。コンピュータに対して、乱雑な生のセキュリティログの山を見て即座に「脅威」か「安全」かを叫ぶよう求めるのではなく、彼らは、より慎重なアナリストのように機能する2段階のシステムを構築しました。まず、システムはユーザーの活動をタイムラインに整理し、強力な言語モデルに対して、そのタイムラインを明確で構造化されたリスク因子のリストに翻訳するよう求めます。モデルに対し、不自然な時間帯のファイルアクセスや、奇妙なサーバーへの接続など、何が問題である可能性があるのかという具体的な特定を求めるのです。次に、第2のモデルが、攻撃が展開していることを示唆するパターンを特定するために、これらのリスク因子のリストの時系列的な変化を観察します。このアプローチにより、信頼されていた従業員が悪意を持つ「内部脅威」と、巧妙な外部攻撃者がネットワーク内に長時間潜伏する「高度標的型攻撃(APT)」の両方を検知することが可能になります。

研究者たちは、この手法を2つの異なるセキュリティデータセットでテストしました。一つのデータセットは、メールのやり取りからファイル転送に至るまで、あらゆるものを捉えた、約100人の従業員を含む18ヶ月間の内部脅威シナリオをシミュレートしたものです。もう一つのデータセットは、コンピュータ間の数千の接続を追跡した、ネットワークへの隠密な外部攻撃をシミュレートしたものです。どちらの場合も、新しいシステムは、言語モデルに依存していた従来の最高の手法を大幅に上回りました。内部脅威のデータでは、新しいアプローチは攻撃を正しく特定する能力を向上させると同時に、誤報を11パーセント以上減少させました。ネットワーク攻撃のデータでは、その改善はさらに劇的で、31パーセント以上も跳ね上がりました。この成功の鍵は、単にコンピュータの脳を大きくすることではなく、情報の処理方法を変えたことにありました。第1のモデルに、複雑なログを単純で解釈可能なリスク指標へと分解させることで、最終的な判断を下す前に、システムは正常な業務と悪質な活動の微妙な違いを見分ける能力が格段に向上したのです。

最も興味深い発見の一つは、システムがコンテキスト(文脈)の必要性をどのように扱ったかという点です。研究者たちは、より小さく、能力の低い言語モデルの場合、ユーザーの過去の行動の要約を提供することで、より優れたリスク指標を生成できることを見出しました。それはまるで、モデルが現在の瞬間における異常性を理解するために、ユーザーの履歴を見る必要があるかのようでした。しかし、より大規模で高性能なモデルの場合、この追加の歴史的コンテキストはほとんど影響を与えませんでした。それらのモデルは、すでに自力で高品質なリスク指標を生成できていたからです。このことは、リスク評価の質こそが、これらの脅威を捕らえるための最も重要な要因であることを示唆しています。もし第1段階のプロセスが、危険についての明確で正確な描写を生み出せれば、第2段階は容易に攻撃パターンを認識できます。もし第1段階が曖昧であったり混乱したりしていれば、最終的な分類器がいかに強力であっても、システムは苦戦することになります。

また、本研究はデータのグループ化の方法が極めて重要であることも明らかにしました。システムは、孤立したイベントやマシン間の接続を見るのではなく、一人の人物の全活動を一つの連続した物語として見たときに最もよく機能します。研究者が、ユーザーによるものではなく、二台のコンピュータ間の接続によってデータをグループ化しようとしたところ、システムの性能は著しく低下しました。これは、攻撃者の行動は多くの異なるツールやログにまたがるアクションによって定義されるためであり、全体像を見ることで初めて、システムは脅威の全容を把握できるからです。研究者たちは、システムが最初のデータセットにおける内部脅威の特定には優れていた一方で、第二のデータセット(非常に隠密なネットワーク攻撃を含むもの)は、信号がはるかに微弱であるため、より困難な課題であったと述べています。それでもなお、構造化されたアプローチは検出のための強固な基盤を提供しており、複雑なセキュリティデータを管理可能で解釈可能な断片へと分解することが、強力な戦略であることを証明しました。

結局のところ、この研究は、自動化された脅威検知の未来が、あらゆる可能な攻撃をコンピュータに暗記させることにあるのではなく、行動を構造化された方法で推論させることを教えることにあることを示しています。言語モデルを使用して生のデータを明確なリスク指標へと翻訳し、その後、それらの指標を時系列で分析することにより、セキュリティシステムはより正確で信頼性の高いものになります。今回の知見は、最も効果的なセットアップは、標的とされる脅威の種類と使用されるモデルの能力に依存することを示唆していますが、核心となる原則は変わりません。すなわち、「中間ステップにおける明晰さが、最終的な決定におけるより良い結果につながる」ということです。このアプローチは、組織を、内部で牙を剥く者と、人目の付かない場所に隠れようとする外部の者の両方から守るための、有望な道筋を提示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →