← 最新の論文
💬 NLP

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

本論文は、Microsoft Sentinel ログおよび調査グラフから 7,542 件の質問を生成してサイバー脅威調査における LLM エージェントを評価するために設計された初のベンチマーク「ExCyTIn-Bench」を紹介し、現在の最先端モデルが 0.606 の報酬スコアしか達成していないことを明らかにし、今後の改善の余地が大きいことを浮き彫りにする。

原著者: Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

公開日 2026-05-04
📖 1 分で読めます☕ さくっと読める

原著者: Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、ExCyTIn-Bench という論文を、平易な言葉と日常的な比喩を用いて解説したものです。

全体像:AI 探偵のための新しい「運転免許試験」

非常に賢く新しい AI ロボットが多数いると想像してください。それらがサイバーセキュリティの探偵として十分な能力を持っているかどうかを知りたいのです。彼らは、山のようなごちゃごちゃしたデータを見て、悪党を見つけ出し、ハッキングの間に何が起きたのかを正確に特定できるでしょうか?

この論文の著者たちは、「『ウイルスとは何か?』のような雑学を質問するだけでは、記憶力しか測れない。実際に作業ができるかを見てほしい」と言っています。

そこで彼らはExCyTIn-Benchを構築しました。これは AI エージェントのための高リスクな運転免許試験のようなものです。車ではなく、AI がデジタル犯罪現場を運転します。テストコースの代わりに、偽物(しかし現実的な)セキュリティログで満たされた、模擬企業のコンピュータネットワークが用意されています。

試験の構築方法(「犯罪現場」の作り方)

試験を公平かつ現実的なものにするため、研究者たちは単にランダムな質問を作ったわけではありません。彼らは試験を 3 つのステップで構築しました。

  1. 犯罪現場(データ): 彼らは「Alpine Ski House」という架空の Microsoft Azure 企業を設立しました。そこで、ランサムウェアやメール詐欺など、実際に現実世界で発生した8 種類のサイバー攻撃をシミュレーションしました。そして、警察報告書、電話記録、防犯カメラ映像のような57 種類のログテーブル(数千件のエントリを含む)を収集しました。
  2. 地図(グラフ): 人間の探偵が調査する際、一度にすべてを見るわけではありません。彼らは足跡を追います。アラート Aユーザー Bにつながり、それが疑わしいファイル Cにつながります。研究者たちはこれらの足跡を**地図(グラフ)**に変換しました。
    • ノード: この地図には、「アラート(警察のサイレン)」と「エンティティ(関与している人物やコンピュータ)」を表す点が描かれています。
    • エッジ: これらを結ぶ線は、それらがどのように関連しているかを示しています。
  3. 質問(試験問題): 人間が質問を作成する代わりに、AI にこの地図を見て7,542 個の質問を生成させました。
    • : 「IP アドレス X からの不審なログインが検知されました。この地図に基づくと、ハッカーはパスワードを盗むためにどのファイルを使用しましたか?」
    • AI エージェントは、地図の線を「運転」し、データベースを照会し、点と点を結びつけることで答えを見つけなければなりません。

AI が試験を受ける方法

AI エージェントはMySQL データベース環境(巨大な書類棚)の中に置かれます。そこには棚の配置が示されていません。AI は以下の手順を踏む必要があります。

  1. 地図を請求する: 「どのようなテーブルがありますか?」
  2. 手がかりを読む: 「この IP アドレスのログを表示してください。」
  3. 点と点を結ぶ: 「わかりました、その IP アドレスはこのユーザーに関連しています。そのユーザーが何をしたか確認しましょう。」
  4. 答えを提出する: 「ハッカーは ntdsutil.exe というファイルを使用しました。」

AI が正解すればポイントが加算されます。行き詰まったり、間違った質問をしたりすれば、スコアは下がります。この試験は、最終的な答えに至らなくても手がかりをいくつか見つけた場合、先生が解答過程に対して加点をするように、部分点も与えます。

彼らが発見したこと(結果)

研究者たちは、この試験で OpenAI、Google、Anthropic などの大手企業からオープンソースのものまで、さまざまな AI モデルをテストしました。

  • 難易度が高い: 最も賢い AI モデルでさえ苦労しました。最高スコアだったモデル(Claude-Opus-4.5)は、1.0 満点中0.606というスコアでした。これは、まだ改善の余地が大きいことを意味します。
  • 「ひらめき」の瞬間: 最もパフォーマンスが良かった AI モデルは、段階的に推論できるものでした。それらは単に推測するのではなく、データベースを探索し、最初の推測が間違っていたことに気づき、人間の探偵のように新しい経路を試みました。
  • オープンソース vs 大手テック企業: 驚くべきことに、いくつかの小型のオープンソースモデルは、巨大で高価なモデルとほぼ同等のパフォーマンスを発揮し、その格差が縮まっていることを示しました。

なぜこれが重要なのか

この論文は、これが史上初のベンチマークであると主張しています。以前は、AI がサイバーセキュリティの事実をどの程度記憶しているかを主にテストしていました。しかし現在、証拠を吟味し、複雑な出来事の連鎖を推論することで、AI が実際に犯罪を調査できるかどうかをテストする方法ができました。

要約すると: 著者たちは、AI エージェントがサイバーセキュリティ調査員として学べるかどうかを確認するために、現実的な「犯罪現場」と一連の「探偵パズル」を構築しました。結果は、AI が向上しつつあることを示していますが、人間のセキュリティアナリストを代替できるまでには、まだ長い道のりがあることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →