コンピュータが単に命令に従うだけでなく、悪党が侵入してくる前に、巨大で無秩序なオフィスビルの中からセキュリティ上の欠陥を捜し出す「新人刑事」のように振る舞う世界を想像してみてください。これが「自律型サイバー防御」の夢です。そこでは、AIエージェントが組織のデジタル状態を常にスキャンしています。誰がサーバー室の鍵を持っているのか、どのソフトウェアが古くなっているのか、そして誰かがこっそり動き回っていないかなどをチェックするのです。しかし、ここには落とし穴があります。刑事が信頼されるためには、その刑事が実際に事件を解決しているのか、それとも単に推測しているだけなのかを知る必要があります。現在、大きな問題があります。企業の実際のデータは機密事項であるため、研究者はこれらのAI刑事を、現実世界の複雑で混沌としたシナリオでテストすることができないのです。これは、パイロットに飛行機の操縦桿を一度も握らせず、雲の写真だけを見せて飛行機の操縦を教えようとするようなものです。共有された公平なテスト環境がなければ、これらのAIエージェントが私たちを救う準備ができているのか、それとも単に作り話をしているだけなのかを知る術はありません。
本論文は、「Open Security Benchmark (OSB)」と呼ばれる解決策を紹介しています。これは、本質的に、これらのAI刑事をテストするために特別に構築された、巨大で凍結された偽の「デジタル都市」です。これは、偽の従業員、偽のクラウドサーバー、偽のパスワードを備えた、現実の企業と全く同じように見え、感じられる、巨大で不変のビデオゲームのレベルのようなものだと考えてください。著者らは、理論と現実の間の溝を埋めるために、この「都市」を作り上げました。彼らは、AIエージェントに「先月解雇されたはずなのに、依然として会社の機密ファイルへのアクセス権を持っている従業員をすべて見つけ出せ」といった謎解きを与え、エージェントが2つの異なる方法を用いて答えを見つけ出すためのフレームワークを構築しました。一つは、巨大なデータベースを検索するために特殊な言語(SQL)でクエリを書くこと、もう一つは、AWSやGoogle Workspaceのような実際のベンダーツールを操作する人間のように振る舞うことです。
この論文は、単に「見てください、ゲームを作りました」と言っているわけではありません。エージェントが実行されるたびに「グラウンドトゥルース(正解)」が常に同一であることを保証するために、環境を凍結させるという厳格なフレームフレームワークを提示しています。これにより、研究者はAIを、単に正しい答えに到達したかどうかだけでなく、「どのように」そこに到達したかについても採点できるようになります。適切な質問をしたか? 異なるシステム間の点と点を結びつけたか? 本研究はこのフレームワークを合成された偽の組織を用いて具体化しており、小規模なチーム(75人)から大規模な組織(2,000人)まで、さまざまな規模の企業でのテストを可能にしています。このフレームワークは、AIエージェントが現実世界の複雑なタスク、例えば人事記録と異なるベンダー間のクラウドアカウントを結びつけるといった、単一ベンダーのツールでは極めて困難とされる能力を扱えるかどうかを明らかにするように設計されています。
決定的なことに、本論文は、AIエージェントが自信に満ちた回答を出したとしても、それだけで信頼してよいわけではないと主張しています。著者らは、これらのエージェントを単独で、あるいは小さくクリーンなデータセットで評価するという考えを明確に否定しています。彼らは、公平であるためには環境が「凍結」されており、かつ複数のベンダーをまたいでいる必要があると主張しています。彼らは、AIがサイバー防御を解決したと主張しているわけではありません。むしろ、このベンチマークは進歩を測定するための必要なツールであり、「このAIは安全か?」という曖昧な問いを、具体的なスコアカードへと変えるものであると示唆しています。共有され、再現可能な目標を提供することで、OSBはこの分野を「推測」から「測定」へと移行させ、私たちが最終的にAIエージェントに現実のデジタル都市のハンドルを握らせる際、彼らが実際にどのようにパフォーマンスを発揮するかを確実に把握することを目指しています。
技術要約:Open Security Benchmark (OSB)
問題提起:環境データのギャップ
本論文は、自律型エンタープライズ・サイバー防御の開発における決定的なボトルネックを特定している。それは、エージェント型AIを評価するための、共有可能でクエリ可能な、再現性のある環境の欠如である。企業は、セキュリティ状態を感知し、推論し、行動できるエージェントへと移行しつつあるが、この分野は「環境データのギャップ」に苦しんでいる。実際のエンタープライズ環境はプライベートであり、複数のベンダーにまたがり、深く相関したデータを含んでいるが、これらは公開されていない。その結果、エンドツーエンドで防御姿勢(posture)の調査エージェントを評価するための「ゴールド(正解)」となる回答を備えた、共有の基盤が存在しない。既存のベンチマークは、狭い領域(例:攻撃的セキュリティ、特定の脆弱性検出)のみを扱っているか、あるいはセキュリティ・ポスチャ管理(SPM)に求められるクロスベンダーかつ包括的な視点を欠いている。実務家は、エージェントを実際に配備すべき業務に基づいて比較することができず、研究者は体系的な評価のための安定したターゲットを欠いている。
メソドロジー
Open Security Benchmark (OSB) フレームワークは、組織のセキュリティ状態の凍結された不変のスナップショットとして、精査された合成エンタープライズ環境を提示することで、このギャップに対処する。その手法は、以下の5つのコアコンポーネントで構成されている。
1. データレイヤーと環境
OSBは、完全に架空(実在の個人や資格情報は含まない)でありながら、実際の商品データモデルやプロダクションの行動パターン(例:アイデンティティのライフサイクル、権限構造、一般的な設定ミス)から合成された合成組織データセットを利用する。
- 範囲: 初回リリースでは、8つのベンダー様式のソース(AWS, Azure AD, GCP, GitHub, Google Workspace, HRIS, MongoDB Atlas, Okка)をカバーしており、44のリレーショナルテーブルで構成される。
- 規模: 環境は、汎用性と堅牢性をテストするために、3つのスケール(Small: 約75従業員、Mid: 約400、Large: 約2,000)で生成される。
- 信頼境界: エージェントが観測するもの(スキーマとデータ)と、エバリュエーター(評価者)が観測するもの(ゴールドのリファレンス、シードデータ)との間には、厳格な分離が存在する。
2. 調査モダリティ
OSBは、同一の基礎環境とグラウンドトゥルース(正解)を用いて、2つの異なるモダリティでエージェントを評価する。
- Text-to-SQL (Relational): エージェントは、読み取り専用のリレーショナル・スナップショットと対話する。タスクは、データベース D と自然言語によるセキュリティの問い q のペア (D,q) として定式化される。エージェントは、関連するテーブルを発見し、SQLクエリを構成し、回答を合成しなければならない。このモダリティは、事前定義された外部キーなしでのクロスベンダーの相関関係(例:HRデータとクラウドアクセスの結合)の評価を標準化し、エージェントにアイデンティティ解決パスを推論させる。
- ネイティブ・ベンダーAPI: 同一の環境スナップショットが、実際のベンダーAPI(例:AWS CLI、IdPへのHTTPコール)を介して実行可能な世界としてコンパイルされる。エージェントは、実際のベンダーツールとドキュメンテーションを使用して対話する。記録されたリクエストトレースは、SQLクエリトレースに代わるエビデンスとしてスコアリングに使用される。
3. タスクおよび評価セット
タスクは、構造化された回答(判定、一致する対象の集合、または構成事実)を必要とするセキュリティの問いである。
- パッケージング: 本フレームワークは、Sola Securityのベンチマークから派生した2つの初期パックを提供している:ISPM Visibility(単一プラットフォームのインベントリとハイジーン)および ISPM Cross-Vendor(境界を越えたフェデレーテッドな相関関係)。
- グラウンドトゥルース: 回答は「クローズドフォーム(閉形式)」であり、プランに依存しない。スコアリングは、論理形式(特定のクエリやAPIシーケンス)ではなく、デノテーション(回答の内容)に基づいて行われるため、意味的な等価性が許容される。
4. スコアリングレイヤー
評価は多次元的であり、結果を単一の集計スコアに集約することを避ける。以下の4段階のパイプラインを採用する。
- 実行 (Execution): エージェントをタスクに対して実行する。
- エビデンス収集 (Evidence Collection): 推論トレースおよびクエリ/APIトレースを収集する。
- ルールロックされたLLMジャッジ (Rubric-Locked LLM Judges): 異なるプロバイダーの2つのジャッジからなるパネルが、「回答の正確性」、「推論の有用性」、「SQLの意味的な適切性」などの基準を0〜1の範囲でスコアリングする。
- 決定論的な構造チェック (Deterministic Structural Checks): 「テーブル/ジョインの再現率(Recall)」や「適合率(Precision)」といった指標により、エージェントが正しいデータ構造にアクセスしたかを確認する。
- 指標: スコアは、ブートストラップ法による95%信頼区間およびジャッジ間の合意度(Cohen's κ)と共に報告され、スコアラーのノイズを明らかにする。
5. ハーネスとBring-Your-Own (BYO) パス
- ハーネス (Harness): エージェントを
get-schema と run-query(またはAPIの同等操作)に制限する、最小限かつ監査可能な実行基盤。すべての操作はエビデンスアーカイブに記録され、再現性を保証する。
- BYOパス: 研究者は比較のために公開パックを実行でき、実務家は独自のプライベートテナントデータと成功の定義を提供できる。プライベートな評価は、テナント内の自己ホスト型またはオープンウェイトのジャッジ上で実行されるため、機密データが組織外に流出することはない。
主な貢献
本論文は、主に3つの貢献を提示している。
- OSBフレームワーク: データレイヤー、タスク/評価セットレイヤー、多次元スコアリング、監査可能なハーネス、およびBYOパスを備えた、エージェント型AIをセキュリティポスチャのタスクで評価するための標準化された基盤。
- 精査されたデータカタログ: 環境データのギャップを埋める、合成組織データセットのコレクション。これは、ゴールドのポスチャ回答を備えた、共有可能でクロスベンダーかつクエリ可能なターゲットを提供する。
- 初期ユースケースパック: アイデンティティ・セキュリティに関する2つのパック(VisibilityおよびCross-Vendor)が、フレームワークをエンドツーエンドで具現化しており、他のポスチャ・サブドメイン(例:クラウド構成、脆弱性状態)におけるコミュニティ主導のパック作成への道筋を確立している。
結果と主張
本論文は、特定のAIモデル(例:「モデルXは85%をスコアした」など)を比較する実験結果は提示していない。代わりに、フレームワーク自体の重要性を主張している。
- ギャップの解消: OSBは、ゴールドの回答と伴う、防御志向の最初の共有されたクロスベンダー・リレーショナル環境を提供する。
- 測定による信頼: 回答を凍結された環境内のクローズドフォームのグラウンドトゥルースに固定することで、OSBはエージェントの信頼に関する問いを、主観的な判断から客観的な測定へとシフトさせる。
- 拡張性と拡張性: フレームワークは、アイデンティティを超えて他のポスチャ・サブドメインや防御段階(リスク優先順位付け、修復、検証)へと拡張できるように設計されている。
- トレーニングの可能性: 評価中に生成されるエビデンスアーカイブは、オフライン強化学習や模倣学習の入力として機能するように構造化されており、ベンチマーク自身の検証済みトレースを用いた「ブートストラップによる自己改善」を通じて、エージェントの能力向上を可能にする可能性がある。
重要性
著者らは、OSBを単なるスコアボードではなく、自律型サイバー防御を進展させるためのエンジンとして位置づけている。安定し、再現可能で、プライバシーに配慮した基盤を提供することで、OSBはコミュニティがパックを作成し、エージェントが実際に配備されるべき業務に基づいて比較し、あらゆる評価を次世代のエージェントを進展させるデータへと変えることを可能にする。究極の目標は、信頼できるエージェント型AIを、自律型エンタープライズ・サイバー防御の状況把握(situational-awareness)の中核へと拡張し、セキュリティポスチャの評価を「判断」ではなく「測定」の問題にすることである。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録