← 最新の論文
💻 computer science

Cross-Vendor Sola ISPM Benchmark: Evaluating Agentic AI for Federated Identity Security Reasoning

本論文は、断片化されたマルチクラウド・アイデンティティ・システムを横断して推論するエージェンティックAIの能力を評価するためのCross-Vendor Sola ISPMベンチマークを紹介し、明示的な関係的コンテキストを提供することが、クロスベンダーのセキュリティ分析における回答の正確性を大幅に向上させ、失敗率を低減させることを実証する。

原著者: Eden Yavin, Gal Engelberg, Konstantin Koutsyi, Leon Goldberg, Gal Baron

公開日 2026-06-03
📖 1 分で読めます☕ さくっと読める

原著者: Eden Yavin, Gal Engelberg, Konstantin Koutsyi, Leon Goldberg, Gal Baron

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大でモダンなオフィスビルを想像してみてください。そこでは、すべての部署が異なる言語と異なるファイリングシステムを使用しています。人事部は従業員記録を一つの帳簿に保管し、ITセキュリティチームはデジタル台帳を使い、クラウドストレージチームは別の地図を持ち、マーケティングチームは全く異なるアプリを使用しています。

かつては、「誰が金庫へのアクセス権を持っているか?」を知りたいときは、ただ一人の人に聞けば済みました。しかし今日、「金庫」はデジタル化されており、鍵はこれらすべての異なるシステムの中に散らばっています。答えを見つけるためには、人事の帳簿、ITの台帳、そしてクラウドの地図の間で、点と点を結びつけなければなりません。

この論文は、あるAI探偵がこれらのパズルを解くほど賢いかどうかをテストするための、新しい方法を紹介しています。

問題:「翻訳ミス」のギャップ

著者らはこれを**「相関ギャップ(Correlation Gap)」**と呼んでいます。

あなたが探偵で、容疑者を探しているところだと想像してください。手元には容疑者の顔写真(HRシステムにおける名前)と、車の特徴(クラウドシステムにおけるID)があります。しかし、警察のデータベースは、「人事の帳簿にある『ジョン・ドゥ』は、車の登録簿にある『J. ドゥ』と同じ人物である」ということを知りません。

現在のAIモデルは、一つの本を読むことは非常に得意ですが、異なる言語間で手がかりを結びつけることは苦手な探偵のようなものです。彼らは答えを推測することはできますが、システム同士がどのように対話しているかを理解できないため、途中で迷ってしまうことがよくあります。

解決策:「Sola ベンチマーク」

研究者たちは、AIエージェントにこの特定の問題をテストするための訓練場(ベンチマーク)を構築しました。

  • セットアップ: 彼らは、8つの異なる現実世界のプラットフォーム(AWS、Google、Microsoft、および人事ソフトウェアなど)を使用して、現実的で混沌とした環境を作り上げました。
  • テスト: AIに50個の複雑な質問を与えました。例えば、「先月解雇されたが、依然としてクラウドサーバーへのアクセス権を持っている従業員をすべて特定せよ」といった内容です。
  • 挑戦: これに答えるためには、AIは以下のステップを踏む必要があります:
    1. 人事リストを見て、解雇された人々を見つける。
    2. そのリストを、アイデンティティ・プロバイダー(Oktaなど)の言語に翻訳する。
    3. それをクラウドプロバイダー(AWSなど)と照合し、誰がまだ鍵を持っているかを確認する。
    4. 混乱することなく、これらすべての点を結びつける。

実験:探偵に地図を与える

研究者たちは、何が最も効果的であったかを確認するために、AIを5つの異なる条件下でテストしました。

  1. コンテキストなし: 探偵は目隠しをされた状態で建物の中に放り込まれます。地図やリストはなく、推測しながらあらゆるドアを叩かなければなりません。
  2. スキーマのみ: 探偵は部屋の番号と中身のリストを受け取りますが、それらの部屋がどのように繋がっているかのマップは持っていません。
  3. スキーマ + グラフ: 探偵は部屋のリストに加え、どのドアがどのドアに繋がっているかを示すマップを受け取ります(例:「人事ビルのドアAは、クラウドビルのドアBに直接つながっている」)。
  4. スキーマ + 例題: 探偵は部屋のリストと、他の探偵が同様のパズルをどのように解いたかといういくつかの事例を受け取ります。
  5. フル・コンテキスト: 探偵は部屋のリスト、マップ、例題、そしてガイドブックをすべて受け取ります。

結果:マップが決定的な違いを生む

結果は明白であり、驚くべきものでした。

  • 当てずっぽうの失敗: AIに助けがない場合(コンテキストなし)、AIは苦戦しました。多くの間違いを犯し、物事を理解するために大量の質問をしなければなりませんでした。
  • 「グラフ」こそが魔法の要素: パフォーマンスが最も大きく向上したのは、AIにセキュリティ・グラフ(システム間の接続を示すマップ)を与えた時でした。
    • 正確性の向上: 完全なマップと例題を与えると、AIの正解率は約**34%**上昇しました。
    • 効率性の向上: AIは推測や不要な質問をやめ、必要な「移動」の回数を約**70%**削減しました。
  • 賢いが迷子: 論文によれば、AIモデルは実際にはかなり賢いことが分かりました。助けがなくても、彼らはしばしば答えの概略(例:「はい、リスクが存在します」)を推測できました。しかし、マップがなければ、それを証明するための具体的な証拠(例:「リスクがある正確な12名は以下の通りです」)を見つけることはできませんでした。

まとめ

この論文は、AIは必ずしもセキュリティ推論において「愚か」なのではなく、適切なコンテキストがないために「盲目」になっているだけであると結論付けています。

これは、ドライバーにGPSを与えることに似ています。ドライバー(AI)は運転の方法も目的地も知っていますが、GPS(システム間の接続を示す構造化されたマップ)がなければ、道に迷い、曲がり角を間違え、時間を浪費してしまいます。一度GPSを与えれば、彼らは完璧に運転し、より速く到着し、どの通りを通るべきかを正確に把握できるのです。

著者らは、AIが現実世界のセキュリティにおいて有用であるためには、単に質問を投げかけるだけでなく、デジタル世界のあらゆる部分を繋ぐ**「関係性のマップ」**を与えなければならないということを証明するために、このベンチマークを構築しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →