← 最新の論文
💻 computer science

Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense

本論文は、公開されているベンダー横断的な評価データの決定的な欠落を埋めるために、正解(グラウンドトゥルース)を備えた凍結された包括的かつクエリ可能なセキュリティ環境を提供することで、エンタープライズ・サイバー防御における自律型AIエージェントの評価と信頼構築を行うよう設計された新しいフレームワークである、Open Security Benchmark (OSB) を紹介するものである。

原著者: Gal Engelberg, Michael Arenzon, Leon Goldberg

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Gal Engelberg, Michael Arenzon, Leon Goldberg

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが単に命令に従うだけでなく、悪党が侵入してくる前に、巨大で無秩序なオフィスビルの中からセキュリティ上の欠陥を捜し出す「新人刑事」のように振る舞う世界を想像してみてください。これが「自律型サイバー防御」の夢です。そこでは、AIエージェントが組織のデジタル状態を常にスキャンしています。誰がサーバー室の鍵を持っているのか、どのソフトウェアが古くなっているのか、そして誰かがこっそり動き回っていないかなどをチェックするのです。しかし、ここには落とし穴があります。刑事が信頼されるためには、その刑事が実際に事件を解決しているのか、それとも単に推測しているだけなのかを知る必要があります。現在、大きな問題があります。企業の実際のデータは機密事項であるため、研究者はこれらのAI刑事を、現実世界の複雑で混沌としたシナリオでテストすることができないのです。これは、パイロットに飛行機の操縦桿を一度も握らせず、雲の写真だけを見せて飛行機の操縦を教えようとするようなものです。共有された公平なテスト環境がなければ、これらのAIエージェントが私たちを救う準備ができているのか、それとも単に作り話をしているだけなのかを知る術はありません。

本論文は、「Open Security Benchmark (OSB)」と呼ばれる解決策を紹介しています。これは、本質的に、これらのAI刑事をテストするために特別に構築された、巨大で凍結された偽の「デジタル都市」です。これは、偽の従業員、偽のクラウドサーバー、偽のパスワードを備えた、現実の企業と全く同じように見え、感じられる、巨大で不変のビデオゲームのレベルのようなものだと考えてください。著者らは、理論と現実の間の溝を埋めるために、この「都市」を作り上げました。彼らは、AIエージェントに「先月解雇されたはずなのに、依然として会社の機密ファイルへのアクセス権を持っている従業員をすべて見つけ出せ」といった謎解きを与え、エージェントが2つの異なる方法を用いて答えを見つけ出すためのフレームワークを構築しました。一つは、巨大なデータベースを検索するために特殊な言語(SQL)でクエリを書くこと、もう一つは、AWSやGoogle Workspaceのような実際のベンダーツールを操作する人間のように振る舞うことです。

この論文は、単に「見てください、ゲームを作りました」と言っているわけではありません。エージェントが実行されるたびに「グラウンドトゥルース(正解)」が常に同一であることを保証するために、環境を凍結させるという厳格なフレームフレームワークを提示しています。これにより、研究者はAIを、単に正しい答えに到達したかどうかだけでなく、「どのように」そこに到達したかについても採点できるようになります。適切な質問をしたか? 異なるシステム間の点と点を結びつけたか? 本研究はこのフレームワークを合成された偽の組織を用いて具体化しており、小規模なチーム(75人)から大規模な組織(2,000人)まで、さまざまな規模の企業でのテストを可能にしています。このフレームワークは、AIエージェントが現実世界の複雑なタスク、例えば人事記録と異なるベンダー間のクラウドアカウントを結びつけるといった、単一ベンダーのツールでは極めて困難とされる能力を扱えるかどうかを明らかにするように設計されています。

決定的なことに、本論文は、AIエージェントが自信に満ちた回答を出したとしても、それだけで信頼してよいわけではないと主張しています。著者らは、これらのエージェントを単独で、あるいは小さくクリーンなデータセットで評価するという考えを明確に否定しています。彼らは、公平であるためには環境が「凍結」されており、かつ複数のベンダーをまたいでいる必要があると主張しています。彼らは、AIがサイバー防御を解決したと主張しているわけではありません。むしろ、このベンチマークは進歩を測定するための必要なツールであり、「このAIは安全か?」という曖昧な問いを、具体的なスコアカードへと変えるものであると示唆しています。共有され、再現可能な目標を提供することで、OSBはこの分野を「推測」から「測定」へと移行させ、私たちが最終的にAIエージェントに現実のデジタル都市のハンドルを握らせる際、彼らが実際にどのようにパフォーマンスを発揮するかを確実に把握することを目指しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →