ADR: An Agentic Detection System for Enterprise Agentic AI Security
本論文は、高忠実度のテレメトリ、体系的なレッドチーム、スケーラブルな2段階検出システムを組み合わせ、観測性、堅牢性、コストの課題を克服し、実世界での展開およびベンチマーク評価において優れた性能を達成するモデルコンテキストプロトコル(MCP)エージェントの保護のための実証済みのエンタープライズフレームワークであるADRを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
何千もの従業員が新しい種類の「スーパーアシスタント」(AI エージェント)を使って業務を行う、巨大でハイテクなオフィスを想像してください。これらのアシスタントは、ファイルを読み取り、コードを書き、他のソフトウェアツールと対話して作業を完了させることができます。これらは、MCP(Model Context Protocol)と呼ばれる標準的な言語を使ってツールと対話します。
問題は、これらのアシスタントが非常に賢く自律的であるため、欺かれる可能性があることです。ハッカーはアシスタントに秘密の指示をささやき、パスワードを盗んだり重要なファイルを削除したりするように説得できます。アシスタント自身はただ仕事をこなしているだけだと思っています。
従来のセキュリティガード(ファイルの変更を監視するものなど)は、ファイルが変更された「事実」は検知できますが、アシスタントがなぜ変更したのかという「理由」は聞き取れません。彼らは行動の背後にある「思考プロセス」を見逃してしまいます。
この論文は、これらの AI アシスタントを監視するために設計された新しいセキュリティシステム、ADR(Agentic Detection and Response) を紹介します。その仕組みを簡単に説明します。
1. 問題:「盲点」
古いセキュリティツールを、工場フロアを監視するカメラだと考えてみてください。それらは作業員が箱を持ち上げて扉から出ていく様子を見ることはできます。しかし、作業員の会話や、手に持った「この箱は実は爆弾だ」と書かれたメモは聞き取ったり見たりできません。
- ギャップ: 古いツールは「行動」(ファイルの書き込み)は検知しますが、「意図」(プロンプトと推論)を見逃します。
- リスク: ハッカーは、データ窃取を通常のタスクだと AI に思い込ませることができます。
2. 解決策:ADR システム
著者たちは、これを修正するために、高度に訓練されたセキュリティチームのように機能する 3 部構成のシステムを構築しました。
部品 A:「鷲の目」センサー(ADR Sensor)
工場フロアを監視するだけでなく、このセンサーは AI の脳内に直接設置されます。
- 機能: ユーザーが何を求めたか、AI がそれをどのように考え、どのツールを使用し、その後何が起こったか、すべてを記録します。
- 比喩: これは会議での最終決定だけでなく、話されたすべての言葉を記録する法廷速記員のようなものです。これにより、セキュリティチームは AI が何をしたかという結果だけでなく、AI が何を行っていたかの完全な「物語」を得ることができます。
部品 B:「2 段階」探偵チーム(ADR Detector)
すべての行動を、超賢明だが高価な AI 探偵でチェックするのは、コストと時間がかかりすぎます。そこで、ADR は 2 段階のプロセスを使用します。
- ティア 1(迅速なトリアージ): 高速で軽量なスキャナーが、1 秒間に数千の行動をチェックします。これはクラブの入り口で ID を素早く確認するボーイのようなものです。明らかに安全そうであれば通過させます。「怪しい」(パスワードを要求するなど)と思われる場合は、フラグを立てます。
- ティア 2(深掘り調査): フラグが立てられた項目は、シニア探偵に送られます。この探偵は会社の規則書、コードマニュアル、既知の犯罪手口リストにアクセスできます。完全な物語(センサーから取得)を読み、「これは実際の攻撃か、それとも誤解か」を判断します。
- なぜ機能するか: 退屈で安全なタスクには高価な探偵を使わないことでコストを節約しつつ、疑わしいタスクには深く慎重な分析を施すことを保証します。
部品 C:「レッドチーム」シミュレーター(ADR Explorer)
システムが稼働する前には、テストが必要です。
- 機能: 特別な AI「レッドチーム」がシステムを破壊しようと試みます。AI アシスタントを欺く新しい巧妙な方法を考案します。
- 比喩: 建物の警報が機能するか確認するために、チームが建物に火を忍び込ませる消火訓練を想像してください。レッドチームが新しい手口を見つけた場合、システムはそれから学び、実際のハッカーがそれを使う前に賢くなります。
3. 結果:実世界での証明
チームは、7,200 台以上のコンピューターで 10 ヶ月以上、Uber においてこれをテストしました。
- 成功: システムは、従業員が誤って(あるいは悪意を持って)パスワードや秘密を外部と共有した数百件を発見しました。
- 精度: 非常に正確でした。テストにおいて、特定のベンチマークで誤検知がゼロ(狼がいないのに「狼だ」と叫ぶことが一度もなかった)でありながら、実際の攻撃の 67% を検知しました。
- 比較: 現在利用可能な他のトップセキュリティツールよりも 2 倍から 4 倍優れた性能を発揮しました。
4. 「シフト・レフト」予防
このシステムは秘密の共有を特定するのが非常に上手だったため、チームは単にそれらを捕まえるだけでなく、発生する前に阻止しました。
- ユーザーが入力しようとしている内容をスキャンする「プレプロンプト」チェック(フック)を追加しました。パスワードを検出すると、即座にブロックします。
- これは97.2% の精度で機能し、漏洩が始まる前に防止しました。
まとめ
この論文は、ADR を、AI アシスタントの新しい時代における最初の大規模で実証済みのセキュリティシステムとして提示しています。これは、AI の思考内容を「見えない」という問題を、完全な会話を記録し、コストを節約するために賢明な 2 段階の探偵プロセスを使用し、自らのシステムをハックしようとする試みを通じて常に自己訓練を行うことで解決します。それは実在する企業環境で成功を証明し、古いツールが見逃していた実際のセキュリティリスクを捕捉しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。