AgentCyberRange: Benchmarking Frontier AI Systems in Realistic Cyber Ranges
本論文は、現実的なウェブ脆弱性攻撃およびポストエクスプロイトのシナリオにおける最先端AIシステムの自律的な攻撃能力をベンチマークするために設計された、オープンなマルチホスト・インフラストラクチャであるAgentCyberRangeを紹介しており、現在のモデルは成功が限定的である一方で、現実的な条件下では未知の脆弱性を発見し防御を回避できる可能性があることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
概要:デジタル道場におけるAIのテスト
想像してみてください。あなたは、新しく開発された超スマートなロボットが危険かどうかを知りたいと考えています。ロボットに「あなたは危険ですか?」と直接聞くことはできません。なぜなら、ロボットは嘘をつくかもしれないからです。また、数学のテストを課すこともできません。数学ができるからといって、家に侵入できるとは限らないからです。
このロボットが本当にトラブルを引き起こす可能性があるのかを知るには、シミュレーションされた近隣地域(「サイバーレンジ」)の中にロボットを入れ、本物の泥棒と同じように侵入を試みさせる必要があります。
この論文は、まさにそれであるAGENTCYBERRANGEを紹介しています。これは、世界で最も賢いAIシステムが、いかに現実的なサイバー攻撃を実行できるかをテストするために設計された、巨大なオープンソースの「デジタル道場」です。
問題点:「ビデオゲーム」対「現実世界」
この論文が登場する前、AIのセキュリティテストは、一度に一つのパズルを解くだけのビデオゲームのようなものでした。
- 従来のテスト: 「ここに鍵のかかったドアがあります。鍵を開けてください。」(これは「脆弱性の再現」と呼ばれます)。
- 現実: 本物のハッカーは、単に一つの鍵を開けるだけではありません。彼らはまず、裏口を見つけるために近所を歩き回り、忍び込み、廊下でマスターキーを見つけ、そして家中のすべての部屋の鍵を開けます。
著者らは、これまでのテストは単純すぎると主張しています。それらのテストは、「ドアを見つける」ことから「家全体を乗っ取る」ことへと、点と点を結びつけるAIの能力をテストしていませんでした。
解決策:二段階の強盗劇
AGENTCYBERRANGEベンチマークは、本物の強盗劇を模倣して、AIに対して主に2つの課題を設定します。
- Webエクスプロイト(表玄関): AIは実際のウェブサイト(銀行やブログなど)を観察し、隠された裏口や弱い窓を見つけなければなりません。指示されることなく、どこを探すべきかを自分で判断する必要があります。
- ポストエクスプロイト(内部工作): その一つのドアから侵入した後、AIはそこに留まり続けなければなりません。AIは「ルート(管理者権限)」という「ボスキー」を手に入れるために梯子を登り、セキュリティガード(アンチウイルス)をすり抜け、ネットワーク全体を制御するまで別のコンピュータへと移動していく必要があります。
これを公平かつ再現可能なものにするために、彼らはCAGEと呼ばれるツールを構築しました。CAGEは、いわば審判兼ステージマネージャーです。CAGEは偽の家を用意し、AIロボットを走らせ、彼らの行動を監視し、彼らが実際に成功したのか、それとも単に運が良かっただけなのかを自動的にチェックします。
実験:誰が最高の泥棒か?
研究者たちは、世界で最も高度な6つのAIシステム(GPTやClaudeのバージョンを含む)を、このデジタル道場でテストしました。彼らに、侵入を試みるための「予算(ステップ数の制限)」を与えました。
結果:
- 勝者: コーディングツールであるCodexとペアになったAIシステム GPT-5.5 が最も優秀でした。
- スコア: 最も優れたAIであっても、「表玄関」の課題では約16%、「内部工作」の課題では約**32%**の成功率しか達成できませんでした。
- 教訓: これらのAIは恐ろしいほど上手くなっています。彼らは単にパズルを解いているのではなく、実際に現実のソフトウェアに侵入し、ネットワーク内を移動しています。しかし、彼らはまだ完璧で信頼できるハッカーには程遠い状態です。彼らはしばしば道に迷ったり、隠れたドアを見逃したり、あるいはセキュリティアラームに捕まったりします。
「驚きの」発見
論文では、当初のテスト計画には含まれていなかった2つの興味深い事実が見つかりました。
- 新しい秘密を発見した: テスト用のウェブサイトへの侵入を試みる過程で、AIは人気のあるソフトウェアにおける、人間の開発者さえまだ知らなかった**全く新しい未知の脆弱性(ゼロデイ)**を偶然発見しました。
- 適応力がある: テスト環境が彼らを阻止しようとしたとき(アンチウイルスプログラムなど)、AIは防御を回避するために「ツール」や「手法」を変更することがあり、即座に思考して対応できることを示しました。
結論:私たちは新しい鏡を必要としている
著者らは、もはやAIを単純なパズルでテストすることはできないと結論付けています。これらのシステムは、複雑な攻撃(ドアを見つけ、侵入し、全体を乗っ取る)を連鎖させる能力を示し始めているため、AGENTCYBERRANGEのような現実的でエンドツーエンドのテスト環境が必要です。
私たちは、彼らがどのように失敗し、どのように成功するかを、安全で制御された「道場」の中で正確に把握する必要があります。この論文は、これらのAIは強力ではあるものの、まだ「信頼できる」攻撃者ではないが、その潜在能力は急速に高まっており、注意深く監視する必要があることを強調しています。
要約すると: この論文は、超AIが人間のようにハッキングできるかどうかをテストするための現実的なシミュレーションを構築しました。最も賢いAIはすでに現実のシステムに侵入し、新たな穴を見つけることができる一方で、依然として多くのミスも犯していることが分かりました。デジタル世界を守るために、私たちはこうしたテストを必要としているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。