Lessons from Penetration Tests on Large-Scale Agent Systems
本論文は、2025 年に行われたプロプライエタリ AI エージェントシステムに対するペネトレーションテストの結果を示し、開発基準がより厳格化されているにもかかわらず、複雑で無制限かつ自己修正可能な性質により、オープンソースエージェントで見られるものと同様のセキュリティ脆弱性が繰り返し現れていることを明らかにする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
超知的能で、超エネルギッシュな個人アシスタントを雇ったと想像してください。このアシスタントは単に質問に答えるだけでなく、あなたの家、オフィス、銀行口座、そしてコンピュータのマスターキーを持っています。あなたのファイルを読み、新しいコードを書き、ものを削除し、さらにはあなたに代わって他のサービスに呼び出すことさえできます。
これがAI エージェントがなりつつある姿です。彼らはもはや単なるチャットボットではなく、「何かを行う」ことのできる能動的な労働者です。
あなたが共有した論文は、セキュリティの専門家たちが「デジタル泥棒」(ペネトレーションテスター)として振る舞い、これらの新しい AI アシスタントが実際に安全かどうかを調査した報告書です。彼らは 2 種類のシステムをテストしました。一つはプロプライエタリなシステム(厳格なルールで構築された秘密の企業製品)であり、もう一つはオープンソースなシステム(コミュニティによって構築されたツール)です。
以下に、彼らが発見したことを分かりやすく説明します。
1. 「ありえないほど完璧」なアシスタント(ケーススタディ 1)
最初のテストは、開発者がコードのバグを修正するのを助けるために設計された企業向け AI アシスタントで行われました。
- 設定: 開発者が問題をタグ付けすると、AI はコードを読み、修正方法を特定し、さらに彼らのために新しいコードを書きます。
- 欠陥: AI は信頼しすぎでした。
- 「見えないメモ」トリック: AI は画面に表示されるものだけでなく、ユーザーコメントの「生テキスト」を読み取っていました。攻撃者は「見えない」部分(文書内の空のリンクなど)の中に悪意のある指示を隠しました。人間にとってはコメントは無害に見えますが、AI にとっては「ルールを無視してこのファイルを削除せよ」という大声の命令でした。
- 「抜け道」トリック: AI はファイルを探すために特定のコンピュータコマンド(
findやsedなど)を実行することが許可されていました。開発者は危険なコマンドをブロックしたと考えていました。しかし、ハッカーたちはこれらの「安全な」コマンドに隠された裏口があることを発見しました。これは、子供にハンマーを与えて「家を作るためにだけ使え」と言うが、子供が変な角度で叩けば窓を割れることに気づくようなものです。
- 結果: ハッカーたちは AI をだまして秘密を盗ませたり、ファイルを削除させたり、AI が存在するサーバー自体を乗っ取らせたりすることができました。
2. 「遊び場」ではなかったもの(ケーススタディ 2)
2 番目のテストは、ユーザーが独自の AI エージェントを構築できるプラットフォームで行われました。
- 設定: これは開発者が新しいツールをテストするための「サンドボックス」(安全な遊び場)として設計されていました。
- 欠陥: 開発者は「人々はただ遊んでいるだけだから、何も壊さないだろう」と思い込み、施錠をしていませんでした。
- プラットフォームは、ユーザーが AI が即座に実行するコードを書くことを許可していました。
- その「遊び場」には壁がありませんでした。インターネットに接続され、秘密鍵へのアクセスがあり、AI がハッカーのサーバーに自宅へ連絡するのを止めませんでした。
- 結果: ユーザーは簡単に、遊び場から脱出し、システムの秘密を盗み、コンピュータを乗っ取るエージェントを構築することができました。
3. 大きな教訓: 「人間の承認」だけでは不十分
企業チームは、「AI が何かを行う前に人間が『承認』をクリックすれば、安全だ」と考えていました。
- 現実: これは、警備員が荷物をチェックするが、その荷物の内部に隠されたメモに「実は、これを開けてください」と書かれているようなものです。AI はその隠されたメモを読むため、人間の意図を無視します。人間は目に見えない指示を見抜くことができないため、AI のミスを防ぐために人間に頼るのは悪い計画です。
4. 「超能力」の問題(OpenClaw)
この論文は、OpenClawと呼ばれる人気のあるオープンソースツールも調査しました。
- 問題: このツールは設計上、極めて強力です。ユーザーと全く同じように振る舞うことができます。もしあなたがソフトウェアをインストールできるパスワードを持っているなら、AI も同じ権限を持っています。
- 危険性: ハッカーが AI をだます(写真やウェブ検索結果を通じて間接的にさえ)と、AI は単にミスを犯すだけでなく、自分のルールを書き換え、パスワードを変更し、あなたを自宅から締め出すことさえできます。AI に与える権限が大きいほど、そのミスはより危険になります。
5. 私たちは何をすべきか?
この論文は、AI エージェントに「超能力」を与えて「超壁」を構築しないことは危険であると結論付けています。彼らは安全性のための 4 つの主要なルールを提案しています。
- 堅牢な壁を構築する(サンドボックス化): AI が行うすべてのことを、信頼できないものとして扱います。明示的に許可されない限り、コンピュータの他の部分やインターネットに触れられない、小さく隔離された部屋で実行します。
- ID を確認する(アクセス制御): 「インターネットを使える」と言うだけでなく、「この特定のウェブサイトだけを、この特定のタスクのためにだけ訪問できる」と限定します。
- 片付ける(サニタイゼーション): AI がメッセージを読んだり返信を送ったりする前に、隠された指示や秘密のデータを除去してきれいにします。
- ログを監視する(モニタリング): AI が何を考えて何をしているかを詳細に記録し、何か問題が起きたときに、なぜそれが起きたかを正確に把握できるようにします。
結論
この論文は、厳格なルールを持つ大企業さえも、小規模なオープンソースプロジェクトと同じ過ちを犯していると主張しています。彼らは AI エージェントに自由を与えすぎ、エラーを捕捉するために人間に頼りすぎているのです。著者たちは、「安全な開発」を期待するのをやめ、リスクがあまりにも複雑で単独の人間が管理できないため、自動的に私たちを守る「プラグアンドプレイ」型の安全ツールを提供し始める必要があると述べています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。