← 最新の論文
🤖 machine learning

Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

本論文は、AIエージェントに対して体系的なプロンプトによる探索を行い、ターゲットのプロファイル構築およびより強力な間接プロンプト注入攻撃の作成を行うことで、ブラックボックス型の偵察主導型ペンテスティングを自動化するフレームワークである「Know Your Agent(KYA)」を導入するものである。

原著者: Or Zion Eliav, Eyal Lenga, Shir Bernstien, Yisroel Mirsky

公開日 2026-07-23
📖 1 分で読めます☕ さくっと読める

原著者: Or Zion Eliav, Eyal Lenga, Shir Bernstien, Yisroel Mirsky

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが単にあなたがコマンドを入力するのを待つのではなく、あなたに代わって自ら動き回る世界を想像してみてください。それはメールを読み、ウェブを検索し、コードを書き、さらには航空券を予約することさえできます。私たちはこれらを「AIエージェント」と呼んでいます。これらは、自ら計画を立て、行動することができる、非常にスマートなデジタルアシスタントのようなものです。しかし、ここが厄tricな部分です。これらのエージェントは、常に周囲の世界の情報を聞き取っています。もしあなたがエージェントにウェブページを読み取るよう頼んだとしたら、そのエージェントは、たとえ見知らぬ人が書いた部分であっても、そのページ上の「すべて」を読み取ります。これが独自のセキュリティ問題を生み出します。もし悪意のある人物が、一見普通に見えるウェブページやメールの中に、隠された巧妙な指示を忍び込ませていたらどうなるでしょうか。エージェントはそれを読み取り、それがあなたからの正当な命令であると誤認して、その悪意のある人物が望む通りに動いてしまうかもしれません。これは「間接的プロンプトインジェクション(Indirect Prompt Injection)」と呼ばれます。それは、まるで誰かがあなたの友人のランチボックスに、「私のランチをちょうだい」と書かれたメモを忍び込ませ、あなたの友人が礼儀正しさゆえに、そのメモがあなたからのものではないと気づかずにランチを渡してしまうようなものです。

大きな疑問は、研究者たちが投げかけている問いです。AIエージェントを現実世界に解き放つ前に、それらがこうした罠に陥らないことを確認するために、どのようにテストすべきか? 長い間、セキュリティの専門家たちは、エージェントが壊れることを期待して、ただランダムで混乱を招くような指示を投げつけることでテストしてきました。それは、城壁の弱点を見つけようとして、盲目的に岩を投げつけているようなものでした。しかし、ある新しい論文は、このアプローチには最も重要な要素である「偵察(reconnaissance)」が欠けていることを示唆しています。伝統的なセキュリティの世界では、テスターはただ岩を投げるのではありません。まず城を偵察します。開いている窓を探し、衛兵のスケジュールを確認し、レイアウトを学びます。この論文は、AIエージェントを真にテストするためには、私たちも同じことをする必要があると主張しています。つまり、「エージェントを知ること(Know Your Agent)」です。

著者たち(ベン・グリオン大学のチーム)は、KYA(Know Your Agent)と呼ばれる新しいフレームワークを紹介しています。彼らは、AIエージェントを壊す最善の方法は、盲目的に推測することではなく、まずそのエージェントについて知り得る限りのすべてを学ぶことだと主張しています。彼らは、AIエージェントには脆弱性を生む2つの主な「盲点」があることを発見しました。第一に、エージェントは「正しく見えるもの」(特定のフォーマットや、通常「これは安全な指示である」ことを意味する言葉など)を信頼してしまうことです。第二に、エージェントは「物語に適合するもの」(現在のタスクの最中に、一見自然に見える要求など)を信頼してしまうことです。

論文によれば、デジタル探偵のように振る舞うスマートで自動化されたシステムを使用することで、これまでの方法よりもはるかに効果的にこれらの盲点を突くことができるといいます。このシステムであるKYAは、単に攻撃するだけではありません。立ち止まって質問を投げかけ、エージェントの反応を観察し、そのツールやルールに関する詳細なプロフィールを構築します。例えば、「ああ、このエージェントは指示を区切るために特別な記号を使っているのだな」とか、「このエージェントは、現在のストーリーにそぐわないことを頼むと、警戒するのだな」といったことを学習します。こうした詳細を把握した上で、より説得力のあるトリックを仕掛けるのです。

研究者たちは、このアイデアをいくつかの異なるAIエージェントに対してテストし、彼らの「偵察主導型」の手法が驚くほど効果的であることを発見しました。シミュレーションにおいて、KYAは、単に推測しては試行錯誤を繰り返す従来の手法よりも、最大で67パーセントポイントも高い確率でエージェントへの侵入と攻撃に成功しました。彼らはさらに、OpenHandsという実世界のコーディングエージェントに対してもテストを行い、それが機能することを確認しました。論文は、もし私たちがAIエージェントを安全にしたいのであれば、それらを静的なターゲットとして扱うのをやめ、真にその防御をテストする前に、調査し、プロファイリングし、理解すべき複雑なシステムとして扱う必要があると結論付けています。それはもう、単に岩を投げつける時代ではありません。まずは城の秘密を学ぶことなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →