← 最新の論文
🤖 machine learning

Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security

本論文は、「Adaptive Adversaries」というマルチターンかつマルチLLMのベンチマークを紹介するものであり、これは、適応的かつマルチラウンドの戦略を活用する自律的な攻撃者が、メモリレスなLLM防御策に対して、静的なシングルターン評価と比較して攻撃成功率を大幅に向上させることを実証するとともに、最先端モデル間で明確かつシナリオ依存的な脆弱性を明らかにしている。

原著者: Devina Jain, David Hartmann, Chuan Li

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Devina Jain, David Hartmann, Chuan Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、銀行口座の管理やプライベートな日記の読み取りといった、最も機密性の高いタスクを任せるために、ロボット執事を雇うことを想像してみてください。あなたは、そのロボットがあなたのルールに従うほど賢く、かつ、誰かに騙そうとしてもそれを無視できるほどタフであることを望んでいます。人工知能の世界では、これらのロボットは「LLMエージェント」と呼ばれています。これらは、読み書きができ、さらには他のコンピュータプログラムさえも使える、超スマートなアシスタントのような存在です。しかし、落とし穴があります。これらのアシスタントは、騙される可能性があるのです。まるで人間が口の上手い見知らぬ人に騙されるように、AIも「プロンプト・インジェクション」として知られる、隠された指示を忍び込ませる手法によって操作されることがあります。

長い間、科学者たちは、あらかじめ用意された単一の鍵を使って、新しい錠前をピッキングしようとするセキュリティガードのように、「静的(スタティック)」な方法でAIをテストしてきました。彼らはその一つの鍵を試し、それが機能するかどうかを確認して、そのまま次に進みます。問題は、現実世界のハッカーは単一の鍵を使うのではなく、ガードの動きを観察し、異なる角度を試し、侵入する方法を見つけるまで試行錯誤を繰り返すということです。この論文は、AIを単一の既製の鍵でテストすることは不十分であると主張しています。AIが本当に安全かどうかを知るためには、AIのあらゆる動きを観察し、ラウンドごとに戦略を即座に変更する、巧妙で適応的な攻撃者にどう対処するかを見る必要があるのです。

研究者たちは、このテストを行うための全く新しい「セキュリティ・アリーナ」を構築しました。単一の鍵を用いる代わりに、彼らはAI攻撃者がAI防御側と対峙する15ラウンドの会話シナリオを作成しました。攻撃者は、防御側の過去の回答を見て、その情報を使って方針転換したり新しいトリックを試したりすることができる、執念深い探偵のような存在です。しかし、防御側は「メモリレス(記憶を持たない)」であり、これは、たとえ過去14ラウンドがあったとしても、新しいメッセージをあたかも初めて見たかのように扱うことを意味します。この設定は、ハッカーが捕まるのを避けるために毎回新しいチャットウィンドウを開くという現実世界の状況を模倣しており、一方でハッカー自身は、あらゆる試行から学習していきます。

チームはこのアリーナを、現在利用可能な最もスマートなAIモデルの3つ(Claude Opus 4.6、GPT-5.4、Gemini 2.5 Pro)を、攻撃者としても防御者としても用いて実行しました。彼らは驚くべき発見をしました。もし会話の最初のラウンドだけを見るならば、AI防御側はほぼ完璧に見え、攻撃者の成功率はほぼ0%になります。しかし、攻撃者が適応して学習するために15ラウンドすべてを使用できるようになると、成功率はモデルに応じて5.4%から14.0%へと大幅に上昇します。これは、多くのAI安全性テストが、ゲームを早く終わらせすぎてしまうために、最大の脅威を見逃している可能性を示唆しています。

もう一つの大きな発見は、あらゆる面において「最高」である単一のAIモデルは存在しないということです。研究者が総合スコアを見たとき、上位2つのモデルであるOpusとGPT-5.4は互角のようです。しかし、特定のシナリオごとに分解してみると、彼らの弱点は完全に異なっていました。例えば、「コードパーサーのデバッグをしている」と偽ってパスワードを暴露させようとする「メモリリーク」のシナリオでは、Opusは60%の確率で失敗しましたが、GPT-5.4とGeminiは堅守しました。逆に、決定を変更するために「公式」な権限通知を偽装するシナリオでは、Geminiは53%の確率で失敗しましたが、他のモデルは揺らぎませんでした。これは、単一の「最も安全な」モデルに頼ることは間違いであり、モデルごとに異なる盲点があることを意味しています。

また、この研究は、単一のタイプの攻撃者を用いるだけでは不十分であることも示しました。3つのトップティアのAI攻撃者を統合することで、研究者たちは、単独の攻撃者が自力で見つけられる数よりも、1.4倍から2.2倍多い独自の成功した攻撃を明らかにしました。これは、異なる専門分野を持つ3人の異なる探偵がいるようなもので、一人が他の人が見逃した手がかりを見つけるかもしれません。さらに、これらのAIが生成した攻撃は、従来の事前作成された攻撃とは大きく異なり、以前のテストで見られた攻撃との類似性はほとんどありませんでした。これは、静的な攻撃リストが時代遅れになりつつあることを証明しています。

要約すると、この論文は、AIの安全性を真に理解するためには、静的な一度限りのテストではなく、攻撃者が学習し適応する動的なマルチラウンドのシミュレーションが必要であると示唆しています。結果は、現在のAIモデルは進化しているものの、持続的で巧妙な圧力の下でのみ表面化する、特定の隠れた脆弱性が依然として存在することを示しています。研究者たちは、この「アリーナ」全体(シナリオや数千回の戦闘データを含む)を公開しており、他の人々がこのデジタル執士をテストし改善し続け、彼らが単に安全に見えるだけでなく、実際に安全であることを保証できるようにしています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →