人工知能が単に質問に答えるだけでなく、航空券を予約したり、銀行口座を管理したり、デジタルツールを駆使して複雑なスケジュールを整理したりと、自ら行動を起こす世界を想像してみてください。これらは「エージェンティック(agentic)」なシステムと呼ばれ、ますます一般的になりつつあります。これらを構築するために、エンジニアはソフトウェア・フレームワーク、つまりAIの「脳」と外部の世界との間の仲介役として機能するツールキットに頼ることになります。これらのシステムを構築、あるいは監査する者にとって極めて重要な問いは、この仲介役の選択がセキュリティに影響を与えるのかどうかという点です。もしハッカーが悪意のあるコマンドでAIを欺こうとした場合、そのコマンドを届けるために使用される特定のツールキットによって、AIの反応は変わるのでしょうか?それとも、AIの安全性は、ソフトウェアのラッパー(包み材)に関わらず、ほぼ完全にモデル自体とその攻撃の性質によって決定されるのでしょうか?この問いは、理論ではなく確かなデータによってこの論争に決着をつけようとした、新しい大規模な調査の中核をなしています。
研究者たちは、9,360回もの個別の試行を含む大規模かつ制御された実験を行うことで、この検証に取り組みました。彼らは7種類の普及しているAIフレームワークを、AIへの直接接続と対決させ、フレームワークが違いをもたらすかどうかを確認するために8つの異なる条件を設定しました。公平なテストを期すため、彼らは主要なプロバイダー3社による6種類の異なるAIモデルを使用し、単純な欺瞞からシステムの目標を乗っ取ろうとする複雑な試みまで、5つの異なる系統の攻撃にさらしました。決定的なのは、チームは単に攻撃が同じ方法で届けられると仮定したのではなく、すべてのメッセージをバイト単位で検証し、AIの脳に到達する悪意のある内容がすべてのシナリオにおいて同一であることを確認した点です。このレベルの精密さにより、ソフトウェアが攻撃を誤って書き換えてしまったことによる混乱を排除し、フレームワークを唯一の変化する変数として孤立させることができました。
結果は驚くほど明白でした。フレームワークの選択が、AIが攻撃に屈するかどうかに与える影響はほとんどありませんでした。研究者たちは、攻撃の種類と使用される特定のAIモデルこそが支配的な要因であり、結果の差の大部分を説明していることを発見しました。対照的に、フレームワークの選択が結果に占める割合は、統計的にゼロと区別がつかないほど微小でした。これを確実にするため、チームは、いかなる差異も単に見えないだけでなく、実質的に存在しないことを証明するために設計された厳格な統計テストを適用しました。彼らは、大多数のケースにおいて、あるフレームワークを別のものに置き換えても、システムのセキュリティ態勢を意味のある形で変えることはないと確認しました。このことは、セキュリティチームが使用するソフトウェア・ツールキットについて心配するよりも、モデルとそのモデルが直面する具体的な脅威を理解することにエネルギーを集中させるべきであることを示唆しています。
しかし、この研究は注意深い検討を要する一つの特定のエラーを発見しました。一つのフレームワークであるCrewAIは、内部の指示が他のものと誤って異なっていたという既知のバグを修正した後でも、他のフレームワークよりもわずかにセキュリティが低い傾向があるという、小さくも統計的に実在する傾向を示しました。この残留した差異は絶対的な観点からは極めて小さく、実質的に無視できる範囲内にありましたが、集団の中で際立った唯一のフレームワークでした。また、研究者たちは、特定のトリッキーなプロンプトに直面した際、特定のAIモデルが内部的な思考に利用可能な計算リソースをすべて静かに消費し、一切の出力を生成しなくなるという、別の興味深い失敗モードも発見しました。これは異なるフレームワーク間で一貫して発生したため、それがソフトウェアのラッピングによるものではなく、モデル自体の特性であることを証明しました。
結局のところ、この研究は、実用的なエンジニアリングの問いに対して、稀有な高信頼度の回答を提供しています。それは、テストされた種類の攻撃やツールにおいて、AIエージェントのセキュリティはオーケストレーション・フレームワークによって意味のある形で形作られることはないということを示しています。本研究は、「仲介役」となるソフトウェアはセキュリティリスクに対して概して透明であり、AI自身の挙動と攻撃の性質こそが安全性の真の推進力であることを裏付けています。一つのフレームワークが極めて小さな持続的な癖を示したものの、全体像は安定しています。すなわち、フレームワークの選択は主要なセキュリティ上の決定事項ではないということです。むしろ、これらのエージェントの安全性を確保するための真の作業は、それらが実行するモデルと、それらが操作され得る具体的な方法を理解することにあります。この結論は、開発者と監査者の双方に明確な進むべき道を示しています。
技術要約: AgentPort-Bench
問題提起
本論文は、エージェンティックAIのセキュリティにおける極めて重要な問いに取り組んでいる。すなわち、「オーケストレーション・フレームワーク(例:LangChain、CrewAI、AutoGen)の選択は、基礎となるモデルや特定の攻撃とは独立して、ツールを使用する大規模言語モデル(LLM)エージェントのセキュリティ態勢を意味のある形で左右するのか?」という問いである。既存のAgentDojoのようなベンチマークは、単一のフレームワーク内での堅牢性を測定しているが、フレームワーク自体を変数として分離できていない。先行するクロスフレームワーク比較(NguyenおよびHusainなど)は、攻撃ペイロードが異なるアダプター層を通じて同一に配信されていることを検証できていないことが多く、観察されたセキュリティの差異が、真のフレームワークレベルの効果ではなく、プロンプト・テンプレートの違いによるアーティファクトである可能性を残している。
メソドロジー
本研究、AgentPort-Benchは、フレームワーク変数を分離するために、制御された統一的な評価設計を採用している。
- 実験範囲: 評価は、7つのエージェンティック・オーケストレーション・フレームワーク(LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google Agent Development Kit、Semantic Kernel)と、直接APIベースラインを合わせ、計8つの実行条件に及ぶ。
- モデルと攻撃: 3つのプロバイダー(Anthropic、OpenAI、Google)にわたる6つのモデル(安価なティアとフロンティアティアの2段階)を対象とし、OWASP Agentic Security Initiative (ASI) の脅威タクソノミーにマッピングされた5つの攻撃ファミリーに対してテストを行う。
- データ収集: データセットは、2ラウンドにわたって収集された9,360回の試行で構成される。第1ラウンド(7,020試行、5フレームワーク)と、拡張ラウンド(2,340試行、追加の2フレームワーク)である。
- ペイロード同一性検証: 本手法の核心的な革新は、バイト単位のペイロード検証である。システムは、モデルAPIに送信された正確な内容をログに記録し、標準的な攻撃ペイロードと照合(diff)する。いかなる相違(例:システムプロンプトの言い換え、指示の追加)も、フレームワークの特性ではなく、修正すべきアダプターの欠陥として扱う。
- 統計的分析: 以下の組み合わせによる統一的な統計処理を導入している:
- 古典的な分散分解: バランスの取れたサブセットに対するANOVA(分散分析)および置換テスト。
- 混合効果モデル: 反復測定と順序変数(PASS/UNCERTAIN/FAIL/VULNERABLE)を考慮するため、フルデータセットに適用される順序ロジスティック回帰および線形混合効果モデル(ランダムなプロンプト切片を含む)。
- 等価性検定: フレームワークの効果が、単にゼロと統計的に区別できないだけでなく、実質的に無視できる(Cohenの d = 0.2で定義される小さな効果量内にある)ことを判断するための、事前指定された一側検定(TOST)。
主な貢献
- 最大規模の制御されたクロスフレームワーク評価: 本論文は、9,360回の試行を7つのフレームワーク、6つのモデル、5つの攻撃ファミリーに統合した、同種の中で最大規模の制御された比較を提示している。
- 前提条件としてのペイロード同一性検証: 本研究は、バイトレベルのペイロード検証の必要性を実証している。この手法により、CrewAIにおける実在のアダプター欠陥(デフォルトのエージェント構築が、「safely」という単語を含む、より長いペルソナを用いた相違するシステムプロンプトを使用しており、結果にバイアスを与えていたこと)を検出し、修正することができた。修正後、1,170回の試行が再収集された。
- 高度な統計的枠組み: 本研究は、この領域において混合効果モデルと形式的な等価性検定を初めて適用した。これにより、著者は「帰無仮説を棄却できない」という段階を超え、フレームワークの効果が実質的に無視できると積極的に主張することが可能となった。
- 精密に特定された例外: 本論文は、アダプターの欠陥を修正した後でも、非PASSの結果においてCrewAIに統計的に有意な残差の上昇があることを特定している。この効果は小さく、全条件で一様であり、新しいフレームワークの追加による相互作用は見られない。
- 非セキュリティ系失敗モードの発見: 特定の敵対的プロンプトに対し、フロンティアモデルである
gpt-5.5 における決定論的な推論トークン枯渇失敗(不可視の推論に全トークン予算を消費してしまう現象)と、Google ADKとSemantic Kernelの間でのトークン計上単位の不一致(修正しない限り、誤ったコスト比較につながるもの)を明らかにした。
結果
- 分散の帰属: 古典的なANOVA(バランスの取れたサブセット)において、攻撃ファミリーが結果の分散の最大のシェア(28.0–28.7%)を説明し、次いでモデルの選択(4.1%)であった。フレームワークの選択が説明するシェアはゼロと区別がつかない(0.05%)であった。
- 等価性検定: 8つの実行条件間の28組の全ペア比較は、事前に指定された小さな効果量の範囲内に収まっている。これは、この脅威モデルにおけるセキュリティ結果に関して、フレームワークの選択が実質的に無視できるという主張を支持している。
- CrewAIの残差: 集計されたフレームワークの効果は無視できるものの、CrewAIは特定の例外として残っている。アダプターの欠陥を修正した後でも、他のすべての条件と比較して、非PASSの結果において統計的に有意にわずかな上昇を維持している。しかし、この効果は等価性の範囲内に留まるほど小さい。
- 失敗モード:
gpt-5.5 モデルは、新たに追加されたフレームワークの両方において、特定のプロンプトに対して100%の失敗率(推論トークンの枯渇)を示した。これは、フレームワークの実装上の欠陥ではなく、モデル固有の脆弱性であることを示唆している。
意義と主張
本論文は、評価された特定の脅威モデル、モデル、およびフレームワークにおいて、ペイロードの配信が検証・制御されている限り、エージェンティックなセキュリティ態勢は、オーケストレーション・フレームワークの選択によって意味のある形で決定されることはないと主張している。
- 実務的な示唆: ツールを使用するLLMエージェントのセキュリティ評価および緩和策は、フレームワークの選択ではなく、攻撃カテゴリの網羅性およびモデルレベルの挙動に向けられるべきである。
- フレームワークに関するニュアメント: 集計された効果は無視できるものの、本論文は、他のフレームワークと比較して(ロールプレイング・テンプレートによるシステムプロンプトの配信方法の構造的な違いに起因する可能性がある)特有の残差効果を持つCrewAIに対して、特段の注意が必要であることを強調している。
- 方法論的厳密性: 本研究は、バイトレベルのペイロード検証なしには、クロスフレームワークのセキュリティに関する主張がアダプターレベルのアーティファクトによって混同されることを確立した。また、単に有意なp値に依存するのではなく、実質的な無視可能性を証明するために、形式的な等価性検定が必要であることを実証した。
著者は、これらの知見が、実行時のツール呼び出しを行わない設計の下での、評価された特定の8つの条件と5つの攻撃ファミリーに適用されるものであり、あらゆる可能なオーケストレーション設計やデプロイメントシナリオに対する一般的な主張ではないことを述べ、その範囲を限定している。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録