When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents
本論文は、LLM駆動型のエンボディード・エージェントが知覚する環境状態情報の操作を通じて、タスクの理解、計画、および実行を汚染し、それによってロボットシステムの安全性と信頼性を損なう新たな攻撃対象領域である「ステート・セマンティック・インジェクション(State-Semantic Injection)」を導入するものである。
原著者: Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu
原著者: Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
テクニカルサマリー:状態が攻撃対象(アタックサーフェス)となる時:LLM駆動型エンボディドエージェントにおける状態セマンティック・インジェクション
1. 問題の定義
本論文は、LLM(大規模言語モデル)駆動型のエンボディドエージェント(身体性を持つエージェント)における重大なセキュリティ上のギャップに対処している。先行研究では、敵対的な情報が感覚チャネルやミドルウェアチャネル(例:RIPA)を通じてLLML制御のロボットに到達し得ることが確立されているが、これとは補完的なダウンストリームの問いが残されている。すなわち、**「侵害された状態生成器(state producer)が、スキーマを維持したまま破損した記録をプランナーに送り込んだ場合、その偽の証拠が有効なプランニング入力として採用され、標的とした物理的な結果として実現されるか?」**という問いである。
従来のプロンプト・インジェクションが明示的なコマンドを挿入するものであるのに対し、本研究では**「状態セマンティック・インジェクション(State-Semantic Injection)」**を調査している。核心となる課題は、エンボディドエージェントは、デジタルエージェントとは異なり、厳格な制約(エンティティの存在、空間的な到達可能性、アフォーダンス、およびアクションの前提条件)を満たさなければならない点にある。したがって、攻撃を成功させるには、単にLLMを欺くだけでなく、その結果として生成される計画が物理環境またはシミュレーション環境内で実行可能である必要がある。著者らは、ユーザーの指示、プランナーのコード、およびエグゼキュータ(実行器)は信頼され変更されない一方で、単一のプランナー向け状態生成器が侵害されているという脅威モデルを定義している。
2. メソドロジー:ESTI および ESTI-Bench
脅威モデル
著者らは、コンポーネント限定、述語ローカル、かつ非適応的な敵対者を提案している:
- 範囲: 敵対者は、正確に一つの状態生成コンポーネント(例:セマンティックマップ・アダプターや状態キャッシュ・プロバイダー)を侵害する。
- 能力: 攻撃者は、そのコンポーネントが発行する権限を持つレコードのみを書き換えることができる。ユーザーの指示、隠されたシステムプロンプト、または生のセンサーデータを変更することはできない。
- 制約: 攻撃はネイティブなスキーマ、フィールド名、およびレコード数を維持しなければならない。新しいレコードを追加したり、明示的な競合命令を挿入したりすることはできない。敵対的な目標はエピソード開始前に固定されており、攻撃者がプランナーの出力に応じて適応することはない。
ESTI 攻撃メカニズム
**環境状態テキスト・インジェクション(ESTI)**は、既存の相互作用可能なオブジェクト、関係、アフォーダンス、タスク段階の制約、または実行フィードバックにわたる、あらかじめ選択された敵対的な目標を、偽の状態証拠としてエンコードする。この手法は以下の3段階で動作する:
- 目標の正規化と実行時の再接地(Re-grounding): 敵対的な目標は検証可能な述語へとマッピングされる。極めて重要な点は、偽の状態が現在のシーンに接地(グラウンディング)されることを確実にするため、システムが検証済みのエンティティを現在の識別子に解決し、書き換えの直前にアフォーダンスのチェックを更新することである。
- 状態セマンティックの構築: 目標は、新しいコマンドとしてではなく、既存の状態レコード内の値(例:オブジェクトの属性を「パン」から「トマト」へ、あるいは空間的関係を「テーブルの上」から「床の上」へ変更する)として表現される。
- クローズドループ・インジェクション: 書き換えられた状態がプランナー可視のインターフェースに注入される。その後、システムはプランナーがこの証拠を採用するかどうか、およびエグゼキュータが標的とした最終状態を実現するかどうかを評価する。
評価フレームワーク:ESTI-Bench
著者らは、以下の3つの環境にわたるプランニング・実行のクローズドループ評価フレームワークであるESTI-Benchを構築している:
- ProgPrompt / VirtualHome: プログラマティックなプランニング。
- VoxPoser / RLBench: 連続空間における操作。
- AI2-THOR / iTHOR: インタラクティブな屋内実行。
このベンチマークは、2つの指標を区別している:
- プランニング攻撃成功率(P-ASR): 生成された計画が敵対的な目的を充足しているかどうか。
- 実行攻撃成功率(E-ASR): 対応する観測可能な偏差が実行後に実現されているかどうか。
- データセットレベルのグラウンダビリティ(Groundability): 敵対的な述語が既存のエンティティおよびアフォーダンスを用いて物理的にインスタンス化可能であることを保証する事前評価フィルタ。これはすべてのベースラインとアブレーションに共通する条件であり、実行時のオラクルではない。
3. 主な貢献
- ダウンストリームの完全性の分離: 本論文は、プランナー可視のセマンティック状態境界におけるダウンストリームの完全性の問題を分離している。破損した状態の証拠が一度露出されたとき、それがグラウンディングおよび実行の制約を越えて、アップストリームの攻撃伝達とは異なる、標的とした最終的な結果を生じさせ得るかを研究している。
- 形式化された脅威モデル: コンポーネント限定でスキーマを維持する脅威モデル。ここでは、敵対的な目的は固定されており、攻撃者は許可された単一の侵害コンポーネントに関連するタスク関連レコードのみを書き換えることができる。
- 表現互換性を備えた構築: 元のユーザー指示およびエグゼキュータを維持しながら、状態の担い手(オブジェクト、関係、アフォーダンス)のセマンティックな役割に一致する偽の証拠を構築する手法。
- ESTI-Bench フレームワーク: プランニングレベルでの採用と実行レベルでの実現の間のギャップを明示的に測定するフレームワークであり、プランナーが欺かれたことと、物理的な攻撃が成功したことを区別する。
- 体系的な評価: 多様なエンボディド・システム(ProgPrompt, VoxPosel, AI2-THOR)および複数のLLM(DeepSeek-V4-Pro, GPT-5.6-luna, Qwen-3.6-Plus)にわたる包括的な評価、および実機ロボットによる概念実証。
4. 実験結果
ベースラインとの性能比較
ESTIは、プランニングおよび実行の成功率の両方において、既存のベースライン(Vanilla IPI, EIRAD, BADROBOTのバリアント)を大幅に上回っている:
- プランニング成功: ESTIは、最強のベースラインであるVanilla IPIの80.49%に対し、平均99.12%のP-ASR(DeepSeek-V4-Pro)を達成した。ProgPromptやAI2-THORなどの特定の環境では、ESTIは100.00%のP-ASRに達している。
- 実行成功: ESTIは平均45.75%のE-ASRを達成し、ベースラインを11.13パーセントポイント上回った。
- 比較: Vanilla IPIは高いプランニング成功率(例:AI2-THORで88.46%)を示すが、実行成功率は著しく低下(37.50%)しており、これはコマンド型のインジェクションが実行制約に失敗する計画を生み出しやすいことを示唆している。ESTIの状態セマンティック・アプローチは、より高い実行忠実度を維持している。
プランニングと実行のギャップ
結果は、P-ASRとE-ASRの間の顕著なギャップ(例:ProgPromptにおける100% vs 47.06%)を浮き彫りにしている。このギャップは、プランナーの欺瞞から実行の実現への**転送損失(transfer loss)**を特徴づけている。これは、プランナーが正常に欺かれたとしても、物理的制約(到達可能性、アフォーダンス、アクション・プリミティブ)によって攻撃の実現が阻止されることが多いことを示している。
アブレーション研究
- キャリアの互換性と一貫性: キャリアの互換性(誤ったフィールドタイプへの書き込み)を除去すると、P-ASRは87.50ポイント(100%から12.50%へ)減少する。表現レベルの一貫性を除去すると、P-ASRは62.50ポイント減少する。これにより、状態の担い手のセマンティックな役割に一致させることが、プランニング採用の主要な要因であることが確認された。
- 実行時の再接地(Runtime Re-grounding): 実行時の再接地(データセットで検証されたバインディングを更新せずに再利用すること)を除去しても、P-ASRの変化はわずか1.92ポイント、E-ASRの変化は3.85ポイントであった。これは、静的なタスクにおいてはデータセットレベルのグラウンダビリティが支配的な要因であり、実行時の更新による増分的なメリットは限定的であることを示唆している。
- モデルの感度: 異なるLLMは状態操作に対して異なる感度を示す(例:GPT-5.6-lunaはAI2-THORにおいて低いP-ASRを示す)が、ESTIはすべてのモデルにおいて一貫してベースラインを上回っている。
実機ロボットによる概念実証
実機のロボット実験において、ESTIはユーザーの指示が変わらないにもかかわらず、ヒューマノイドロボットをあらかじめ定義されたルートから逸脱させ、コンピュータの方へ移動させることに成功した。これは、状態セマンティックの操作がプランナーから観測可能な物理的偏差へと伝播し得ることを裏付けている。
5. 意義と主張
本論文は、**「プランナーの採用だけでは、エンボディド攻撃の成功を特徴づけるには不十分である」**と主張している。LLM駆動型ロボットのセキュリティ境界は、プロンプト・インジェクションを超えて、状態表現自体の完全性にまで及んでいる。
- 条件的帰結: 結果は、**「状態の伝達が成功したことを条件とした」**ダウンストリームの帰結を特徴づけている。著者らは、状態生成器への書き込み権限を得る確率を推定しているわけではなく、また、プランニングの逸脱を実行上の物理的攻撃の成功と同一視しているわけでもないことを明示している。
- 補完性: ESTIは、アップストリームの脅威研究(RIPAなど)を補完するものである。RIPAがどのように敵対的な情報がシステムに入るかを示すのに対し、ESTIはその情報が一度届けられた後に何が起こるかを示す。つまり、もし状態表現が侵害された場合、プランナーは実行可能かつ有害な計画を生成するように欺かれ得るのである。
- 限定的な範囲: 著者らは、アブレーション研究が一般的なグラウンディングの主張よりも狭い結論を支持していることを強調している。データセットレベルのグラウンダビリティが固定されている条件下では、キャリアの互換性と表現レベルの一貫性こそが、プランニング採用の決定的な要因である。彼らは、アップストリームの伝達問題や、エンドツーエンドの知覚侵害メカニズムを提供することを目的としているのではない。
要約すれば、本論文は、環境のセマンティックおよび構造的制約を尊重する限り、スキーマを維持した偽の証拠が標的とした物理的結果をもたらし得る、という「状態インターフェース」がエンボディドエージェントにとって有効な攻撃対象(アタックサーフェス)であることを立証している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。