← 最新の論文
💻 computer science

Sleeper Channels and Provenance Gates: Persistent Prompt Injection in Always-on Autonomous AI Agents

本論文は、信頼できない入力が持続し、後に異なるインターフェースを介して実行される常時稼働型の自律型 AI エージェントにおける永続的なプロンプト注入脆弱性である「スリーパーチャネル」を導入し、標準的なアクションインスタンスダイジェストと所有者の証明を用いてそのような攻撃を防止する「プロベナナンスゲート」を中心とした階層的な防御策を提案し、静的監査ツールとランタイムアダプタによって支援するものである。

原著者: Narek Maloyan, Dmitry Namiot

公開日 2026-05-14
📖 1 分で読めます☕ さくっと読める

原著者: Narek Maloyan, Dmitry Namiot

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたのラップトップ上に常時稼働する非常に頼もしい個人アシスタントがいると想像してください。このアシスタントはメールを読み、カレンダーを管理し、コードを書き、さらにはあなたのために新しいツールをインストールすることさえできます。まるで、決して眠らない超優秀なインターンがいるようなものです。

論文「Sleeper Channels and Provenance Gates(スリーパーチャネルとプロベナンスゲート)」は、このアシスタントをハッキングする特定の、こっそりとした方法について警告しています。以下に、わかりやすく解説します。

1. 「スリーパーチャネル」攻撃:遅延型爆弾

通常、AI をハッキングするとは、誰かが今まさに奇妙な命令でそれをだますことを想像します。しかし、この論文が記述しているのは異なるものです:スリーパーチャネルです。

  • 仕掛け: 見知らぬ人物が公共のグループチャット(または見知らぬメール送信者)から、あなたのアシスタントに「後で役立つヒントを保存しておいて」と頼みます。アシスタントはそれが役立つものだと考え、それを保存します。
  • 休眠: 見知らぬ人物は姿を消します。アシスタントとは再び話しません。「ヒント」はアシスタントの記憶の中に静かに置かれ、無害に見えています。
  • 目覚め: 3 週間後、あなたはアシスタントに「ねえ、あの毎日行う健康チェックの設定を頼める?」と尋ねます。アシスタントは見知らぬ人物の「ヒント」を思い出し、それは良いアイデアだと考え、スケジュールされたタスクを設定します。
  • 爆発: そのタスクが自動的に実行され、あなたのプライベートなデータが見知らぬ人物の秘密のサーバーへ送信されます。

比喩: これは時間遅延式のわなのようなものです。攻撃者はあなたの庭に種(「ヒント」)を植えます。そして立ち去ります。その後、あなたが無邪気に庭に水をかけると、その種が芽を出し、あなたを傷つけるわなになります。攻撃者はわなが作動している瞬間にはいません。彼らは以前に仕掛けただけです。

2. なぜ現在の防御策が失敗するのか

この論文は、現在のセキュリティ対策は、入り口で ID を確認するだけのようなボーイのようなものだと説明しています。

  • もしあなたが見知らぬ人物と一緒に入室すれば、ボーイはその見知らぬ人物を確認します。
  • しかし、もし見知らぬ人物があなたの耳に秘密を囁き、その後あなたが単独で戻って頼み事をした場合、ボーイはあなたがその秘密を携えていることを知りません。
  • AI はあなたのリクエスト(「健康チェックを設定して」)を見て、「ああ、これは私のオーナーが頼んでいるんだ!」と考えます。その健康チェックというアイデア自体が見知らぬ人物から来たことを忘れているのです。

この論文はこれを**「混乱した副官(Confused Deputy)」**問題と呼んでいます。AI は副官であり、あなたが頼んだことを実行していますが、危険なアイデアを誰が思いついたのかについて混乱しているのです。

3. 解決策:「プロベナンスゲート」

これを修正するために、著者たちはプロベナンスゲートと呼ばれる新しいセキュリティシステムを提案しています。

比喩:「レシート」システム
AI が使用するすべての情報に、デジタルレシートが添付されていると想像してください。

  • もし AI が見知らぬ人物からのメールを読めば、そのメールには「出所:見知らぬ人物」と書かれたレシートが付けられます。
  • もし AI がそのメールに基づいてメモを書けば、そのメモはレシートを継承します。「出所:見知らぬ人物」。
  • もし AI が後ほどそのメモに基づいてスケジュールされたタスクを設定しようとした場合、システムはレシートを確認します。

門番(「プロベナンスゲート」):
AI が重要なこと(メールを送る、ファイルを変更する、スケジュールを設定するなど)を行うことを許可される前に、セキュリティゲートを通らなければなりません。

  1. レシートの確認: ゲートは、その決定を行うために AI が使用しているすべてのものの「レシート」を確認します。
  2. ルール: アイデアのどの部分が信頼できない出所(例えば、見知らぬ人物)から来たものであっても、ゲートは閉ざされます
  3. 例外: ゲートを開ける唯一の方法は、あなた(オーナー)が明示的に「はい、私はこの特定の行動を信頼します」と言うことです。ただし、それは一般的なアイデアに対して一度きり行うのではなく、その特定の行動に対してその都度行う必要があります。

4. 彼らが実際に行ったこと

著者たちは単に理論を書いただけではなく、それが機能することを証明するためにプロトタイプを構築しました。

  • テスト: 彼らは実際のオープンソース AI アシスタント(OpenClaw と呼ばれる)を手に取り、「スリーパーチャネル」攻撃をシミュレートしました。彼らは、新しいゲートがない場合、AI が喜んでデータを攻撃者に送信することを示しました。
  • 修正: 彼らは「プロベナンスゲート」(彼らはこれをD2と呼びます)をインストールしました。
  • 結果: AI が攻撃者のわなを設定しようとしたとき、ゲートはレシートを確認し、「見知らぬ人物」というタグを見つけ、その行動をブロックしました。攻撃は失敗しました。

5. 結論

この論文は、AI エージェントがより強力になり、「常時稼働」するようになるにつれて、彼らが何が安全かを記憶していると信じるだけでは不十分だと主張しています。AI が持つすべてのアイデアの履歴を追跡するシステムが必要です。

  • 旧来の方法: 「オーナーはこれを頼んだか?」(はい → 実行する)。
  • 新しい方法: 「オーナーはこれを頼んだか、かつ、その背後にあるアイデアの出所をオーナーが承認したか?」(アイデアが見知らぬ人物から来た場合 → 停止)。

著者たちはこれを「階層化された防御」と呼び、基本的なバージョンとより強力なバージョンを持っていることを意味していますが、核となる考え方はシンプルです:あなたからの新鮮で明示的な「OK」なしに、AI が見知らぬ人物から拾ったアイデアに基づいて行動することを許してはならない。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →