← 最新の論文
💬 NLP

SlotGuard: Stop Oversharing Private Local Context in LLM Agent Transcri

SlotGuardは、機密データをセッショングラフを介して連結されたフォーマット保持型の合成スロットへと書き換えることで、既存のマスキング手法の脆弱性を排除しつつ、LLMエージェントによるプライベートなコンテキストや認証情報の漏洩を安全に防止する、ローカルなトランスクリプト境界システムである。

原著者: Haocheng Xia, Yongjoo Park

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Haocheng Xia, Yongjoo Park

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたのコンピューター上のファイルを読み、メールを送り、コードを実行し、さらには他のソフトウェアと対話することさえできる、あらゆることをこなせる超スマートなロボットアシスタントがいるとします。これらの仕事を行うために、ロボットはあなたのファイルパスやメールアドレス、さらには秘密のパスワードといったプライベートな情報を見る必要があります。しかし、ここに落とし穴があります。次に何をすべきかを判断するために、ロボットはしばしば、テック企業が所有する巨大なクラウドベースの「脳」(大規模言語モデル)に、自身の作業の要約を送らなければなりません。この要約は「トランスクリプト(記録)」と呼ばれます。

問題は、このトランスクリプトが、まるで他人に日記の内容を送りつけるようなものだということです。もしロボットが誤ってあなたの秘密のパスワードや自宅の住所をその日記に書き込んでしまったら、クラウド企業はそれを見たり、保存したり、あるいは将来のロボットの学習に使用したりする可能性があります。それは、ケーキを焼くのを手伝ってほしいと友人に頼むのに、キッチンの写真を送らなければならないようなものです。ただし、その写真の中に、小麦粉のすぐ横に家の鍵が置かれているとしたらどうでしょう。あなたは、友人にキキングの混ぜ方を教えてもらうためにキッチンを見せたいのですが、家の鍵までは絶対に見られたくないはずです。この論文は、あなたのプライベートな世界をロボットに見せつつ、クラウドの脳にあなたの秘密を覗かせないようにするための、トリッキーな問いに取り組んでいます。

そこで登場するのが、あなたのコンピューター内に「プライバシーの門番」として機能するように設計された、巧妙な新システム、SlotGuardです。SlotGuardを、あなたのロボットアシスタントとクラウドの脳の間に座る、魔法の翻訳機だと考えてください。その役割は、トランスクリプトがあなたの家を出る前に、ロボットの日記を書き換えることです。ロボットが実際の秘密のパスワード(例:SuperSecret123!)をそのまま書き込む代わりに、SlotGuardはそれを、見た目は完璧に似ているけれど偽物のプレースホルダー(例:🔑-SYNTHETIC-KEY-99)へと入れ替えます。

ここで行われるのは、魔法のトリックです。この偽のプレースホルダーは、クラウドの脳にとって、本物と全く同じように見え、感じられます。もし本当のパスワードが長い英数字の羅列であれば、偽物もまた長い英数字の羅列になります。もし本当のファイルパスが /Users/Alice/Secrets/Plan.pdf であれば、偽のパスは [REPO_ROOT_1]/Secrets/Plan.pdf のようになるかもしれません。クラウドの脳は依然としてその構造を読み取ることができます。つまり、それがファイルであることを知り、それが秘密であることを知り、それについて話す方法を知っていますが、実際の秘密が何であるかは全く分かりません。それは、宝物が正確な座標ではなく、一般的な「X」印で示された地図をクラウドの脳に渡すようなものです。

しかし、魔法はそれだけではありません。クラウドの脳が「そのファイルを開け」といった指示を返してきたとき、SlotGuardはメッセージがあなたのロボットに届くにそれをキャッチします。SlotGuardは自身の秘密のリストを確認し、[REPO_ROOT_1] が実際には /Users/Alice/Secrets/Plan.pdf を意味することを理解し、信頼できるあなたのコンピューター内のみで、偽物を本物へと書き戻します。その後、ロボットは本物のファイルを開きます。そして、クラウドの脳は、本当の名前が存在したことすら知り得ません。

研究者たちは、このシステムを使って本格的な宿題を行いました。彼らは、ロボットがプライベートな文書を読んだり、秘密の鍵を使用したりといった、機密データに関わるタスクを実行する、数千の偽のシナリオを作成しました。その結果、SlotGuardがなければ、ロボットはほぼすべて(100%の確率で)情報を漏洩させてしまうことが分かりました。単なる「伏せ字(Redaction)」の手法(単に秘密を [PASSWORD] といった言葉に置き換える方法)でさえも、惨憺たる結果でした。ロボットが詳細な情報を失ったことで混乱し、タスクの成功率が97.5%も低下してしまったからです。

しかし、SlotGuardはゲームチェンジャーでした。スマートな追跡グラフを含むフルバージョンのシステムは、仕掛けられたすべての認証情報の隠蔽に成功し、すべての認証情報の漏洩を阻止しました(漏洩率0.0%)。パスやメールなどの構造化データについては、可視化された機密文字を100%除去しました(ただし、ルート所有の絶対パスに関する特定の例外ケースが現在のプロトタイプにおける軽微な課題として残っています)。さらに優れたことに、SlotGuardはロボットの脳を壊しませんでした。SlotGuardを使用しているロボットは、あたかも本物の秘密を見ていたかのように高い成功率を維持し、さまざまなモデルにおいて非常に高い性能を発揮しました。このシステムは非常に高速で、会話の1ターンを書き換えるのに、瞬きする間もない時間(約14マイクロ秒)しかかからず、動作を遅延させることもありません。

また、この論文はSlotGuardが「できないこと」についても指摘しています。これは読心術の盾ではありません。もしクラウドの脳が、会話の文脈からあなたの秘密を推測できるほど賢ければ、SlotGuardでも止めることはできません。また、あなたのコンピューター自体がすでにハッキングされている場合には、あなたを守ることはできません。しかし、あなたのプライベートなデータをクラウドのトランスクリプトに漏洩させないという特定の目的においては、SlotGuardは、ロボットに仕事をさせつつ、あなたの秘密を守り抜く、堅牢で高速かつスマートな解決策を提供します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →