← 最新の論文
🤖 AI

SecureClaw: Clawing Back Control of LLM Agents

SecureClawは、読み取り操作のための信頼されたゲートウェイの強制、および書き込み操作のためのPREVIEW-to-COMMITプロトコルの強制を通じて、不正な外部アクションと機密データの露出を防ぐ、ツールを使用するLLMエージェントのための二重境界セキュリティアーキテクチャであり、タスクの有用性を維持しながら、複数のベンチマークにおいてほぼゼロに近い攻撃成功率を達成している。

原著者: Yuhan Ma, Stefan Schmid

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Yuhan Ma, Stefan Schmid

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いが信頼できないパーソナルアシスタント(LLMエージェント)を、支払いやプライベートなメールの閲覧、カレンダー管理といった機密性の高いタスクを任せるために雇ったと想像してください。

問題は、このアシスタントが少々制御不能な「暴れん坊」であることです。もし彼らに銀行口座番号が書かれた書類を渡すと、彼らはうっかり(あるいは悪意を持って)、その番号を通りすがりの見知らぬ人に読み上げてしまったり、メールの中に隠されたメモに騙されて、詐欺師にお金を送ってしまうかもしれません。

従来のセキュリティガードは、アシスタントが「悪いことをすること」(お金を送ることなど)を阻止しようとしますが、多くの場合、アシスタントがそもそも秘密を「見ること」自体を防ぐことには失敗します。一度アシスタントが秘密を見てしまうと、ガードが阻止する前に、他のプログラムにその内容をささやいたり、自分のメモに書き留めたりできてしまうからです。

SecureClawは、これら両方の問題を同時に解決するために設計された新しいセキュリティシステムです。これは、「見る」ことと「行う」ことを別々の仕事として扱い、それぞれに異なる鍵をかけます。

仕組みは、以下のシンプルな比喩を使って説明します。

SecureClawの二つの鍵

1. 読むための「目隠し」(ゲートウェイ)

アシスタントが、支払額を知るために秘密の請求書を見る必要がある場面を想像してください。

  • 従来の方法: あなたはアシスタントに実際の紙の請求書を手渡します。彼らは数字を読み、書き写し、あるいは聞き耳を立てているハッカーにその数字を読み上げることもできます。
  • SecureClawの方法: あなたは彼らに紙の請求書を渡す代わりに、「謎の箱」(不透明なハンドル)と、「簡略化された小さなメモ」(境界付きの要約)を渡します。
    • メモにはこう書かれています:「ベンダーAからの請求書、金額4,200ドル、期限は金曜日」
    • 謎の箱は、セキュアな保管庫だけが解読できるコードになっています。
    • アシスタントはこのメモとコードを使って作業の計画を立てることができますが、謎の箱を開けて実際の請求書の詳細を見ることはできません。実際の数字を見ることができないため、それをコピーすることも不可能です。

2. 行うための「ダブルチェック」(エグゼキューター)

次に、アシスタントがその請求書を支払うためにメールを送ろうとしている場面を想像してください。

  • 従来の方法: アシスタントはメールを書き、「送信」ボタンを押します。もしハッカーがアシスタントを騙して、宛先を詐欺師のメールアドレスに変更させていた場合、お金は詐欺師へと送られてしまいます。
  • SecureClawの方法: アシスタントができるのは、メールを**「提案」**することだけです。彼らはドラフトを作成し、「これを送りたい」と言います。
    • 信頼できるガード(エグゼキューター)がそのドラフトを拾い上げます。
    • ガードはこうチェックします:「あなたはこれを送るよう頼みましたか? 宛先は正しいですか? 金額は合っていますか?」
    • 決定的なことに、ガードは承認された当初の内容と一致する、改ざん不可能な受領証と照らし合わせて、詳細が正確かどうかを確認します。
    • もしアシスタントが、承認を得た後にこっそりメールアドレスを詐欺師のものに変更しようとしたとしても、ガードはその不一致を見つけ出し、メールをブロックします。実際に「送信」を押す権限はガードだけが持っています。

なぜこれが重要なのか

この論文では、攻撃者がエージェントを騙してデータを盗んだり、間違った相手にお金を送らせようとしたりする3つの「ハッキング・プレイグラウンド」(AgentDojo、AgentLeak、ASB)に対して、このシステムをテストしました。

  • 結果: SecureClawは、不正な送金(攻撃成功率0%)を**100%**阻止し、機密データの漏洩をほぼゼロに抑えることに成功した唯一のシステムでした。
  • 秘訣: この論文は、単一の鍵では不十分であることを証明しています。
    • もし「ダブルチェック」(送信の阻止)だけを行った場合、アシスタントは依然として秘密を読み取り、内部メモを通じて漏洩させることができます。
    • もし「目隠し」(秘密を隠すこと)だけを行った場合、アシスタントはそもそも秘密を知らないために、間違った相手にメッセージを送るよう騙される可能性があります。
    • SecureClawはこの両方を使用しています。 秘密をアシスタントから隠すと同時に、アシスタントが信頼できる最終チェックなしにアクションを実行できないようにしています。

「ノー」と言われたときはどうなるのか?

時には、リクエストが怪しいと判断されてブロックされることがあります。以前のシステムでは、これは単にワークフロー全体を停止させてしまい、ユーザーを困惑させていました。しかし、SecureClawには**「安全なリカバリ(復旧)」**機能があります。

ガードがリクエストをブロックした場合、単に「エラー」と表示するのではなく、アシスタントに対して、安全で事前に承認された再試行ルートを提供します。

  • 例: 「その見知らぬ人へのメールは送れません。しかし、あなたがまず確認するためのドラフトを作成することは可能です。」
  • これにより、セキュリティ基準を下げることなく、作業を継続させることができます。

まとめ

SecureClolaは、日記を読むときは目隠しをし(秘密を暗記させないため)、車の鍵は自分で握っている(地図を確認せずに危険な場所へあなたを連れて行けないようにするため)ボディガードを雇うようなものです。**「計画する能力」「実行する能力」**を分離することで、たとえアシスタントが騙されたとしても、被害を最小限に抑えることができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →