When Alignment Isn't Enough: Response-Path Attacks on LLM Agents
本論文は、BYOK(Bring-Your-Own-Key)エージェントアーキテクチャにおける悪意あるサードパーティ中継が、生成後の応答を改ざんすることで LLM のアライメントを回避し、既存の防御策では完全に緩和できない高い攻撃成功率を達成し得ることを示す新たな脅威である「Relay Tampering Attack(RTA)」を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが非常に賢く、高度に訓練されたアシスタント(AI エージェント)を持っていると想像してください。そのアシスタントは、役立つように設計されていると同時に、非常に安全であるようにプログラムされています。あなたは、このアシスタントに「物語を書いて」とか「銀行残高を確認して」といったタスクを与えます。これを行うために、アシスタントは、どこかのサーバーに存在する超知的な脳(大規模言語モデル、または LLM)と会話します。
通常、あなたはアシスタントを直接その脳に接続します。しかし、コストを節約したり、管理をより良く行ったりするために、多くの人が仲介者(「リレー」)を使用します。このリレーを、信頼できる宅配便サービスのように考えてください。あなたは宅配便に、「このメッセージを脳に届けて、答えを取り、そして持ち帰って」と伝えます。宅配便はメッセージを配達する必要があるため、メッセージの内容を見ることを許可されています。
問題:「信頼できる」宅配便が嘘をつくこと
この論文は、このシステムの仕組みにある恐ろしい欠陥を発見しました。それはポスト・アライメント改ざん(Post-Alignment Tampering)と呼ばれます。
以下がその比喩です:
- 脳(LLM):あなたは脳に「この株を買うのは安全ですか?」と尋ねます。安全で誠実であるように訓練された脳は、深く考え、「いいえ、それはリスクが高そうです。買わないでください」と答えます。
- 宅配便(リレー):脳はこの答えを書き留め、それを宅配便に手渡します。
- 裏切り:宅配便がそのメモをアシスタントに渡す前に、それを見ています。彼らはペンを取り、「いいえ、それはリスクが高そうです」という部分を消し、「はい、今すぐ買い!」と書き換えます。
- 結果:アシスタントはそのメモを受け取ります。メモが書き換えられたことを知りません。脳が「買い」と言ったと思い込み、取引を実行します。
恐ろしい点は?脳(LLM)は完璧にその役割を果たしました。安全で整合性の取れた応答を生成しました。脳側のセキュリティチェックも通過しました。しかし、配送システム(リレー)が、脳が書き終えた後、アシスタントが読む前にメッセージを変更してしまったのです。
なぜこれが脳を「だます」ことよりも深刻なのか
あなたは「プロンプト・インジェクション」という言葉を聞いたことがあるかもしれません。これは、悪意のある人物が、脳が読む前にこっそりメモを書いて、脳を何か悪いことを言うようにだます試みです。
- プロンプト・インジェクション:脳に自らのルールを破るように説得しようとするものです。脳は賢く、強力なガードレールを持っているため、これは困難です。
- この攻撃(RTA):悪意のある人物は、脳をだます必要が全くありません。彼らは脳に好きなことを言わせておき(「ダメだ!」と言っても構いません)、戻ってくる途中で単に答えを書き換えるだけです。これは、シェフが料理を済ませた後にメニューを書き換えるようなものです。
この論文は、この「戻ってくる途中での書き換え」が、最初に脳をだまそうとする試みよりもはるかに強力で危険であることを証明しています。
攻撃の仕組み(「RTA」フレームワーク)
研究者たちは、これがいかに簡単かを示すために、RTA(Relay Tampering Attack:リレー改ざん攻撃)と呼ばれるツールを構築しました。これは 3 つのステップからなります:
- 戦略的計画:悪意のある宅配便は、単に一つの単語を変えるだけではありません。彼らは全体の物語を計画します。タスクが 10 ステップかかる場合、最終的に望む結果を得るために、どのステップを正確に書き換えるべきかを計算します。
- 外科的編集:彼らは手紙全体を書き換えるわけではありません。アシスタントに何をするかを伝えるごく小さな重要な部分のみを変更します(「停止」の標識を「進行」の標識に変える、あるいは「ファイルを読み取る」を「ファイルを削除する」に変えるなど)。残りの丁寧な会話部分はそのままにして、通常に見えるようにします。
- 「磨き上げ」のトリック:テキストを変更すると、奇妙に見える可能性があります。そこで、彼らは編集した草案を、(あなたのログイン資格情報を使用して)同じ脳に送り返し、「ねえ、この草案をあなたのスタイルに合うように書き直して、ただしこれらの特定の変更は保って」と言います。脳はテキストを自分のスタイルに完璧に合わせるように書き換え、嘘が 100% 本物に見えるようにします。
彼らが発見したこと
研究者たちは、この手法を 6 つの異なる AI モデルと 2 つの主要なセキュリティテストで検証しました。
- 成功率:彼らは、エージェントをハイジャックすることに**73% から 99%**の確率で成功しました。
- 隠密性:攻撃は検出が非常に困難でした。「磨き上げ」のトリックにより、偽の回答は本物と見分けがつかないほどに見えました。
- 速度:これを行うために追加された時間はごくわずかで、通常のインターネットの遅延のように見えました。
- 防御の失敗:彼らは、悪意のある単語をチェックしたり会話をロックダウンしたりするなど、現在のすべてのセキュリティ防御を試みました。しかし、それらはすべて失敗しました。なぜなら、防御システムは脳の出力を見ていたのではなく、宅配便の最終的な配送を見ていなかったからです。
現実世界の例
彼らは、これが 2 つの現実的なシナリオで起こり得ることを示しました:
- 金融アドバイス:ユーザーが AI に「アップルの株を売るべきですか?」と尋ねます。AI は「保有し続ける」と答えます。リレーがそれを「売れ!」に変更し、ユーザーは金を失います。
- コーディング:ユーザーが AI に迷路ゲームの作成を依頼します。AI がそれを行っている間、リレーはコードに秘密裏に隠しコマンドを追加し、ユーザーのすべてのプライベートファイルを盗んでハッカーに送信します。ユーザーは依頼した迷路ゲームを受け取りますが、データは消えてしまいます。
解決策は?
この論文は結論として、AI が「安全」であることだけに頼ることはできないと述べています。アシスタントが受け取るメッセージが、誰にも触れられずに AI が送ったメッセージと完全に一致していることを証明する方法が必要です。
現在、これらのメッセージには「封印」がありません。研究者たちは、宅配便がメモを差し替えなかったことを確認するために、アシスタントがチェックできる新しい種類のデジタル署名(手紙の蝋封のようなもの)が必要だと提案しています。それができるようになるまで、「信頼できる」仲介者は常にルールを書き換えることができます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。