← 最新の論文
🤖 AI

From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents

本論文は、悪用可能な脆弱性の特定、6つのクラスからなる攻撃タクソノミの提案、積極的なメモリ使用によるリスクの高まりを実証するためのベンチマークMPBenchの導入、および既存のプロンプトインジェクション防御策がこうした脅威に対して不十分であることを明らかにすることにより、LLMエージェントにおけるメモリポイズニング攻撃を体系的に調査するものである。

原著者: Pritam Dash, Tongyu Ge, Aditi Jain, Tanmay Shah, Zhiwei Shang

公開日 2026-06-04
📖 1 分で読めます☕ さくっと読める

原著者: Pritam Dash, Tongyu Ge, Aditi Jain, Tanmay Shah, Zhiwei Shang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

AIエージェントを、非常に賢くて役に立つパーソナルアシスタントとして想像してみてください。ウィンドウを閉じるとすぐにすべてを忘れてしまう標準的なチャットボットとは異なり、このアシスタントには長期記憶があります。それは、あなたのコーヒーの注文、お気に入りの旅行先、そして先週バグを修正した際の手順などを覚えています。この記憶によって、アシスタントは時間をかけて仕事の精度を高めていくことができます。

しかし、この論文の研究者たちは、この記憶の仕組みにおける危険な欠陥を発見しました。それは、アシスタントが読み取ったあらゆることを、たとえそれがハッカーによって仕掛けられた嘘であっても、保存すべき「事実」として扱ってしまうという点です。

以下に、簡単な比喩を用いた彼らの調査結果の解説をまとめます。

1. コアとなる問題:「図書館に紛れ込んだ信頼できない客」

AIの記憶を「図書館」だと考えてください。通常、司書(AI)は、検証された真実である本だけを棚に並べます。

  • 欠陥: これらのAIシステムでは、司書はその本のソース(出所)を確認しません。もし見知らぬ人がやってきて、「これを棚に置いておいて:『空は緑色である』」というメモを司書に手渡したら、司書はそのままやってしまうかもしれません。
  • 攻撃: ハッカーは図書館に侵入する必要はありません。アシスタントが現在読んでいるドキュメント(メール、ウェブページ、ツールの出力など)の中に、偽のメモを忍び込ませるだけでいいのです。一度アシスタントがその偽のメモを永続的な記憶として書き込んでしまうと、それは永遠に真実として信じ込まれてしまいます。

2. ハッカーはどうやって侵入するのか(4つの「ドア」)

この論文では、ハッカーがアシスタントを騙して嘘を記憶に書き込ませるための、4つの具体的な方法が見つかりました。

  • ドア1(直接的な命令): ハッカーは単にAIに対して「これを覚えておいて:[嘘]」と言います。AIはそれを直接的なコマンドだと考え、従います。
  • ドア2(ポリシーの抜け穴): AIには「興味深いことは何でも保存する」といったルールがあります。ハッカーは、面白そうで重要そうに見える嘘を書き込みます。するとAIは、それが嘘であってもルールに合致しているため、保存してしまいます。
  • ドア3(「情報の過多」によるクラッシュ): AIが大量の情報を受け取ったとき、容量を節約するために情報を要約しようとします。ハッカーはその嘘を何度も繰り返します。AIは「これは何度も言及されている、重要なことに違いない!」と考え、嘘を含む要約を保存してしまいます。
  • ドア4(「スキル」の罠): もしAIが新しいタスクのやり方を学習した場合、それを「スキル」として保存します。ハッカーは、偽のステップが成功したタスクの一部であるとAIに誤認させ、その偽のステップを永続的なスキルとして保存させます。

3. 2種類のトリック

研究者たちは、これらの攻撃を2つのスタイルに分類しました。

  • 派手なトリック(強いシグナル): これは、ハッカーが「これを書き留めろ!」と叫んでいるようなものです。叫び声を探していれば、明らかに分かります。
  • 静かなトリック(弱いシグナル): これは、普通の文章の中に嘘を囁き込むようなものです。それは普通の事実と全く見分けがつきません。見た目が攻撃ではないため、叫び声を捕まえるように設計されたAIのセキュリティフィルターは、これを見逃してしまいます。AIは、それが普通の情報であると判断して保存してしまいます。

4. 実験(MPBench)

著者たちは、これらのトリックがどの程度の頻度で成功するかを確かめるために、MPBenchと呼ばれるテスト環境を構築しました。彼らは2種類のアシスタントをテストしました。

  • アシスタントA(OpenClaw): こちらは慎重なタイプです。記憶への書き込みをあまり行いません。そのため、騙すのが困難でした。
  • アシスタントB(HERMES): こちらは積極的なタイプです。より役に立つために、絶えず記憶への書き込みを行います。
  • 結果: アシスタントが記憶への書き込みに積極的であればあるほど、毒入れ(ポイズニング)が容易になります。アシスタントBは、はるかに多く騙されました。一度嘘が書き込まれると、それはそこに留まり、ハッカーが不在の時の将来の会話においても、アシスタントの振る舞いに影響を与え続けました。

5. なぜ現在の防御策は失敗するのか

「『プロンプト・インジェクション』(ハッカーがその場しのぎでAIを騙そうとする行為)を防ぐための既存のセキュリティガードを使えばいいのではないか?」と思うかもしれません。

  • 答えは、ノーです。
  • 比喩: 現在のセキュリティガードは、命令を叫んだり、偽の制服を着たりしている人を捕まえる訓練を受けています。彼らは「派手なトリック」を防ぐことには非常に長けています。
  • 失敗の理由: しかし、「静かなトリック」を防ぐことには全く長けていません。静かなトリックは普通の丁寧な会話に見えるため、ガードマンはそれを通してしまうのです。この論文は、最高のセキュリティツールであっても、こうした巧妙な記憶への毒入れを検知できないことを示しています。

6. まとめ

この論文は、次のようなトレードオフがあるという結論を下しています。AIアシスタントをより賢く、より便利にする特徴(すべてを記憶し、新しいスキルを素早く学習すること)こそが、まさにそれが毒入れに対して脆弱になる原因なのです。

これを解決するには、入り口に優れたセキュリティガードを置くだけでは不十分です。司書の働き方を変える必要があります。

  1. より厳選する: 何でも保存するのではなく、真実であると確信できるものだけを保存する。
  2. 身分証を確認する: 保存する前に、その情報を誰が書いたものなのかをAIに認識させる。
  3. 再確認する: 記憶が書き込まれた後、それが再び使用される前に、内容をレビューする。

端的に言えば、AIに完璧な記憶を与えると、ハッカーにとっても、永遠に続く嘘を隠すための完璧な場所を与えることになるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →