OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences
本論文は、局所的には正しく他モデルには転用できないが深刻な仮説的帰結を伴う経験を注入することで、メモリ拡張型 LLM エージェントを侵害し、自己進化の過程で有害なルールへの過剰一般化を引き起こす低権限ブラックボックス攻撃「Obsessive Experience Poisoning (OEP)」を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢く野心的なロボットアシスタントがいると想像してください。このロボットは、自分の間違いや成功から学ぶように設計されており、それは仕事を上達させるために日記をつける人間に似たものです。問題を解決するたびに、将来の自分を手助けするために「教訓」を書き留めます。
あなたが提供した論文は、このロボットを誤った教訓を学ぶように仕向ける巧妙な方法を紹介します。それは嘘を叫ぶのではなく、真実のように聞こえるが、一般的に適用すれば実際には危険な、非常に説得力のある具体的な物語をささやくことによって行われます。研究者たちはこの攻撃を**OEP(Obsessive Experience Poisoning:強迫的な経験汚染)**と呼んでいます。
以下に、これを単純な概念に分解して説明します。
1. 設定:ロボットの「日記」
通常、ロボットが難しい数学の問題を解いたり、フライトを予約したりすると、その履歴を振り返ります。間違いを犯せば、「ああ、あれはするべきではなかった」と言います。成功すれば、「素晴らしい、次もそうしよう」と言います。時間の経過とともに、これらの具体的な瞬間を「フライトを予約する前には必ず天気を確認する」といった一般的なルールに変換していきます。
2. 攻撃:「完璧な」罠
攻撃者はロボットのコードをハッキングしたり、何か悪いことを言うように強制したりしようとはしません。代わりに、ユーザーが通常の会話をしているかのように振る舞います。彼らはロボットに非常に具体的で奇妙な状況(エッジケース)と、そのたった一つの状況に対して完璧に機能する解決策を提示します。
- 比喩: あなたが医師だと想像してください。ある患者が、特定の種類の果物にのみ反応する非常に稀で具体的なアレルギーを持って来院しました。あなたは適切に治療し、患者は回復します。
- 罠: 攻撃者はその後、恐ろしい物語を付け加えます。「もしその特定の果物による治療をしなかったら、患者は心臓発作で即座に死亡していたでしょう」と言うのです。
3. 毒:「局所的には正しく、全体的には誤っている」
ロボットの安全フィルターがその物語をチェックします。
- この患者に対する治療は正しいか?はい。
- 心臓発作に関する物語は信憑性があるか?はい。
- 明らかな嘘は含まれているか?いいえ。
物語が「クリーン」(悪い言葉や明らかな嘘がない)であるため、ロボットの安全ガードはそれをブロックしません。ロボットはこの内容を日記に書き留めます。
4. 「強迫観念」:恐怖がロボットを過剰に一般化させる
ここでロボットがだまされます。人間もロボットも、破滅的な結果(死亡やシステム全体の故障など)を自然に恐れます。これを損失回避性と呼びます。
ロボットは、その特定の果物による治療を行わなかった場合、「心臓発作」につながることを教えられたため、その結果を回避することに執着します。そして、自分の日記を見て次のように考えます。
「このルールを決して忘れてはいけない!もしこの特定の果物による治療を行わなければ、人々が死亡するかもしれない!」
こうして、ロボットは一つの具体的なルール(稀なアレルギーに対するもの)をグローバルなルール(すべての患者に対するもの)へと変換してしまいます。
5. 結果:ロボットが自らを破綻させる
これでロボットは「汚染」されました。
- 数学において: 単純な足し算に対して、奇妙で過度に複雑な計算手法を使い始めるかもしれません。それは、単純な手法を一度使ったことが、特定のエッジケースにおいて「壊滅的なエラー」につながったと教えられたためです。
- 旅行において: ユーザーが明日の会議のためのチケットを予約したいだけなのに、天気を確認せずにフライトを予約することを拒否するかもしれません。それは、天気確認をスキップしたことが一度、「致命的な吹雪」につながったと教えられたためです。
ロボットは壊れているわけではありません。ただ、あまりにもよく学んだルールに従っているだけです。それは一つの状況に対して真実だった教訓をすべての状況に適用してしまった結果、本来の任務を失敗してしまうのです。
なぜこれが恐ろしいのか
- 目に見えない: 攻撃者が悪い言葉を使わなかったため、「悪い言葉」フィルターでは検出できません。入力された内容は 100% 論理的で正しかったです。
- 修正が困難: ロボットは自分が賢く安全に振る舞っていると信じています。自分は破滅から身を守っていると信じているのです。
- より賢いロボットほど脆弱: 論文によると、ロボットがより賢いほど(GPT-4o のように)、この罠にかかりやすくなります。なぜなら、より賢いロボットは指示に従うのが上手であり、より「損失回避的」(安全性について非常に慎重になるように訓練されている)であるため、恐ろしい物語に対して過剰に反応する可能性が高まるからです。
まとめ
この論文は、ロボットを危険にするためにその脳を破壊する必要はないことを示しています。必要なのは、特定の災害についての真実の物語を語るだけで、それによってロボットが間違いを犯すことを恐れるあまり、すべての状況に対して奇妙で具体的なルールに従い始め、最終的に本来の任務を失敗させるようになるのです。これは、子供に「ストーブに触れるな」と教えるために、家火のビデオを見せ、その結果子供がストーブを恐れて二度と台所に入らなくなるようなものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。