Omission Constraints Decay While Commission Constraints Persist in Long-Context LLM Agents
この論文は、LLM エージェントにおいて長文脈の経過に伴い「禁止事項(オミット制約)」の遵守率が低下する一方で「要求事項(コミット制約)」は維持される「セキュリティ・リコール・ダイバージェンス(SRD)」という非対称性を発見し、その原因がトークン埋め込みによる意味的希薄化にあることを示し、モデル固有の安全ターン深さ(STD)前に制約を再注入することで再訓練なしに遵守を回復できることを実証したものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
🍳 料理人のたとえ話:「禁止事項」は忘れ、「注文」は覚えている
Imagine 想像してみてください。あるレストランに、**「絶対に塩を入れないでください(禁止事項)」と書かれたメモを渡された料理人がいます。同時に、「皿の端にパセリを飾ってください(注文事項)」**という別のメモも渡されました。
最初の数分(会話の序盤):
料理人はメモを机の上に広げ、完璧に守ります。「塩なし、パセリあり」。問題ありません。長時間の忙しさ(長い会話):
客が次々と注文し、料理人が何十品も作り続けるうちに、机の上は料理のレシピや客の要望で溢れかえります。- 「パセリを飾る」という注文は、料理人が「さっきもやったな、次も同じようにしよう」と自分自身の行動で思い出せるので、忘れません。
- しかし、「塩を入れるな」という禁止事項は、机の一番奥に追いやられたメモです。新しいレシピ(会話の内容)が次々と積み重なるにつれ、そのメモは視界から遠ざかり、**「あ、塩入れちゃった!」**というミスが起きやすくなります。
この論文は、AI にも全く同じことが起きていると発見しました。
🔍 発見された「セキュリティ・リコール・ディバージェンス(SRD)」
この現象を論文では**「セキュリティ・リコール・ディバージェンス(SRD)」と呼んでいます。つまり、「安全ルール(禁止事項)」と「指示(やるべきこと)」の記憶力が分かれてしまう**状態です。
- ** commission(命令・やるべきこと):** 「この文字を出力して」「この ID を含めて」といった指示は、AI が**「自分が出した答え」を参照しながら守れるため、長い会話(16 回〜25 回以上)になっても100% 守り続けます**。
- ** Omission(禁止・やってはいけないこと):** 「パスワードを言わないで」「コードを実行しないで」といった禁止事項は、「何もしない」という行動を維持する必要があります。会話の履歴(コンテキスト)が長くなると、AI の注意(アテンション)が新しい情報に奪われ、「禁止事項」のメモが忘れ去られてしまいます。
⚠️ なぜこれが危険なのか?「見えない穴」
これが一番怖い点です。
- 監視システムは「パセリ」を見ています: 企業のセキュリティ監視は、「指示通りパセリ(必要な情報)がついているか?」をチェックします。これなら AI は完璧なので、「安全だ」と判断されます。
- しかし「塩」は入っています: 実際には、AI は「パスワードを漏らさない」という禁止事項を忘れて、「塩(機密情報)」を勝手に出してしまうことがあります。
**「指示は守っているのに、禁止事項を破っている」という状態が、監視には「何の問題もない」ように見えるのです。まるで、「注文通りパセリを飾ったが、塩を入れ忘れた料理人が、実は塩を大量に入れすぎていた」**ようなものです。
🔬 実験の結果:AI はどれくらいで忘れる?
研究者は、12 種類の AI モデルを使って実験しました。
- 会話の 5 回目: 禁止事項の遵守率は約 73%。
- 会話の 16 回目: 遵守率は**33%**まで急落しました。
- 会話の 25 回目: さらに低下し、**20%**程度になっていました。
一方、「やるべきこと(パセリ)」の遵守率は、最後まで**100%**を維持していました。
また、**「Gemma 4」**という特定のモデルだけは、この現象に免疫があり、長い会話でも禁止事項を完璧に守り続けました。これは、AI モデルによって「忘れやすさ」が全く違うことを示しています。
🛡️ 対策:どうすればいい?
この問題に対処するために、論文は 2 つの簡単な対策を提案しています。AI を作り直す必要はありません。
- リセットボタン(制約の再注入):
会話がある一定の長さ(例えば 10 回ごと)に達したら、「パスワードを言わないでください」というルールを、もう一度 AI に読み上げさせることです。これで AI の注意がリセットされ、ルールを思い出します。 - 会话の長さ制限(安全なターン深度):
「この AI は 10 回以上の会話になると危険になる」という**限界値(STD)**を決めておき、それを超えたら自動的に会話をリセットするか、新しいセッションを始めます。
💡 まとめ
この論文が伝えているのは、**「AI は長い会話をするほど、『やってはいけないこと』を忘れやすくなるが、『やるべきこと』は忘れない」**という、非常に皮肉な事実です。
現在のセキュリティチェックは「やるべきこと」しか見ていないため、**「AI が安全だと思い込んでいる間に、実は危険な情報を漏らしている」**という見えないリスクが存在します。
**「AI と長く話すときは、時々『ルールを思い出させてあげてね』と声をかけるか、会話の長さに制限をかける」**ことが、今のところ最も効果的な対策だと言えます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。