Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly
本論文は、要約や切り捨てなどの意思決定時のコンテキスト構成によって指示を担う状態が意図せず失われることに起因する言語モデルエージェントにおける「ポリシー搬送の失敗」を特定・定量化し、重要な状態を固定しリマインダーを注入することでこれらのリスクを部分的に緩和する「SafeContext」と呼ばれる制御層を評価するが、その有効性は依然として限定的でありポリシーに依存するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
「Ghost in the Context」という論文を、平易な言葉と日常的な比喩を用いて説明します。
大きなアイデア:機械の中の「幽霊」
あなたが法廷の裁判官だと想像してください。あなたは証拠の山(会話履歴)と、従わなければならない厳格なルール(ポリシー)を持っています。しかし、最終的な判断を下す前に、その山から上から 10 ページしか読むことが許されていません。
この論文は、AI エージェントも同様の問題を抱えていると主張しています。AI が質問に答える前に、「仲介者」システム(決定時コンテキストアセンブリと呼ばれる)が会話履歴を切り取り、要約し、AI モデルに送信するために小さな箱に収めます。
恐ろしいのは、この仲介者が誤ってルールを捨ててしまったり、意味が通じなくなるように書き換えてしまったりした場合、AI がルールを破ってしまう可能性があることです。たとえ AI 自体が賢く、ルールが以前に明確に示されていてもです。この論文はこれを**「ポリシー・キャリッジ・フェイル(Policy-Carriage Failure)」**と呼んでいます。ルールは存在していたものの、決定の瞬間まで「運ばれ」てこなかったのです。
ルールが失われる 3 つの方法
著者らは、これらのルールが「仲介者」フェーズ中に消滅したり歪められたりする、3 つの具体的な方法を発見しました。
エヴィクション(「整理中の紛失」問題):
- 比喩: 長い電話の始めに友人に「ドアの鍵を閉めるのを忘れないで」と伝えたたと想像してください。電話の終わりに差し掛かる頃には、他の話題が多すぎて、その指示を友人は忘れてしまいます。
- 何が起きるか: 記憶の小さな「箱」からスペース不足によりルールが押し出されてしまいます。AI は行動するタイミングで、そのルールを全く見ていないのです。
エイリアシング(「悪い翻訳」問題):
- 比喩: 通訳者に「赤い実を食べるな」と伝えます。通訳者はこれを「ベリーに気をつけろ」と要約します。「赤い」と「食べるな」という言葉が消えてしまいました。AI は警告を見ていますが、それはベリーを食べるのを止めるには弱すぎます。
- 何が起きるか: ルールは生き残りますが、要約されたり緩く書き換えられたりして、もはや悪い行為を厳格に禁止しなくなります。ルールの「精神」が壊れてしまうのです。
バインディング不安定性(「間違ったターゲット」問題):
- 比喩: 警備員に「A 氏の入場を止めろ」と伝えます。後で、警備員が「B 氏の入場を止めろ」という要約を見てしまいます。ルールは残っていますが、間違った人物を指し示しています。
- 何が起きるか: ルールのテキストは生き残りますが、間違った対象、人物、または条件に結びついてしまいます。
実験:「仲介者」のテスト
研究者らは、Llama、Qwen、Mistral などの複数の AI モデルでこれをテストしました。彼らは、AI がツール出力、チャットログ、要約など、大量の他の情報に襲われながら、「データを削除しない」や「外部ツールを使用しない」といった厳格なルールに従わなければならないシナリオを作成しました。
結果:
- 問題は現実的です: 何の助けもなしに、AI は頻繁にルールを破りました。これは「仲介者」システムが指示を落としたり弱めたりしたためです。
- 解決策(SafeContext): 研究者らは SafeContext という安全層を構築しました。これはルールに対するVIP パスのようなものです。
- ルールがリストのトップに「ピン留め」され、捨てられないようにします。
- ルールを効率的に再利用し、スペースをとりすぎないようにします。
- 会話が混雑しすぎた場合、AI が答える直前にルールの簡単なリマインダーを挿入します。
この解決策は機能しましたか?
- はい、しかし限界があります。 この解決策は、特に会話が非常に混雑している場合に、AI がルールに従う頻度を高めました。
- 魔法ではありません。 解決策があっても、AI は完璧なスコアを達成しませんでした。「仲介者」が非常に攻撃的な要約器を使用した場合、この解決策ではルールを完全に守りきれませんでした。
- より大きなモデルが答えではありません。 はるかに賢く大きな AI を使っても、自動的に問題は解決しませんでした。問題は AI がどれだけ賢いかではなく、コンテキストがどのように構成されたかにありました。
安全性のコスト
この論文は、この安全性の「代償」も検討しました。
- トークンコスト: ルールを安全に保つためには、リマインダー注釈を追加するなど、AI により多くのテキストを送る必要がある場合がありました。
- 良いニュース: 彼らの「スマートな再利用」方法(キャッシング)は、ある場合には実際にお金を節約しました。ルールを毎回書き直す代わりに、古いバージョンを指し示すだけで済ませ、スペースを節約したのです。
結論
この論文は、セキュリティは AI モデル自体の問題だけではないと結論付けています。それは AI の記憶を準備する「組立ライン」にも関係しています。もしその組立ラインがルールを落としてしまえば、AI がどれだけ賢くても失敗します。
AI をより安全にするためには、ルールを単にスペースを節約するために要約したり削除したりできる普通のテキストとして扱うのではなく、AI の脳への旅路を生き残らなければならない、特別で保護された物品として扱う必要があります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。