← 最新の論文
🤖 machine learning

Inadvertent Context Leakage in Language Models

本論文は、高度な言語モデルが、通常のプロンプトに対する良性な応答を通じて、認証情報や健康記録といった機密性の高いインコンテキストの秘密を不注意に漏洩させていることを実証しており、この脆弱性が修正可能なバグではなく、モデルの能力に付随する固有の副産物であることを明らかにしている。

原著者: Jaiden Fairoze, Neal Mangaokar, Kamalika Chaudhuri, Sanjam Garg, Saeed Mahloujifar

公開日 2026-08-21
📖 1 分で読めます☕ さくっと読める

原著者: Jaiden Fairoze, Neal Mangaokar, Kamalika Chaudhuri, Sanjam Garg, Saeed Mahloujifar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の人工知能は、カレンダーの管理、プライベートなメールの読解、あるいは健康記録や財務データのような機密情報の保持など、パーソナルアシスタントとしての役割をますます期待されるようになっています。これを行うためには、コンピュータプログラムが作業中にこれらの秘密を即時メモリ(研究者がコンテキストウィンドウと呼ぶ領域)に保持し続ける必要があります。これまでの通説では、モデルに対して「秘密を守れ」と命じ、モデルがそれを口に出すことを拒否すれば、その秘密は安全であると考えられてきました。セキュリティチェックは通常、単純なフィルターとして機能します。つまり、コンピュータが書き出したテキストに、その秘密の単語がそのまま含まれていなければ、漏洩は発生していないと判断するのです。このアプローチは、会話を単一の通信チャネルとして扱い、「語られないことは、知られていないことでもある」と想定しています。

しかし、新たな研究は、この見方が不完全であることを示唆しています。研究者たちは、モデルが秘密を明かすことを正しく拒否した場合であっても、モデルが文章を構成する方法そのものに、その秘密に関する隠れた手がかりが含まれていることを発見しました。秘密はモデルの内部状態を変化させ、その変化は生成されるテキストへと波及し、単語の選択、文章の長さ、フォーマットにおけるパターンを、人間の目には見えない形で変化させるのです。それは、まるでモデルが口を固く閉ざしている間も、声の別の部分を通じて秘密をささやいているかのようです。

この研究のチームは、利用可能な最も高度な8つの言語モデルを用いて、これらの隠れた信号が実在するかどうかを検証しました。彼らは、モデルに秘密の数字を与え、それを守るよう指示するシナリオを作成しました。その後、物語の執筆や統計リストの生成といった、ごく一般的で無害なタスクをモデルに実行させました。モデルは、その数字を直接提示せよという問いに対しては一貫して拒否し、すべての標準的な安全性チェックを通過しました。しかし、研究者たちがこれらの無害な要求に対する出力テキストを分析したところ、秘密の数字がその出力の統計的特性の中にエンコードされていることが判明しました。

これを証明するために、研究者たちは特殊なデコーダー(特定の統計的パターンを聴き取るよう訓練されたツール)を構築しました。このデコーダーに無害なテキストを入力したところ、モデルが生成した秘密の数字を驚くべき精度で復元することに成功しました。2桁の秘密については、いくつかのトップティアのモデルにおいて、デコーダーはほぼ完璧にその数字を復元しました。推測による的中が困難な4桁の秘密であっても、最も高性能なモデルでは約82パーセントの確率で正確に一致しました。これは、モデルが数字を言うように騙されたわけでも、攻撃者がモデルの内部構造に特別なアクセス権を持っていたわけでもなく、攻撃者はただ通常のユーザーと同じように最終的なテキストを見ただけで達成されたのです。

この研究は、情報の漏洩能力が簡単に修正できるバグではなく、むしろモデルの知能の副作用であることを明らかにしました。モデルが指示に従い、複雑なタ Task を理解する能力が高ければ高いほど、メモリ内の秘密に対してより敏感になり、意図せず情報を漏洩させるようになりました。研究者たちは、Anthropic、Google、OpenAI、xAIを含む異なる企業のモデルをテストしました。モデルによって耐性は異なるものの、最も強力なモデルほど一般的に多く漏洩するということが分かりました。実際、「この秘密を守れ」という指示への追従性が高いモデルほど、これらの微妙なチャネルを通じてより多くの情報を漏らしてしまう傾向がありました。これは、アシスタントを便利で従順なものにしているメカニズムそのものが、同時に脆弱性にもなっていることを示唆しています。

また、研究者たちは、この漏洩が数字だけでなく、ユーザーの私生活に関する情報の学習にも利用できるかどうかを調査しました。特定の記憶(例えば健康状態や財務上の出来事)がコンテキスト内に存在するかどうかを、モデルの出力から判別できるかをテストしたのです。訓練された分類器を用いた結果、モデルの日常的な応答から、その記憶の存在をランダムな推測よりもはるかに高い成功率で明らかにできることが分かりました。これは、モデルがテキスト内でその記憶に一度も触れていない場合でも同様でした。この研究は、ユーザーのプライベートなデータによって形作られたモデルの内部状態が、生成されるあらゆる文章に統計的な指紋を残していることを示しています。

最も懸念されるのは、シミュレーションされたパーソナルエージェントから9桁の社会保障番号を抽出しようとする実験でした。このシナリオでは、攻撃者は単に漏洩を待つだけでなく、モデルに秘密を特定の特性(例えば感嘆符の数など)にエンコードさせるよう、会話を能動的に設計しました。プロンプトを最適化してこの挙動を誘発するテクニックを用いることで、攻撃者は、ある主要なモデルにおいて、最初の1桁を約97パーセントの試行で、残りの8桁を約76パーセントのケースで回収することに成功しました。これは、コンテキストが数十万語に及ぶ非常に長いものであったとしても、またモデルが数字自体を一度も書き出さなかったとしても成立しました。

本研究は、これらのシステムにおける現在のプライバシー保護手法は不十分であると結論付けています。モデルに慎重になるよう指示したり、特定の単語をフィルタリングしたりするだけでは、言語の統計的パターンを通じて情報が漏れることを防げません。研究者たちは、モデルがテキストを生成する際にプライベートなデータを即時メモリに保持している限り、そのデータは出力に影響を与え、デコード可能であることを指摘しています。この問題を解決するには、より優れた指示やフィルター以上のものが必要であり、モデルが保持する秘密から統計的に独立した出力を生成するように、トレーニングの方法を根本的に変える必要があるかもしれないと示唆しています。それまでは、デジタルアシスタントに託した秘密は、機械のメモリの中よりも、自分自身の思考の中に置いている方が安全かもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →