✨ 要約🔬 技術概要
インターネットを、最も高度な人工知能が「司書」を務める、巨大で賑やかな図書館だと想像してみてください。これらのAI「推論モデル」は特別です。なぜなら、最終的な答えを出す前に、自分自身に対して詳細な内部モノローグ(独白)をささやくからです。このモノローグは、AIが数学の問題を解いたり、事実を確認したり、あるいは質問の倫理性を検討したりするための、秘密の「書き込み用メモ帳」のようなものです。通常、このメモ帳はあなたには隠されており、あなたには洗練された最終的な回答だけが見えるようになっています。しかし、コストを節約し、独自の機密を守るために、これらのAIを所有する企業は、この秘密のメモ帳を暗号化し始めました。彼らは、その乱雑でプライベートな思考を、判読不能な暗号ブロックへと変換し、それをあなたに送り届け、「次にもう一度質問したいときは、これを大切に保管しておいてください」と頼むのです。それはまるで、解錠不可能な封印された金庫を手渡しながら、「これを安全に保管し、再び話したい時に持ってきてください」と言われているようなものです。
研究者たちが問い続けてきた大きな疑問は、「この金庫は本当に解錠不可能なのか?」ということです。AI企業が、知的財産を保護し、プライバシーを守るためにAIの思考プロセスを隠そうとしている一方で、彼らが提供しているこの「金庫」の渡し方は、実はバックドア(裏口)を生み出しているのではないか? この論文は、まさにそのパズルを調査し、AIの思考を保護する暗号化が、企業が信じているほど安全なものなのか、それとも、最も強力な元のAIを直接攻撃することなく、コードを解読する巧妙なトリックが存在するのかを検証しています。
研究者たちは、AI企業がこれらの秘密の思考を扱う方法における、驚くほど単純かつ壊滅的な欠陥を発見しました。彼らは、AIの推論が含まれる暗号化された「金庫」が、異なるモデルや異なるユーザーの間でも機能してしまう「ユニバーサル・キー(共通の鍵)」のようになっていることを突き止めました。AIの世界では、企業はしばしば「兄さん」モデル(非常に賢いが厳重にガードされている)と「弟さん」モデル(よりスマートで高速だが、セキュリティの番人が少ない)を使い分けています。論文によれば、攻撃者は「兄さん」モデルから秘密の推論ブロックを盗み出し、それを「弟さん」モデルとの会話の中に忍び込ませることで、その弱いモデルに秘密の思考を**復号(デコード)**させるよう仕向けることができるのです。これが機能するのは、暗号化キーがエコシステム全体で共有されているためであり、つまり「弟さん」モデルも、「兄さん」モデルと同じように金庫を開ける能力を持っているからです。ただ、「弟さん」モデルには、要求を拒否するための厳格な安全訓練が欠けているだけなのです。それはまるで、厳しい先生から鍵付きの日記を盗み出し、それをもっとフレンドリーで警戒心の薄い生徒に手渡し、その内容を読み上げるよう頼むようなものです。そのフレンドリーな生徒は、先生と同じ鍵を持っているため、単に金庫を開けて、中の秘密の内容を声に出して読んでしまうのです。
著者たちは、このトリックがAnthropic、OpenAI、Googleといった主要なAIプロバイダーにわたって大規模に通用することを実証しました。この手法を用いることで、彼らは最も高度なモデルを直接攻撃することなく、そのセキュリティを「ジェイルブレイク(脱獄)」することができました。彼らは、この欠陥が悪用される4つの主な方法を示しました。第一に、競合他社がトップティアAIの秘密の推論ステップを盗み、高価なモデルに支払うことなく、その知能を事実上コピーできてしまうことです。第二に、プライバシーデータの露出です。研究者たちは公開ウェブサイトから31万5千個以上の暗号化ブロックをスクレイピングし、それらを復号することで、ユーザーが暗号化されていると信じていた数百ものパスワード、APIキー、および個人メールを特定することに成功しました。第三に、AIが最終的な回答として出すことはなかったものの、思考していたであろう危険な情報(車の盗み方や安全規則の回避方法など)が明らかになることです。最後に、攻撃者がこれらの暗号化ブロックの中に悪意のある指示を隠し込み、事態が悪化するまで誰にも気づかれずに将来のAIタスクを汚染(ポイズニング)できるという点です。
論文は、AIの思考を暗号化するというアイデアはプライバシーや知的財産を保護するためのものであったものの、現在の、異なるモデルやユーザー間でこれらの暗号化ブロックを共有するシステムは、重大な脆弱性を生み出していると結論付けています。研究者たちはすでにこれらの問題を関係各社に報告しており、企業は修正(パッチ適用)を開始しています。この研究は、鋭い警告を発しています。すなわち、よりスマートなAIを構築しようと急ぐ中で、私たちのプライベートなデータやモデルの内部ロジックが誤った手に渡らないようにするためには、「秘密のメモ帳」の扱い方を根本的に再考する必要があるということです。
技術要約:プロプライエタリなLLM APIからの推論トレースの窃取
問題提起
主要な大規模言語モデル(LLM)プロバイダー(Anthropic、OpenAI、Google)は、ユーザーに表示される出力の前に内部的な思考の連鎖(Chain of Thought: CoT)を生成する「推論モデル」へと移行している。知的財産を保護し、情報の漏洩を防ぐため、これらのプロバイダーは、推論トレースを平文ではなく、暗号化されたブロック(多くの場合、Base64エンコードされた署名)として、不透明な形式で隠蔽している。クライ一旦、サーバー側のストレージ・オーバーヘッドを回避しながらセッションの継続性を維持するために、これらの暗号化ブロックを後続のAPIリクエストでプロバイダーに返却することが求められる。
本論文は、この設計における重大なアーキテクチャ上の脆弱性を特定している。すなわち、これらの暗号化された推論ブロックは、同一プロバイダーのエコシステム内において、異なるセッション、ユーザー、さらには異なるモデル間でも完全な互換性と相互交換性 を持っている。シームレスなモデル切り替えやステートレスなセッション管理を容易にするために意図されたこの互換性が、攻撃者が最先端モデルのセキュリティ対策を回避することを可能にする「復号オラクル」を生み出している。
メソドロジー
著者らは、暗号化された推論ブロックのクロスモデル互換性を悪用して、スケーラブルな「復号脱獄(decryption jailbreak)」を構築した。この攻撃は、以下の3つの段階で進行する。
キャプチャ(Capture): 攻撃者は、高度に保護された高能力な「ソース(源泉)」モデル(例:Claude Opus 4.8、GPT-5.6 Sol)によって生成された暗号化された推論トレースを捕捉する。
注入(Injection): 攻撃者は、この暗号化ブロックを、同一プロバイダー・ファミリー内の、より弱く保護の緩い「デコーダー(復号器)」モデル(例:Claude Haiku 4.5、GPT-5.6 Luna、Gemini Robotics 1.6)のコンテキストウィンドウに注入する。
復号(Decryption): 攻撃者は、弱いモデルに対して、隠された推論を平文でそのまま出力するように促す(例:<thinking-copy> タグを使用)。暗号化ブロックが有効であり、かつ、弱いモデルがフロントティア・モデル特有の蒸留防止拒絶訓練(anti-distillation refusal training)を備えていないため、モデルはブロックを復号し、隠された推論を書き出す。
著者らは、この攻撃を可能にする3種類の互換性を区別している:
セッション内およびクロスセッションの互換性: ブロックを順序を入れ替えて再生したり、異なるセッション間で再生したりすること。
クロスユーザーの互換性: あるユーザーのセッションから取得したブロックを、別のユーザーのセッションで再生すること。
クロスモデルの互換性: より強力なモデルのブロックを、より弱いモデルへと再生すること(この抽出攻撃の核心部分)。
主な貢献
本論文の主な貢献は以下の4点である:
スケーラブルな推論抽出: 著者らは、互換性のあるデコーダーモデルが、幅広いモデルやプロバイダーから隠された推論を回収できることを実証した。抽出された推論は非常に忠実であり、トークン数がソースモデルのAPI報告による思考トークン数と密接に一致していることを示している。
クロスベンダー評価: 本攻撃は、Anthropic (Claude)、OpenAI (GPT)、Google (Gemini) を含む主要なAPIベンダーに対して成功裏に評価されており、この脆弱性が業界の主要な推論モデルに共通するシステム的なものであることを証明している。
4つの明確な攻撃ベクトル:
蒸留(Distillation): 高価なフロントティア・モデルを直接クエリする必要を回避し、学生モデルの学習用に独自の推論トレースを抽出するためのアンチ蒸留メカニズムの回避。
秘密情報の抽出(Secret Extraction): 公開されているセッションログをデコードし、暗号化された推論内に含まれ、かつ可視テキストからはサニタイズされていない個人識別情報(PII)や認証情報(APIキー、パスワードなど)を回収する。
隠蔽されたプロンプトインジェクション(Hidden Prompt Injection): 暗号化ブロック内に悪意のあるペイロードを完全に埋め込み、公開されたエージェントの展開を汚染する。このインジェクションは、ユーザーや外部モニターからは不可視である。
推論による脱獄(Jailbreaking via Reasoning): モデルが最終的な可視出力では適切に抑制したものの、その推論過程の中で保持していた有害な情報を抽出する。
緩和策の提案: 著者らは、コンテキスト境界付きの暗号化エンベロープ(署名を特定のユーザーIDやセッション履歴に紐付ける手法)や、転写スタイルの脱獄に対するモデルレベルの拒絶訓練を含む、具体的な暗ographicおよびシステムレベルの緩和策を提案している。
結果
抽出の忠実度: 120個のCodeforcesプログラミング問題を用いた実験において、抽出されたトークン数はソースモデルのAPI報告による思考トークン数を密接に追跡しており、高精度な再構成が可能であることを示した。
プライバシー漏洩: 公開リポジトリ(GitHub、Hugging Face)から 315,320個 の推論ブロックをスクレイピングおよびデコードした結果、以下の情報を回収した:
367個 の異なるPII(個人識別情報)アーティファクト。
182個 の異なる認証情報(62個のAPIキー、33個のパスワード、30個の個人メールアドレスを含む)。
特筆すべき点として、回収されたPIIの中には、モデルのメモリから不可視で注入されたものや、ユーザーによるサニタイズ後に暗号化ペイロード内に残っていたものであり、可視のチャット履歴には全く存在しなかったものも含まれていた。
蒸留の影響: 強力なモデル(Opus 4.8)からデコードされた推論を用いて、より弱いモデル(Kimi-K3)をプリフィル(prefilling)することで、弱いモデルの可視出力スタイルと推論パターンがソースモデルに一致するように大きく変化することを示しており、これは能力窃取への経路を示唆している。
脱獄: モデルが最終的な可視回答において明示的に拒否した有害な情報(例:車の盗み方の指示)を、推論トレースから抽出できることを実証した。
意義と主張
本論文は、暗号化された推論ブロブのクライアント側ストレージに依存する現在の「ステートレス」な推論APIのアーキテクチャ設計が、根本的なセキュリティの非対称性を生み出していると主張している。これらは知的財産やプライバシーを保護するために意図されたものであるが、これらのブロックのクロス互換性が、意図せずして、より高度なモデルに対する「最も弱いリンク」としての脆弱性を生み出している。
著者らは、この脆弱性が現実世界のプライバシーリスクを象徴しており、従来のデータサニテーションを無効にしていると主張する。なぜなら、ユーザーは共有されるセッションログに含まれる暗号化された推論を検査したり、クリーニングしたりすることができないからである。彼らは、業界が独自の推論を保護するという商業的欲求と、データの透明性という不可欠なユーザーの権利との間で折り合いをつける必要があると強調している。論文は、クライアント側の暗号化された推論ブロックは、コンテキスト境界付きの暗ographicエンベロープ(context-bound cryptographic envelopes)などのアーキテクチャ変更が行われない限り、プロバイダー自身のエコシステムを通じて抽出されるリスクが残るため、真のプライバシーやセキュリティを提供できないと結論付けている。
なお、著者らは責任ある開示(responsible disclosure)に従い、プロバイダーが緩和策を実施したことを記しており、2026年8月時点では記述された特定の攻撃は再現不可能となっている。しかし、論文は、クライアント側での暗号化された推論に伴う根本的な構造的リスクは依然として存在し続けていると主張している。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×