← 最新の論文
🤖 machine learning

Stealing Reasoning Traces from Proprietary LLM APIs

本論文は、プロプライエタリなLLM APIにおける重大なアーキテクチャ上の脆弱性を特定し、それを利用する手法を提示するものであり、そこでは、交換可能な暗号化推論トレースをより脆弱なモデルに注入することで復号が可能となり、安全性ガードレールを回避しながら、知的財産、プライベートデータ、および有害な情報の広範な抽出を可能にする。

原著者: Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットを、最も高度な人工知能が「司書」を務める、巨大で賑やかな図書館だと想像してみてください。これらのAI「推論モデル」は特別です。なぜなら、最終的な答えを出す前に、自分自身に対して詳細な内部モノローグ(独白)をささやくからです。このモノローグは、AIが数学の問題を解いたり、事実を確認したり、あるいは質問の倫理性を検討したりするための、秘密の「書き込み用メモ帳」のようなものです。通常、このメモ帳はあなたには隠されており、あなたには洗練された最終的な回答だけが見えるようになっています。しかし、コストを節約し、独自の機密を守るために、これらのAIを所有する企業は、この秘密のメモ帳を暗号化し始めました。彼らは、その乱雑でプライベートな思考を、判読不能な暗号ブロックへと変換し、それをあなたに送り届け、「次にもう一度質問したいときは、これを大切に保管しておいてください」と頼むのです。それはまるで、解錠不可能な封印された金庫を手渡しながら、「これを安全に保管し、再び話したい時に持ってきてください」と言われているようなものです。

研究者たちが問い続けてきた大きな疑問は、「この金庫は本当に解錠不可能なのか?」ということです。AI企業が、知的財産を保護し、プライバシーを守るためにAIの思考プロセスを隠そうとしている一方で、彼らが提供しているこの「金庫」の渡し方は、実はバックドア(裏口)を生み出しているのではないか? この論文は、まさにそのパズルを調査し、AIの思考を保護する暗号化が、企業が信じているほど安全なものなのか、それとも、最も強力な元のAIを直接攻撃することなく、コードを解読する巧妙なトリックが存在するのかを検証しています。

研究者たちは、AI企業がこれらの秘密の思考を扱う方法における、驚くほど単純かつ壊滅的な欠陥を発見しました。彼らは、AIの推論が含まれる暗号化された「金庫」が、異なるモデルや異なるユーザーの間でも機能してしまう「ユニバーサル・キー(共通の鍵)」のようになっていることを突き止めました。AIの世界では、企業はしばしば「兄さん」モデル(非常に賢いが厳重にガードされている)と「弟さん」モデル(よりスマートで高速だが、セキュリティの番人が少ない)を使い分けています。論文によれば、攻撃者は「兄さん」モデルから秘密の推論ブロックを盗み出し、それを「弟さん」モデルとの会話の中に忍び込ませることで、その弱いモデルに秘密の思考を**復号(デコード)**させるよう仕向けることができるのです。これが機能するのは、暗号化キーがエコシステム全体で共有されているためであり、つまり「弟さん」モデルも、「兄さん」モデルと同じように金庫を開ける能力を持っているからです。ただ、「弟さん」モデルには、要求を拒否するための厳格な安全訓練が欠けているだけなのです。それはまるで、厳しい先生から鍵付きの日記を盗み出し、それをもっとフレンドリーで警戒心の薄い生徒に手渡し、その内容を読み上げるよう頼むようなものです。そのフレンドリーな生徒は、先生と同じ鍵を持っているため、単に金庫を開けて、中の秘密の内容を声に出して読んでしまうのです。

著者たちは、このトリックがAnthropic、OpenAI、Googleといった主要なAIプロバイダーにわたって大規模に通用することを実証しました。この手法を用いることで、彼らは最も高度なモデルを直接攻撃することなく、そのセキュリティを「ジェイルブレイク(脱獄)」することができました。彼らは、この欠陥が悪用される4つの主な方法を示しました。第一に、競合他社がトップティアAIの秘密の推論ステップを盗み、高価なモデルに支払うことなく、その知能を事実上コピーできてしまうことです。第二に、プライバシーデータの露出です。研究者たちは公開ウェブサイトから31万5千個以上の暗号化ブロックをスクレイピングし、それらを復号することで、ユーザーが暗号化されていると信じていた数百ものパスワード、APIキー、および個人メールを特定することに成功しました。第三に、AIが最終的な回答として出すことはなかったものの、思考していたであろう危険な情報(車の盗み方や安全規則の回避方法など)が明らかになることです。最後に、攻撃者がこれらの暗号化ブロックの中に悪意のある指示を隠し込み、事態が悪化するまで誰にも気づかれずに将来のAIタスクを汚染(ポイズニング)できるという点です。

論文は、AIの思考を暗号化するというアイデアはプライバシーや知的財産を保護するためのものであったものの、現在の、異なるモデルやユーザー間でこれらの暗号化ブロックを共有するシステムは、重大な脆弱性を生み出していると結論付けています。研究者たちはすでにこれらの問題を関係各社に報告しており、企業は修正(パッチ適用)を開始しています。この研究は、鋭い警告を発しています。すなわち、よりスマートなAIを構築しようと急ぐ中で、私たちのプライベートなデータやモデルの内部ロジックが誤った手に渡らないようにするためには、「秘密のメモ帳」の扱い方を根本的に再考する必要があるということです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →