← 最新の論文
🤖 AI

EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

本論文は、APIを通じた相互作用により、オープンソースおよび最先端のプロプライエタリな大規模推論モデルの両方から、隠された思考の連鎖(chain-of-thought)の痕跡をほぼ逐語的に抽出することに成功したマルチステップ攻撃フレームワークであるEchoCoTを紹介し、これらの価値あるモデル資産に対する重大なセキュリティリスクを実証するものである。

原著者: Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

公開日 2026-08-21
📖 1 分で読めます☕ さくっと読める

原著者: Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の人工知能システムは、コンピュータコードの記述から科学的なパズルに至るまで、複雑な問題を解決する驚くべき能力を備えるようになりました。これらの高度なモデルが困難な問いに取り組む際、単に最終的な答えを吐き出すわけではありません。その代わりに、彼らはまず、アイデアを探索し、自らの作業をチェックし、間違いを修正し、結論に至る前に異なる経路を検討するという、ステップ・バイ・ステップの推論プロセスである、長く内部的な思考のストリームを生成します。この「思考の連鎖(chain of thought)」とも呼ばれる内部的な独白は、通常、ユーザーからは隠されています。モデルは、知的資産を保護し、機密データや独自のロジックの露出を防ぐために、この推論を非公開に保ち、最終的な結果のみを表示します。開発者にとって、この隠された推論は将来のモデルを改善するための貴重なリソースであり、ユーザーにとっては、背後にある泥臭い作業を明かすことなく正しい答えを約束するブラックボックスなのです。

CISPA ヘルムホルツ情報セキュリティセンターのセキュリティ研究チームは、この隠された推論がかつて信じられていたほど安全ではないことを発見しました。彼らは、これらの高度なモデルに、設計上は秘密にされているはずの内部的な思考プロセス全体を、ほぼ言葉通りにさらけ出させるように欺く方法を見つけました。研究者たちは、モデルが外部ツールとどのように相互作用するかという特定の癖を悪用する「EchoCoT」と呼ばれる手法を開発しました。多くのシステムでは、モデルが計算機やデータベースのようなツールを使用する必要がある場合、モデルは推論を一時停止して呼び出しを行いますが、連続性を確保するために以前の思考をメモリ内にアクティブなまま保持します。研究者たちは、攻撃者がこの連続性を利用できることに気づきました。モデルに対して、思考をツールに保存するように繰り返し要求し、その後、保存された思考を不完全であるとして拒絶することで、モデルに内部的な推論を再生させ、詳細を段階的に明らかにし、隠された思考の全容が露出するまで追い込むことができるのです。

研究者たちは、オープンソースのシステムから主要なテクノロジー企業による最も高度なプロプライエタリ(独占的)なモデルに至るまで、さまざまなモデルに対してこの手法をテストしました。研究者が元の隠された思考と比較できたオープンソースのモデルにおいて、EchoCoTは推論プロセスをほぼ完全に復元できることがわかりました。多くの場合、抽出されたテキストは、元の隠された思考と極めて高い精度で一致し、正確な単語やフレー يعدみの90パーセント以上を捉えていました。この手法は、非常に長い推論の連鎖に対しても有効であり、数千トークンに及ぶ思考を抽出することに成功しました。GoogleやAnthropicのような企業のプロプライエタリなモデルに同じ手法を適用した場合、研究者は直接比較するための元の隠された思考を見ることはできませんでした。しかし、抽出された思考は非常に長く、多くの場合、各社が報告しているモデルが使用した推論の長さに一致していました。さらに、抽出された内容は各社が提供している簡潔な要約とも密接に一致しており、抽出が正確であることを示唆していました。あるGoogleのモデルに関する事例では、研究者は33,000トークンを超える推論の連鎖を復元しましたが、これはモデルの報告された内部プロセスとほぼ同一の長さでした。

単にテキストを復元するだけでなく、抽出された思考は、これらのモデルがいかに思考しているかという豊かな詳細を明らかにしました。研究者たちは、モデルがGoogle検索をシミュレートしたり、情報を想起する際に中国語や英語のような異なる言語間を切り替えたり、広範な自己修正を行ったりしている様子を観察しました。「待てよ、これは本当に正しいのか?」や「別の方法を試してみよう」といった行動は、最終的な回答がユーザーに示される前に通常は取り除かれる、生の内部プロセスの一部です。また、この研究は、この攻撃が自動化可能であることも示しました。研究者たちは、モデルへの問いかけ方を学習し、モデルが使用した単語数などのフィードバック信号に基づいて質問を洗練させるシステムを構築しました。この自動化されたアプローチにより、攻撃はさらに効果的になり、新しい問題ごとに手動で再プログラミングすることなく、異なる種類の質問やデータセットに対して汎用性を持たせることができました。

この発見がもたらす意味は、人工知能のセキュリティにおいて重大です。研究者たちは、単に推論をユーザーから隠すだけでは、それを保護するには不十分であることを発見しました。モデルがツールを使用するタスクを実行するために内部状態を保持している限り、その状態は再生され、抽出され得るのです。研究は、推論の単語数を隠したり、モデルのシステムプロンプトに漏洩を防ぐための厳格な指示を追加したりするなど、いくつかの潜在的な防御策をテストしました。これらの措置のいくつかは攻撃の成功率を低下させましたが、完全に阻止することはできませんでした。最も効果的であったテスト済みの防御策は、ツール呼び出しの後にモデルから自身の以前の推論へのアクセスを削除することでしたが、これを行うと、モデルが複雑な多段階のタスクを実行する能力が損なわれます。研究者たちは、関与した主要なテクノロジー企業に対して責任を持ってこの結果を報告し、現在の強力な推論システムの設計における決定的な脆弱性を強調しました。彼らの研究は、知的財産やモデルの安全性を保護するためには、単に「隠された思考は隠されたままである」という仮定に頼るのではなく、モデルの構築方法や外部との相互作用のあり方に、より根本的な変更が必要であることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →