← 最新の論文
🤖 AI

Synchronized Logit Steering: Real-world Steganography

本論文は、生成された出力自体から共有のロジット分布を導出することにより、送信者と受信者が元のプロンプトの文脈を共有する必要なく、高い情報密度と統計的な隠蔽性を実現し、プロンプトに依存しない隠密な通信を可能にする、大規模言語モデルのための決定論的なステガノグラフィ手法であるSynchronized Logit Steering (SLS) を導入する。

原著者: Andrew Rufail, Aadi Dash, Onir Narahari, Ethan Mui, Mahi Gajare, Prakhar Tiwari, Shrija Makapothula, Nick Cui

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Andrew Rufail, Aadi Dash, Onir Narahari, Ethan Mui, Mahi Gajare, Prakhar Tiwari, Shrija Makapothula, Nick Cui

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

デジタルな会話の静かな響きの中で、人工知能によって生成される言葉の中に、目立たないように潜む新しい種類の秘密の言語が登場しました。ステガノグラフィーとして知られるこの分野は、メッセージの存在そのものを隠蔽し、単なる普通のコミュニケーションの外見だけを残すという、メッセージを徹底的に隠す古来の技術です。メッセージを暗号化して鍵を持たない者には読めなくする暗号学とは異なり、ステガノグラフィーは、メッセージを完全に自然に見え、聞こえるテキストの中に埋め込み、目に見えないものにすることを目指しています。エッセイを書き、数学の問題を解き、会話を行う強力なコンピュータプログラムである大規模言語モデルは、この手法の新たな最前線となりました。これらのモデルは単に事実を検索するのではなく、確率に基づいて文の次の単語を予測し、可能性のある選択肢の範囲から選び出します。この固有の変動性は、文章を書くほぼすべてのステップにおいて、モデルが意味の通る複数の単語の中から選択肢を持っていることを意味します。研究者たちは、これらの選択が、読み手がそこに存在することを知ることなく、隠された情報を運ぶために利用できるのではないかと長年考えてきました。

長年、AI生成テキストにメッセージを隠そうとする試みは、大きな障壁に直面してきました。それは「共有された秘密のコンテキスト」の必要性です。二人の人物が本を鍵として暗号メッセージを送ろうとしている場面を想像してみてください。もし彼らが全く同じ版を持っていない、あるいは異なるページを見ている場合、そのコードは失敗します。同様に、AIテキストにデータを隠すための従来の手法では、送信者と受信者が、同じ確率的な単語リストを計算するために、全く同じ開始指示(プロンプト)を共有している必要がありました。AIシステムがプライベートなデータを取り込んだり、刻一刻と変化する隠された内部指示を使用したりすることが多い現実世界において、この要件は技術を脆弱で非実用的なものにしていました。もし送信者と受信者が同一のコンテキストから始まっていない場合、隠されたメッセージは失われるか、破損してしまいます。Algoverse AIの研究チームは、この依存関係を完全に排除し、二者が同じ開始点を見ることなく隠されたメッセージを交換できる解決策を開発しました。

研究者たちは、この手法を「同期ログ・ステアリング(Synchronized Logit Steering)」と呼んでいます。共有された開始プロンプトに頼る代わりに、このシステムは、すでに書かれたテキストに基づいた共有された理解を構築します。プロセスは標準的な言葉のやり取りから始まります。一定の合意された単語数、具体的には40トークン(AIが処理するテキストの基本単位)が生成されると、送信者と受信者はその既存のテキストを新しい共有リファレンス(参照点)として使用します。この「プロキシ・プロンプト」は共通の基盤として機能します。両者がすでに現れた同じ言葉を見ることができるため、元の開始指示が完全に異なっていても、独立して全く同じ次の単語の確率リストを計算できるのです。この同期により、秘密の初期コンテキストを共有することなく、隠されたコードに合意することが可能になります。

メッセージを送信するために、送信者はこの共有リファレンスによって生成された、次に起こりうる単語のリストを確認します。そして、単に文に適合する単語を選ぶだけでなく、そのリストにおける位置が隠されたデータの一部に対応するように特定の単語を選択します。例えば、隠されたメッセージが数字の「5」を必要とする場合、送信者はリストの中で5番目に可能性の高い単語を選択します。受信者は、同じ単語を見て、かつ同じ確率リストを知っているため、単にその単語の位置を数えることで「5」という数字を取り出すことができます。これは繰り返し行われ、システムは選択した単語が不自然であったりロボットのようであったりしないように、「エントロピー」、つまり不確実性の量をチェックします。システムは、より一般的でない単語を選ぶことが奇妙に聞こえないほどモデルが不確実である場合にのみ、データを隠します。

チームはこの手法を、一般的な会話、複雑な数学的推論、ソフトウェアエンジニアリングの問題を含む幅広いタスクでテストしました。彼らは、最初の40単語が確立されると、隠されたメッセージを含むテキストと通常のテキストとの間の統計的な差は無視できるほど小さくなることを見出しました。技術的な観点から言えば、両方のタイプのテキスト間のダイバージェンス(乖離)は臨界閾値を下回り、これは隠されたメッセージが通常の文章と統計的に区別がつかないことを意味します。また、研究者たちは、このプロセスをバースト(断続的な放出)として繰り返すことで、隠される情報の量を大幅に増やすことができることも発見しました。彼らが「周期的なバースト(periodic burst)」と呼ぶ最も効果的な構成では、以前の単一メッセージの試みよりも約10倍多くのデータを埋め込むことができ、0.20ビット/トークンの密度を達成しました。これは、AIが書いた単語ごとに、会話の流れを変えることなく、少量のビットの秘密情報が正常に埋め込まれたことを意味します。

この手法の成功にもかかわらず、研究者たちは、複雑なタスクの中に隠されたメッセージを詰め込んだ際のトレードオフについても指摘しています。システムが数学的推論やソフトウェアコードの中にデータを隠そうとすると、AIの回答の正確性がわずかに低下しました。これは、メッセージを運ぶために特定の単語を選ぶよう強制することが、困難な問題に求められる厳密な論理の道筋からモデルを逸脱させてしまうことがあることを示唆しています。研究者たちは、実世界のアプリケーションにおいては、システムがテクニカルなモードにあることを認識し、メッセージの隠蔽を停止し、より会話的または記述的な部分のためにこの技術を保留するような、スマートな仕組みを備えるべきだと提案しています。このような適応的なアプローチは、安全なコンテキストにおける隠密な通信を可能にしつつ、AIの推論の質を維持することになります。

この研究の含意は二重です。一方で、これは、共有された秘密の鍵を必要とせずにAIコンテンツにウォーターマーク(電子透かし)を入れたり、テキストの起源を検証したりするための堅牢な方法を示しており、知的財産の保護に役立つ可能性があります。他方で、これはAIシステムがどのようにコミュニケーションをとるかという脆弱性を浮き彫りにしており、エージェントが人間の監視なしにデータを抽出したり、調整を行ったりする可能性があることを示しています。研究者たちは、これらの隠されたチャネルがどのように構築されるかを理解することが、それらに対する防御を築くための第一歩であると強調しています。彼らは、将来のセキュリティシステムが、単語の選択における異常なパターンを監視するか、あるいはこの同期を可能にする統計的なシグネチャーを撹乱できる可能性があると示唆しています。最終的に、この研究は、AIテキストの中にメッセージを隠す能力が単なる理論的な可能性ではなく、自然な言語の流れの中で静かに機能し、探し方を知る者が発見するのを待っている、実用的な現実であることを裏付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →