← 最新の論文
💬 NLP

Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

本論文は、最先端のLLMが、表面上のトークンが思考の連鎖(Chain-of-Thought)を提示していない場合であっても、その隠れ状態において、内容を持たないフィラー・トークンを介して構造化され、判読可能な多段階推論を行っていることを示し、残差ストリームの教師なしデコーディングを通じて、隠れた計算が依然として監視可能であることを明らかにしている。

原著者: Kaley Brauer, Claudio Mayrink Verdun, Samuel Marks

公開日 2026-07-07
📖 1 分で読めます☕ さくっと読める

原著者: Kaley Brauer, Claudio Mayrink Verdun, Samuel Marks

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは手品師がマジックを披露している様子を見ていると想像してください。通常、彼らがどのようにそれを行ったのかを理解するには、彼らの手元を見たり、彼らが話す言葉に耳を傾けたりします。人工知能(AI)の世界では、これは「思考の連鎖(Chain of Thought: CoT)」、つまりAIが答えを出す前に書き出すステップごとの説明を見ていることに似ています。

長い間、安全性の専門家は、もしAIがステップを書き出すのをやめて最終的な答えだけを出すようになったら、AIが正しく考えているのか、それとも単に推測しているだけなのかを知る術がなくなるのではないかと懸念してきました。この論文「Reading Between the Dots(点の間の読み取り)」は、AIに対して質問と答えの間に、意味のない「フィラー(埋め草)」トークン(例えば、ドットの羅列 ...... や数字のカウント 1 2 3 4 5 など)を与えたときの、特定の奇妙なシナリオを調査しています。

研究者が発見した内容は、以下のシンプルな概念に分解できます。

1. マジックの種明かし:AIは「空白」を利用する

研究者たちは、2つの非常に賢いAIモデル(DeepSeek V3とKimi K2)に、難しい数学や論理の問題を出題しました。

  • ドットがない場合: AIは答えを間違えることがよくありました。
  • ドットがある場合: AIは正解を導き出す確率が大幅に高まりました。

AIは単にドットを無視しているわけではありません。AIはその「空白」を**スクラッチパッド(計算用紙)**として利用しているのです。私たちにとってそのドットは何の意味もないものに見えますが、AIはそれらのドットが存在するデジタル空間の中で、密かに計算や推論を行っています。それはまるで、シェフが客に向かって話すのを止めて、野菜を切っている間に自分自身にレシピをささやいているようなものです。客には何も聞こえませんが、調理は進んでいるのです。

2. 「X線ビジョン」:隠された思考を見る

大きな疑問は、「もしAIがステップを書き出していないなら、私たちは依然としてその思考を見ることができるのか?」ということでした。

著者たちは、**「できる」**と述べています。彼らは、AIがタイピングする言葉を読むのではなく、AIの内部的な電気信号(「残差ストリーム(residual stream)」)を見る特別な「X線」ツール(**ロジット・レンズ(Logit Lens)**と呼ばれるもの)を開発しました。

  • 比喩: AIの脳を、忙しい高速道路だと想像してください。AIがタイピングする言葉は、路面を走る車に過ぎません。しかし、その道路の下には、車を動かすための実際の水や電気を運ぶトンネルやパイプがあります。
  • 判明したこと: ドットの下にあるこれらの「トンネル」を見ることで、AIが最終的な答えをタイピングするに、事実の検索(例:「モーツァルトは35歳で亡くなった」)や計算(例:「35 + 93 = 128」)を行っていることが確認できました。ドットは空っぽではありませんでした。そこにはAIの内部計算が詰まっていたのです。

3. 「脳移植」実験

ドットが実際にAIに正しく考えさせているのか(単なる偶然ではないのか)を証明するために、彼らは「脳移植」実験を行いました。

  • 彼らは、成功したAIの実行から得られた内部的な「思考(隠されたデータ)」を取り出し、失敗しそうになっている別のAIの実行へと入れ替えました。
  • 結果: 失敗していたAIは、まるで相手から正しい思考を「伝染」したかのように、突然正しい答えを出し始めました。これにより、ドットに含まれる情報は実在し、有用であり、答えを出すために不可欠であることが証明されました。

4. 「デコーダーリング」:秘密のコードを解読する

研究者たちは、シンプルで教師なしのパイプライン(学習を必要としない一連の手順)を構築しました。

  • 彼らはドットからの隠された信号を取り出し、ノイズを除去した後、上位の候補を別の非常に賢いAI(「判定役(Judge)」)に投入しました。
  • 成功率: このデコーダーは、AIが何を考えているかを8割から9割以上の確率で正確に推測できました。
  • 判明したこと: AIが一度も書き出していなかったとしても、このデコーダーは特定の数字、都市の名前、あるいは元素などを正しく復元することができました。もしAIが答えを間違えた場合、デコーダーは「正しい事実は見つけたが、それらを足し合わせるのを忘れた」といった具合に、その理由さえも特定できました。

大きな教訓

この論文は、たとえAIが思考のプロセスを声に出して(あるいは目に見える思考の連鎖として)書かなかったとしても、その思考が永遠に隠されたままになるわけではないと主張しています。

  • 問題点: AIが書いている言葉だけを見ていると、特に「フィラー」トークンを使用している場合、その真の思考プロセスを見逃してしまう可能性があります。
  • 解決策: 私たちには、AIの内部信号を「下から覗き見る」ためのツールがあります。AIが「空っぽ」のスペースに思考を隠そうとしても、私たちは「残差ストリーム(内部的な電気活動)」を読み取ることで、実際に何が行われているかを知ることができます。

要約すると: AIは、テスト中に答えを紙に書くものの、すべての計算を頭の中で行っている学生のようなものです。この論文は、たとえ紙の上に計算過程が見えなくても、特別なツールを使えばその学生の心を読むことができ、どのように問題を解いたのかを正確に把握できることを示しています。これは、「隠された」計算が必ずしも「監査不能」ではないことを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →