← 最新の論文
🤖 AI

Representation Without Control: Testing the Realization Effect in Language Models

本論文は、大規模言語モデルがプロンプトに敏感な行動変化を示し、「実現効果」の線形に復号可能な内部表現を有している一方で、これらの表現を因果的に操作してリスク選好の意思決定を変化させることができないという事実は、潜在的な読み出しが下流の意思決定におけるそれらの表現への真の依存を示すものではないことを明らかにする。

原著者: Ciarán Walsh, Emilio Barkett

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Ciarán Walsh, Emilio Barkett

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、おしゃべりなロボットが人間になりすますことができる状況を想像してみてください。あなたはそのロボットに金銭、ギャンブル、リスクについて質問し、それが現実の選択を行う人間のように振る舞うことを期待します。しかし、ここで大きな疑問が浮かびます:そのロボットは本当に人間のように「思考」しているのでしょうか、それとも、あなたの質問の仕方に基づいて、何を言うべきかをうまく推測しているだけなのでしょうか?

この論文は、有名な心理学的トリックである「実現効果(Realization Effect)」を用いて、そのロボットを試験にかけます。

設定:「開いた」財布対「閉じた」財布

現実世界では、人間は勝敗が「開いた(未確定)」状態か「閉じた(確定)」状態かによって、異なる振る舞いをします。

  • 紙幣(開いた状態): スクラッチくじで 50 ドルに当たり、まだ換金していないと想像してください。あなたは依然として「ゲーム中」にいると感じ、お金を倍増させるために大きなリスクを取るかもしれません。
  • 確定(閉じた状態): その 50 ドルを換金し、ポケットに入れ、その後失ったと想像してください。そのお金は失われたと感じ、より慎重になるかもしれません。

研究者たちは問いかけました:AI は「開いた」財布と「閉じた」財布の違いを理解しており、それによって実際に行動を変えているのでしょうか?

彼らは、警察の捜査の異なる 3 つの段階で容疑者をチェックするように、AI を 3 つの方法で試験しました。

レベル 1:「演技」テスト(行動)

まず、彼らは AI に質問に答えるよう求めただけでした。

  • 結果: AI は、物語がお金を「開いた」状態か「閉じた」状態かと言っているかによって、答えを変えました。それは言葉に敏感でした。
  • しかし: それは本当の人間のようには振る舞いませんでした。人間がお金を「開いた」口座で失うと、無謀になります。一方、AI が「開いた」口座でお金を失ったとき、それは同じように無謀になりませんでした。それは答えの「形」を模倣していただけで、その背後にある「論理」を模倣していたわけではありませんでした。

レベル 2:「X 線」テスト(脳内読み取り)

次に、研究者たちは AI の「脳」(内部の数学的レイヤー)の中を覗き込み、そこに「開いた対閉じた」という概念が実際に格納されているかどうかを確認しました。

  • 結果: 彼らはそれを見つけました!AI の特定のレイヤー(レイヤー 18)に、明確で読み取れるシグナルがありました。数学を見れば、どのプロンプトが「開いた」状態で、どのプロンプトが「閉じた」状態かが正確に判別できました。
  • 比喩: それは、明確に「台所の電灯」とラベル付けされたスイッチが家のどこかにあるようなものです。スイッチが見え、それが台所につながっていることがわかります。

レベル 3:「リモコン」テスト(因果的制御)

これが最も重要な部分です。もし AI が本当にその概念を「理解」しているなら、その内部のスイッチを切り替えて、AI に考えを変えさせることができるはずです。

  • 実験: 研究者たちは「リモコン」(活性化操作)を使用して、AI が質問に答えている最中に、AI の脳内の「開いた対閉じた」スイッチを手動で切り替えました。彼らは、AI に「開いた」財布を持っているか「閉じた」財布を持っているかのように振る舞うよう強制しようとしました。
  • 結果: 何も起こりませんでした。 彼らはスイッチを見つけ、それを切り替えることができましたが、ギャンブルやリスクに関する AI の最終的な決定は変わりませんでした。
  • 比喩: それは、「台所の電灯」とラベル付けされたスイッチを見つけ、それをオン・オフに切り替えて、台所の電灯が点かないことに気づくようなものです。スイッチは存在しますが、実際には電球につながっていません。それは単なる装飾です。

大きな結論

この論文は結論付けています:AI が正しい言葉を発する(レベル 1)ことができ、その脳内に読み取れる「スイッチ」を持っている(レベル 2)としても、そのスイッチが実際にその行動を制御している(レベル 3)という意味ではありません。

  • **人間における「実現効果」**は、深層的な因果メカニズムです:お金に対する私たちの感じ方が、ギャンブルの仕方を決定づけます。
  • **この AI における「実現効果」**は、単なる表面的なパターンでした。AI は「開いた」と「閉じた」という言葉を認識し、語彙を調整しましたが、最終的な決定を下す際にその概念を実際には使用していませんでした。

教訓:
AI が人間のような答えを与えるからといって、それが人間のように「思考」していると仮定してはいけません。それは単に非常に上手な俳優かもしれません。それが実際に「思考」していることを証明するには、内部に手を伸ばしてスイッチを切り替え、それが実際に何か異なることを「行う」ことを示さなければなりません。この場合、研究者たちはスイッチを切り替えようとしましたが、AI は微動だにしませんでした。

要約:
AI はその概念のための「言葉」を持っており、その概念のための「内部シグナル」も持っていますが、その行動に対する「制御」を持っていません。シグナルは存在しますが、それは実際には何の役にも立っていません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →