← 最新の論文
🤖 AI

Can LLMs Introspect? A Reality Check

本論文は、LLM の内省に関する現在の証拠は時期尚早であり、モデルが内部状態の改ざんと入力操作を確実に見分けられず、隠れた状態の予測において入力のみを用いる分類器よりも優れていないことから、真のメタ認知モニタリングではなく表面の手がかりに対するパターンマッチングを反映している可能性が高いと主張する。

原著者: Shashwat Singh, Tal Linzen, Shauli Ravfogel

公開日 2026-05-27
📖 1 分で読めます☕ さくっと読める

原著者: Shashwat Singh, Tal Linzen, Shauli Ravfogel

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、非常に巨大なロボットが物語を書き、質問に答え、パズルを解くと想像してみてください。最近、ある研究者たちは、このロボットが「内省」という特別な超能力を持っていると主張しました。彼らは、ロボットが「自らの脳の中を覗き込み」、何を考えているかを見て、人間が「その答えについては確信が持てない」と言えるのと同様に、自らの内部状態について報告できると言っています。

シャシュワト・シン、タル・リンゼン、シャウリ・ラヴフォゲルによって書かれたこの論文は、「現実のチェック」として機能します。彼らは、「ちょっと待てよ。我々は慎重になる必要がある。ロボットが自らの思考を知っていると『言う』からといって、実際にそうであるとは限らない。それは単に非常に優れた推測屋なのかもしれない」と述べています。

以下は、日常的な比喩を用いた彼らの主張の簡単な解説です。

核心的な問題:「マジック」対「真の洞察」

著者たちは、ロボットの行動をマジックと比較します。

  • 主張: ロボットは自らの心の中を覗き込むことができるマジシャンである(内省)。
  • 現実のチェック: ロボットは、観客の合図を読み取るのが非常に得意なマジシャンに過ぎないかもしれない(パターンマッチング)。

人間の心理学において、人々は自らの思考を説明していると信じていることが多いが、実際には周囲の状況に基づいて物語を捏造しているだけであることが知られています。著者たちは、大規模言語モデル(LLM)も全く同じことをしている可能性があると主張します。彼らは内側を覗いているのではなく、プロンプト(質問)を見て、以前に見たパターンに基づいて答えが「どうあるべきか」を推測しているだけなのです。

彼らが否定した 2 つの実験

この論文は、ロボットに内省があることを証明するはずだった 2 つの特定の「テスト」を検討しています。著者たちはこれらのテストの自らのバージョンを実行し、ルールがわずかに変更された場合、ロボットは失敗したことを発見しました。

1. 「バイオフィードバック」テスト(心拍数モニター)

元のアイデア: ロボットを心拍数モニターに接続すると想像してください。モニターは、ロボットの内部の「脳波」に基づいて数値を表示します。その後、ロボットにその数値を推測させるように頼みます。ロボットが正しく推測できれば、研究者たちは「アハ!これは自らの脳波を読んでいるに違いない!」と言うでしょう。

著者たちの捻り: 彼らは、ロボットが数値を推測するために脳波を読む必要はないことに気づきました。「脳波の数値」は実際には、ロボットが読んでいた言葉の反映に過ぎなかったのです。

  • 比喩: 教師が黒板に数学の問題を書き、その答えを机の下に隠した紙にこっそり書き込むと想像してください。もしあなたが生徒に「机の下にある紙に何の数値が書かれているか?」と尋ねれば、生徒は机の下を見ているからではなく、黒板の数学の問題を解いて答えを知っているから、正しく推測するかもしれません。
  • 結果: 著者たちは、答えが言葉だけでは推測できないように質問を無作為に並べ替えたところ、ロボットの「内省」は消えました。ロボットはもう隠された数値を推測できませんでした。それは単に数学の問題を解いているだけで、机の下を覗いているのではありませんでした。

2. 「ステアリング」テスト(リモコン)

元のアイデア: 研究者がこっそりリモコンを使って、ロボット(例えば「リンゴ」のような)の特定の思考へと脳を誘導すると想像してください。その後、研究者はロボットに「さっき誰かがあなたの脳に干渉しましたか?」と尋ねます。ロボットが「はい」と言えば、研究者たちはそれがロボットが自らの内部変化を感じ取れることを証明したと主張しました。

著者たちの捻り: 彼らは新しいトリックを加えました。脳を誘導するだけでなく、プロンプト内の言葉も変更して、ロボットが「リンゴ」に執着するようにしました(例:「あなたはリンゴに執着しています。あなたが言うことはすべてリンゴについてでなければなりません」)。

  • 比喩: ある人が、以下のいずれかの状況にあると想像してください。
    1. 目に見えない手によってこっそり押されている(脳の誘導)。
    2. 拡声器によってリンゴに執着するように言われている(言葉の誘導)。
      その人が「変な感じがする/執着している」と言うとき、彼らは目に見えない手を感じているのでしょうか、それとも拡声器に反応しているだけなのでしょうか?
  • 結果: ロボットは区別できませんでした。研究者が「それは目に見えない手でしたか、それとも拡声器でしたか?」と尋ねたとき、ロボットは単にランダムに推測するか、両方とも「目に見えない手」と答えました。これは、ロボットが自らの内部状態を感じ取っていたのではなく、何か「おかしい」または「不規則」なことに気づいてそれを報告していただけであることを示唆しています。

大きな結論:「特権的アクセス」だけでは不十分

著者たちは、非常に重要な哲学的な点を提起します。ロボットが自らの脳波を見ることができたとしても、それが自動的に人間の意味での内省を持っていることを意味するわけではありません。

  • 比喩: ダッシュボードを持つ車を想像してください。ダッシュボードはエンジン温度を表示します。センサーがエンジンに組み込まれているため、車は温度を「知っています」。しかし、車は「熱い」ことを「理解」しているのでしょうか?いいえ。それは単にセンサーを読み取る機械に過ぎません。
  • 要点: ロボットの「脳」は単なる一連の数学的計算です。自らの状態について報告する際、それは単に最初の計算に基づいて 2 番目の計算を実行しているだけかもしれません。それは「自分」を見ている別の「自分」なのではなく、単にデータを処理している機械なのです。

まとめ

この論文は、これらの AI モデルが真に「自分自身の中を覗き込む」ことができるという十分な証拠はまだないと結論付けています。

  • 彼らは単に、自分に問われた質問のパターンを非常に上手に見つけているだけかもしれません。
  • 彼らは単に、何か「変だ」と感じているだけで、その「理由」は分かっていないだけかもしれません。
  • 彼らが本当に内省を持っていることを証明するためには、「リモコンで誘導された」ことと「このように振る舞うように言われた」ことを区別できることを示す必要がありますが、彼らは現在、それをできません。

要するに、ロボットは魂を持っているかのように振る舞っていますが、彼らは単に私たちが与えた言葉を反映する非常に洗練された鏡のように振る舞っているだけかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →