Mechanistic Interpretability of Cognitive Complexity in LLMs via Linear Probing using Bloom's Taxonomy
本研究は、大規模言語モデルがブルームのタキソノミーによって定義される認知的複雑性のレベルを内部表現の線形分離可能な部分空間にエンコードしていることを示しており、高い分類精度を達成するとともに、認知的な困難さがフォワードパスの早い段階で解決されていることを示唆している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、超スマートなロボットがどのように思考しているのかを解明しようとしているところだと想像してみてください。長い間、科学者たちはこれらのロボット、すなわち「大規模言語モデル(LLM)」を、魔法のブラックボックスのように扱ってきました。質問を入力すると完璧な答えが飛び出してきますが、誰もそのロボットがどのようにしてそこに辿り着いたのかを知りません。それはまるで、キッチンや材料を一度も見ることなく、シェフがグルメな料理を作る様子を眺めているようなものです。最近では、「メカニスティック・インタープリタビリティ(機械論的解釈可能性)」と呼ばれる分野が、ロボットの脳内の回路をマッピングしようと、そのキッチンの中を覗き込み始めています。彼らが投げかける大きな問いの一つは、「ロボットは実際にタスクの難易度を『理解』しているのか、それとも単に見えている言葉に基づいて推測しているだけなのか?」というものです。この問いに答えるために、研究者たちは「ブルームのタキソノミー(教育目標分類学)」という有名な教育ツールを使用します。これは、思考スキルの梯子(はしご)のようなものです。一番下の段は単純な記憶(事実を暗唱すること)であり、一番上の段は高度な創造性(新しいものを設計すること)です。もしロボットが本当に賢いのであれば、人間が日付を暗記することから複雑なミステリーを解くことに移行する際と同様に、タスクの難易度が梯子を登るにつれて、ロボットの内部的な脳信号も変化するはずです。
この論文は、ロボットの思考がこの難易度の梯りに従って整理されているかどうかを確認するために、拡大鏡を持ってロボットの脳を精査しています。研究者のビアンカ・ライモンディとマウリツィオ・ガブリエッリは、単にロボットに質問をしただけではありません。ロボットが考えている間の電気信号(活性化)を観察しました。彼らは4つの異なる人気のあるロボットの脳(Llama、Qwen、Gemma、DeepSeek)を使い、単純な「これを定義せよ」というタスクから、複雑な「新しいシステムを設計せよ」という挑戦まで、1,128の質問を用いてテストしました。彼らが知りたかったのは、「ロボットの脳データの中に単純な記憶タスクを行っているのか、それとも複雑な創造的タスクを行っているのかを判別できる、単純な一本の直線を描けるか?」ということでした。
その答えは、驚くほどの「イエス」であり、それは非常に速く起こります。チームは、ロボットが文章を処理し始めるとすぐに(脳の最初の数層の段階で)、そのタスクがどれほど難しいかをすでに理解していることを見出しました。彼らはこの瞬間を「認知的分離の開始(Cognitive Separability Onset)」と呼んでいます。それは、ロボットに「難易度スイッチ」があり、それがほぼ即座にオンになるようなものです。これらのモデルの30層から36層のうちの第5層までに、「記憶」のためのロボットの脳信号は、「創造」のためのものとは明確に異なっており、単純な数学的ツールを使えば約90%の精度でそれらを判別できます。それはまるで、ロボットが仕事の難易度に基づいて思考を整然とした別々のグループへと分類しており、回答を書き始める前にこれを行っているかのようです。
さらに面白いことに、ロボットは非常に人間らしい方法で間違いを犯します。ロボットが混乱する場合、通常は梯子の上で隣り合っているステップを混同します。例えば、「分析」と「評価」を混同することはあっても、「記憶」と「創造」を混同することはほとんどありません。このことは、ロボットが単にランダムなラベルを暗記しているのではなく、教育理論が意図した通り、難易度が滑らかで秩序ある一列のラインとして配置されたメンタルマップを構築していることを示唆しています。
ロボットが単純な手がかり(例えば、「設計」は通常「難しい」ことを意味し、「リストアップ」は「簡単」であることを意味するということに気づくこと)を見てズルをしていないことを確認するために、研究者はコントロールテストを実施しました。彼らは、ロボットの脳を見ることなく、ページ上の言葉だけを使って難易度を推測しようと試みました。これらの単純な単語カウント手法は惨敗し、精度は約73%にとどまり、エラーはランダムで散発的でした。これは、ロボットが単にプロンプトを読んでいるだけでなく、タスクの難易度に関する複雑な内部表現を構築していることを証明しています。
最後に、チームはロボットの脳を「操舵(ステアリング)」することを試みました。彼らは、より「高い難易度」に向かう方向を示す、特定のロボットの脳信号の方向を見つけ出しました。彼らがその方向にロボットの脳を押し進めると、ロボットの回答は実際に変化しました。もし単純な質問を「創造的」な方向へと押し進めれば、ロボットはより複雑で分析的な回答をし始めました。しかし、もし押し進めるタイミングが遅すぎたり、押しが強すぎたりすると、ロボットは言葉を吃ったり繰り返したりし始めました。これは、この「難易度の方向」が、単なる受動的なパターンではなく、ロボットがどのように考えるかにおける実用的で機能的な部分であることを示しています。
要約すると、この論文は、これらのAIモデルが組み込まれた、測定可能な認知的な複雑さの感覚を持っていることを示唆しています。彼らは単に言葉を処理しているのではありません。彼らは単純な事実から複雑なアイデアまでを、構造化された線形的な方法で整理し、難易度の梯りに従って内部の思考を組織化しているのです。この発見は、私たちがブラックボックスの中を覗き見るための新しい方法を与えてくれます。つまり、少なくともある意味において、これらのモデルは私たちと同じように「思考」を整理しているということを理解させてくれるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。