Mechanistic Interpretability of Chain-of-Thought Reasoning via Sequential Activation Patching
本論文は、トークン位置にわたって時間的に拡散する影響を追跡し、標的を絞ったアブレーションを通じてその機能的重要性を検証することにより、大規模言語モデルにおける思考の連鎖(Chain-of-Thought)推論を因果的に支える分散型アテンションヘッド・サブサーキットを特定するための、逐次的活性化パッチング・フレームワークを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルは、人間のようなテキストを生成し、問題を解決し、質問に答えることができる、現代の人工知能ツールの背後にあるエンジンです。これらのモデルが難しい数学の文章題のような複雑な課題に直面したとき、最終的な答えを出す前に、思考プロセスをステップごとに書き出すよう求められると、パフォーマンスが大幅に向上することがよくあります。「思考の連鎖(チェーン・オブ・ソート)」と呼ばれるこの手法は、人間が紙に計算を書き出す時のように、モデルに問題を小さく管理しやすい断片へと分解することを促します。しかし、これらの書き出されたステップが、実際にモデルの思考を助けているのか、それとも単なる「丁寧なパフォーマンス」に過ぎないのかという謎は、依然として残っています。モデルが中間的なテキストを内部的な論理のガイドとして真に使用しているのか、それとも、実際には別の隠れたプロセスに密かに依存しながら、もっともらしい言葉を生成しているだけなのか、その区別は不明確でした。この違いを理解することは極めて重要です。なぜなら、もしモデルが真に推論していないのであれば、その説明は誤解を招く可能性があり、重要な状況における信頼性も疑わしいものになるからです。
この謎を解明するために、イズミル工科大学の研究者たちは、モデルが作業している間にその「脳」の内部を覗き見ることにしました。彼らは、情報の処理を通じて相互に接続された膨大な経路のネットワークを通じて情報を処理する、「トランスフォーマー」と呼ばれる特定の種類の人工知能に焦点を当てました。彼らは、思考の連鎖のプロセスが、モデルの内部活動を具体的にどのように変化させるのかを知りたいと考えました。単に出力結果を見るのではなく、彼らは「アクティベーション・パッチング」と呼ばれる手法を用いました。モデルの内部状態を、建物の中のさまざまな部屋を流れるデータのストリームだと想像してください。「標準的な実行」では、モデルはステップを書き出すことなく問題を解決します。「クリーンな実行」では、モデルはステップを書き出しながら同じ問題を解決します。研究者たちは、「クリーンな実行」中に特定の経路を流れていた特定のデータを抽出し、それを「標準的な実行」へと入れ替えました。こうすることで、もし「思考」のデータを「非思考」の実行の中に注入すれば、あたかも欠けていたステップを与えられたかのように、モデルが突然問題を正しく解き始めるかどうかを確認することができました。
チームは、モデルの推論能力は単一の孤立した場所に格納されているのではなく、特定の順序で活性化する分散された経路のネットワーク全体に広がっていることを発見しました。思考していないモデルの内部信号を、思考しているモデルの信号と入れ替えたところ、非思考のモデルが思考するモデルのように振る舞い始めました。それは正解に近づき、同じ論理的経路を辿り始めました。このことは、思考の連鎖プロンプトが単に画面上にテキストを追加しているだけでなく、モデルの内部計算を能動的に再編成し、推論モードへと導いていることを示唆しています。研究者たちは、この効果は同じ特定の問題の信号を入れ替えた時に最も強かったものの、全く異なる問題の信号を入れ替えた場合でも、強度は低いながらも機能することを発見しました。これは、モデルが単に一つの特定の数式を解く方法だけでなく、問題の解法プロセスに関する一般的なパターンを学習していることを示しています。
これらの経路が本当に不可欠であることを確認するために、研究者たちは、特定された経路を完全に「オフ」にするという第二の実験を行いました。これを行ったとき、モデルのパフォーマンスは崩壊しました。モデルは単に最終的な数値を間違えただけでなく、物語の中での立ち位置を維持することさえできなくなり、例題の詳細と新しい問題を混同したり、期待される形式で最終回答を提示することさえできなくなったりしました。モデルは時として同じフレーズを何度も繰り返したり、意味をなさない数字を生成したりしました。これらの失敗は、研究者が特定した経路が、単に説明を書くためのものではなく、モデルの推論を軌道に乗せ、例題と実際のタスクを分離させ、正しい数値を生成させるための、まさにその回路であることを示していました。
また、研究は、これらの改善が単なるランダムなノイズや、モデルのどの部分を変更したことによる副作用ではないということも証明しました。研究者が特定の「思考」信号の代わりに、ランダムで無意味なデータを入れ替えたとき、モデルは改善しませんでした。これにより、これらの経路が運んでいる特定の信号こそが重要であることが確認されました。研究者たちは、これらの重要な経路が、モデルの最初や最後ではなく、層の中盤から後半にかけて集中していることを発見しました。これらは、モデルが思考の筋道を維持し、最終的な回答を正しい数値に固定し、例題の問題が新しいタスクを汚染しないようにするためのサポートシステムとして機能しています。
結局のところ、この研究は、思考の連鎖プロンプトが機能するのは、ステップ・バイ・ステップの推論をサポートするように設計された、特定の分散された内部回路を動員するためであることを示唆しています。これらの回路は、モデルの他の部分から切り離されて存在する独立した「推論モジュール」ではなく、モデルが声に出して考えるよう求められたときに動的に使用される、重なり合うコンポーネントなのです。モデルが思考するように促されていないとき、これらの回路は完全には稼働しておらず、モデルは複雑な課題に対して苦戦します。プロンプトによって思考が促されると、これらの回路が活性化し、解決策に到達するために必要なステップへとモデルを導きます。今回の知見は、これらの強力なツールが実際にどのように機能しているのかについて、より明確な姿を提示しており、その推論能力を説明する能力が単なる言語的な現象ではなく、情報の処理方法における真の内部的な変化を反映していることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。