Are Arithmetic Heuristic Neurons Form-Invariant? A Mechanistic Analysis of Symbols, Text, and Code in LLMs
本論文は、LLMにおける算術計算が、記号、自然言語、およびコードの形式を横断して共通かつ形式不変な「ヒューリスティック・ニューロン」の集合に依存していることを示し、形式間の失敗が個別の内部回路ではなく活性化状態に起因することを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、超スマートなロボットに数学を教えようとしているところだと想像してみてください。もし、あなたが「4 + 5 = 9」のような単純な方程式を使って、ロボットが数字の足し算を学んだとしたら、もしあなたが物語形式で伝えたり(「トムは4個のリンゴを持っていて、アリスが彼に5個あげました……」)、あるいはそれを実行するためのコンピュータプログラムを書くように頼んだりしても、ロボットは自動的に同じ問題を解けるようになるだろうと、あなたは考えるかもしれません。しかし、ここにひねりがあります。大規模言語モデル(LLM)として知られるこれらのロボットは、驚くほど気まぐれなのです。彼らは物語の中では正解を出せても、コードとして頼むと無残にも失敗することがあります。たとえ、その数学の内容が全く同じであったとしてもです。これは単なる不具合ではありません。これは、これらのモデルがデジタルな脳の中でどのように「思考」しているのかという謎なのです。
これを理解するためには、ボンネットの下を覗き込む必要があります。LLMを一つの巨大な脳としてではなく、「ニューロン」と呼ばれる小さな作業員たちの巨大な都市として考えてみてください。モデルが問題を解くとき、特定のニューロンのグループが点灯し、重労働を引き受けます。科学者たちはこれを「メカニスティック・インタープリタビリティ(機械論的解釈可能性)」と呼んでいます。基本的には、どの特定の歯車が回転して動作を実現させているのかを、機械をリバースエンジニアリングすることです。研究者たちが問い続けてきた大きな疑問は、ロボットが記号による数学から言葉やコードによる数学へと切り替えるとき、全く新しい作業員チームを動員するのか、それとも、指示の見た目が変わったために混乱しているだけで、実は「同じ」チームの作業員を使っているのか、ということです。
この論文は、ロボットの脳を探偵事件のように扱うことで、この謎を解こうとしています。研究者たちは、同じ数学の問題の3つの異なるバージョン——標準的な方程式、Pythonのコンピュータプログラム、そして自然言語による文章題——を用意し、3つの異なるLlama-3モデルにおいて、どのニューロンが反応したかを観察しました。その結果、ロボットは形式ごとに異なるチームを使っているのではないことが分かりました。むしろ、形式がどのように提示されようとも、実際の計算を行うのは、各レイヤーにつき約50から100個のニューロンからなる、非常にコンパクトで凝縮された「コア・クルー(中核となる精鋭部隊)」なのです。
ここからが、彼らの発見の中で最もエキサイティングな部分です。ロボットがある形式(例えばコード)では問題を解けず、別の形式(例えば文章題)では成功する場合、それは適切な道具が足りないからではありません。単に「コア・クルー」が動き出すための正しい信号を受け取れていないだけなのです。研究者たちは、デジタルの「脳移植」を行うことで、このことを証明しました。彼らは、成功した文章題の実行時の活性化信号を取り出し、それを失敗したコードの実行時に貼り付けました。すると突然、行き詰まっていたロボットが、足し算と引き算において97%以上の確率でコードの問題を正しく解き始めたのです!
このことは、ロボットの失敗が知識の欠如や回路の故障によるものではなく、単に「正しいニューロンが、適切な気分(状態)になっていない」ことに過ぎないことを示唆しています。この研究は、これらの「算術ヒューリスティック・ニューロン」が「形式不変(form-invariant)」であること、つまり、数学が記号、物語、あるいはコードとして提示されるかに関わらず、同じ信頼できる作業員であることを示しています。彼らは一貫して、数字が特定の範囲内にあるかを確認したり、特定のパターンを探したりといった、同じ「戦略の家族」に属しています。したがって、ロボットは同じ質問のされ方に対して混乱しているように見えるかもしれませんが、その内部にある数学エンジンは、実は驚くほど一貫しており、堅牢であり、ただ適切な火花が散るのを待っているだけなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。