← 最新の論文
💬 NLP

How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits

本論文は、特定された言語モデルの回路がタスク遂行に対して高い一貫性と必要性を有する一方で、著しいタスク間重複によりタスク特異性を欠くことを示しており、それによって標的介入および理解のための枠組みの実用性に疑問を投げかけている。

原著者: Michael Li, Nishant Subramani

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Michael Li, Nishant Subramani

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で複雑な工場(大規模言語モデル)を想像してください。この工場は、数学の計算からジョークを話すまで、あらゆる種類の問題を解決できます。長年にわたり、科学者たちは、この工場の内部でどの機械がどの仕事を担当しているのかを正確に突き止めようとしてきました。彼らはこれらの特定の機械のグループを「回路」と呼んでいます。

この論文は、これらの回路について 2 つの単純な問いを投げかけています:

  1. 一貫性:工場が同じ仕事(例えば数字の足し算)を 10 回行った場合、毎回全く同じ機械を使用しているでしょうか?
  2. 特異性:工場が数学の作業を行う際、歴史の作業を行う際とは異なる機械を使用しているでしょうか?

以下は、研究者たちが単純な比喩を用いて発見したことです:

1. 「一貫性」テスト:はい、信頼性があります。

研究者たちは、工場が同じ仕事に対して同じツールを使用するかどうかを確認しました。

  • 発見:はい!工場に数字の足し算を求めると、ほぼすべての数学的問題に対して、特定の機械セット(主に「MLP レイヤー」であり、これは工場の頑丈な作業台に相当します)を確実に使用します。
  • 比喩:これは、特定のケーキを作るシェフのようなものです。毎回そのケーキを作る際、同じミキサーと同じオーブンを使用します。途中でブレンダーやトースターに切り替えることはありません。研究者たちは、これらの特定の機械を「プラグを抜く」ことで、工場はそのタスクをほぼ完全に停止することを発見しました。これは、これらの機械が単に忙しそうに見えているだけでなく、実際に作業を行っていることを証明します。

2. 「特異性」テスト:いいえ、独自性はありません。

ここが驚くべき部分です。研究者たちは、「数学」に使用される機械と、「歴史」や「論理」に使用される機械は全く異なるだろうと予想していました。

  • 発見:彼らの予想は外れました。数学に使用される機械は、歴史、論理、さらには読解力に使用される機械と、ほぼ全く同じものです。
  • 比喩:工具箱を持っていると想像してください。「数学ボックス」には定規や電卓などの数学ツールだけが、「歴史ボックス」には地図や本などの歴史ツールだけが入っていると思っていたとします。しかし、開けてみると、両方のボックスに同じ 90% のツールが入っていることがわかりました。
    • 「数学ツール」を工具箱から取り除くと、工場は数学ができなくなります。
    • しかし、それら同じツールを取り除くと、工場は歴史や論理もできなくなります。
    • 結局のところ、工場はすべての作業を行うために、巨大で共有された「インフラ」(作業台/MLP レイヤー)に依存していることがわかりました。これらのツールは、単一のタスクだけでなく、すべてのタスクの基盤なのです。

3. 「隠れた宝石」:わずかな独自性。

タスク間には違いが全くないのでしょうか?

  • 発見:はい、ただし非常に小さいものです。共有されたツールの大きな山の中に、特定の作業に固有の、小さく専門化されたツールセット(全体の約 10〜30%)が存在します。
  • 比喩:工具箱の話に戻ると、ツールの 90% は共有されていますが、「数学ボックス」には「歴史ボックス」にはない、小さく特別な電卓が入っています。その電卓だけを除去すると、数学は失敗しますが、歴史は機能し続けます。しかし、共有されている 90% があまりにも大きく重要であるため、「数学ボックス」全体を取り除くとすべてが壊れてしまい、あたかも数学ツールだけが重要だったかのように見えてしまいます。

全体像

この論文は、言語モデルを「アテンションヘッド」や「MLP レイヤー」(工場の目に見える大きな部分)のレベルで観察すると、私たちが主に目撃しているのは、各タスクの具体的な設計図ではなく、建物の一般的なインフラであると結論付けています。

  • 理解への示唆:モデルが使用する「作業台」を見つけることは容易ですが、どの作業台が「数学専用」で、どの作業台が「歴史専用」かを簡単に見分けることはできません。なぜなら、それらはすべて両方のタスクに使用されているからです。
  • 留保事項:研究者たちは、真に固有の「専門ツール」(小さな 10%)を見つけるためには、作業台全体ではなく、おそらく個々のネジや配線(ニューロンや特徴)といった、より詳細なレベルを見る必要があるかもしれないと示唆しています。

要約すると:モデルは一貫しています(同じ仕事には同じツールを使用します)が、特異的ではありません(すべての仕事に同じツールを使用します)。私たちが発見する「回路」は、主にモデルの共有基盤であり、単一のタスク固有の指示ではないのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →