← 最新の論文
🤖 AI

Data-driven Circuit Discovery for Interpretability of Language Models

本論文は、既存の仮説駆動型回路発見手法が言語モデルの真のメカニズム的多様性を捉えられないデータセット固有の回路を生み出していることを批判し、単一のタスクに対して複数の異なる高忠実度回路を明らかにするために処理の類似性に基づいて例をクラスタリングする新たな枠組みであるデータ駆動型回路発見(DCD)を提案する。

原著者: Daking Rai, Mor Geva, Ziyu Yao

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Daking Rai, Mor Geva, Ziyu Yao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で超知能なロボット(言語モデル)を想像してください。そのロボットは物語を書き、数学を解き、パズルを解くことができます。科学者たちは、このロボットが「どのように」考えているのかを理解したいと考えています。彼らはこれを「機械的解釈可能性」と呼びます。

科学者たちがこれまで行ってきた従来のアプローチは、特定の1回の走行を見つめることで車の「エンジン」を見つけようとするようなものです。彼らは、「さて、ロボットは点Aから点Bへ移動しただけだ。そのためにどのギアが回転したのかを正確にマッピングしよう」と言います。彼らはこのマッピングされた経路を「回路」と呼びます。

問題:「万能型」の罠
この論文は、この従来の手法が欠陥があると主張しており、それは2つの誤った仮定に基づいているからです:

  1. データセットの仮定:科学者が使用した特定の例(特定の文構造など)が、ロボットがそのタスクを遂行できる「すべての方法」を代表していると仮定しています。
  2. 単一エンジン仮定:質問のされ方がどうであれ、ロボットはタスクを解決するために「1つ」の特定のギアセット(回路)しか使用しないと仮定しています。

発見:ロボットには複数のエンジンがある
研究者たちは、この仮説を検証するために、ロボットに「同じ」タスクを与えつつ、わずかな変化を加えました(物語内の名前を変えたり、数学の問題を数字ではなく言葉で記述したりするなど)。

彼らは以下のことを発見しました:

  • 「ジョンとメアリー」という名前の物語に対するロボットの「エンジン」をマッピングすると、「人物Xと人物Y」という名前の物語に使われたエンジンとは全く異なるものでした。
  • さらに悪いことに、「物体を見つける」と「数学を行う」といった2つの全く異なるタスクを1つの大きなデータセットに混ぜた場合でも、従来の手法は依然として「1つ」のマッピングを無理やり適用しようとしていました。その結果、ロボットが実際には入力に応じて2つの異なるエンジンを使い分けていたことに気づかず、両方のタスクが混ざり合ったごちゃごちゃで混乱した「フランケンシュタイン」のような回路が作成されてしまいました。

解決策:データ駆動型回路発見(DCD)
これを修正するために、著者らは「データ駆動型回路発見(DCD)」と呼ばれる新しい手法を提案しています。

以下のように考えてみてください:

  • 従来の手法:あるグループの人々にパズルを解いてもらい、全員の解答を見て、全員がどのように解いたかを説明する「1つ」のマスター設計図を描こうとします。もし誰かがハンマーを使い、他の誰かがドライバーを使った場合、その設計図は両方の道具が混ざり合った混乱したものでしかなりません。
  • 新しい手法(DCD):まず人々を見て、彼らが問題を「どのように」解いているかによってグループ分けを行います。「ハンマーを使う人々」を1つの部屋に、「ドライバーを使う人々」を別の部屋に集めます。その後、ハンマーグループには別のクリーンな設計図を、ドライバーグループにはまた別のクリーンな設計図を描きます。

DCDの仕組み(比喩)

  1. データの分類:ロボットに1つの経路を使用することを強制するのではなく、DCDはロボットが処理するすべての例を個別に観察します。「この例は、あの例と同じようにロボットの内部ギアを回転させているか?」と問いかけます。
  2. グループの作成:ロボットがそれらを処理する仕方に基づいて、例を「クラスター」に分類します。
  3. 特定の回路の発見:その後、各グループに対して、特定のクリーンな「エンジン地図」を見つけ出します。

結果
この新しい手法を用いたところ、以下のことがわかりました:

  • ロボットは、人間が「1つのタスク」と考えているものに対して、実際には「複数の異なるメカニズム(エンジン)」を使用していました。
  • 新しい地図(回路)は、以前の混乱した地図よりもはるかに正確(忠実)で、単純(スパース)でした。
  • 決定的なことに、ロボットの内部組織は「数学」や「物語」といった人間のラベルには関心がありませんでした。それは入力の「構造」によって自らを組織化していました。DCDは人間のカテゴリーを無理やり押し付けるのではなく、ロボットの内部論理を尊重するものです。

まとめ
この論文はこう述べています:「タスクに対して1つの普遍的なエンジンを見つけようとするのをやめなさい。ロボットはそれよりも賢く、柔軟です。状況に応じて異なるエンジンを持っています。私たちの新しい手法であるDCDは、データに境界をどこに置くかを決めさせ、正しい仕事に対して正しいエンジンを見つけることを可能にします。そうすれば、すべてに1つで混乱したエンジン地図を無理やり押し付ける必要がなくなります。」

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →