← 最新の論文
🤖 AI

Ablation-Reversible Heads Don't Transfer: A Stress Test for Mechanistic Role Claims in Transformers

本論文は、標準的な必要性、符号化、および復元基準を満たすヘッドがプロンプトを越えた計算の転送に失敗することを実証することで、トランスフォーマーのアテンションヘッドに関する一般的なメカニズム的役割の主張の妥当性に異議を唱え、多くのそのようなヘッドが特定の意味的計算を実行しているのではなく、単に軌道を安定させたり出力をバイアスしたりしているに過ぎないことを明らかにするための、新しいKIDフレームワークと厳格なテストパイプラインの導入を促すものである。

原著者: Philip Quirke

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Philip Quirke

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大で複雑なオーケストラ(大規模言語モデル)が、特定の曲(数学の問題を解いたり、質問に答えたりすること)を演奏している様子を理解しようとしていると想像してください。長い間、研究者たちは特定のミュージシャン(「アテンション・ヘッド」)を指さして、「ああ、このバイオリニストこそが『足し算』のメロディを奏でているのだ」と言おうとしてきました。

彼らが通常用いる証明方法は、以下の3つのステップを踏みます。

  1. ミュージシャンを黙らせる: もしそのバイオリニストを消音(ミュート)したら、曲がバラバラになってしまう。(必要性:Necessity)
  2. 楽譜を読み取る: そのバイオリニストの音符を見ると、そこにっきりと「足し算」という言葉が書かれている。(線形デコーダビリティ:Linear Decodability)
  3. 「元に戻す」ボタン: バイオリニストを消音した後、すぐにその録音を無音の中に再生すると、曲は完璧な状態に戻る。(アブレーションの可逆性:Ablation Reversibility)

もしあるミュージシャンがこれら3つのテストをすべてパスした場合、研究者たちは伝統的にこう仮定してきました。「このバイオリニストこそが、『足し算』という概念そのものである」と。

大いなる事実の判明:「偽の転移(Fake Transfer)」

著者であるフィリップ・クィルキとそのチームは、より厳格なテストを設定しました。彼らは、最初の3つのテストをパスした「完璧な」バイオリニストたちを取り上げ、彼らを別の曲へ移動させる試みをしました。

例えば、あなたが「足し算」を演奏するのが得意なバイオリニストを持っているとします。そのバイオリニストの楽譜(脳の状態)を取り出し、それを「引き算」を求める曲の中に貼り付けてみるとします。

  • 期待される結果: もしそのバイオリニストが真に「足し算」という概念を保持しているなら、その状態を「引き算」の曲に貼り付けることで、オーケストラが引き算をする代わりに足し算を行おうとするはずです。
  • 現実: それは機能しませんでした。オーケストラは引き算を続けたのです。バイオリニストの「状態」は、新しい文脈において「足し算」という概念を転移させることはできませんでした。

著者らは、3つの異なるモデルと5種類のタスク(数学、日付、比較など)にわたって、すべてのミュージシャンが最初の3つのテストをパスしたとしても、この第4の、極めて重要なテストには失敗したことを発見しました。彼らは必要不可欠であり、その音符は「足し算」に見えましたが、新しい文脈においてオーケストラに足し算を「教える」ことはできなかったのです。

新しい視点:KID(Knowing, Intent, Doing)

これらのミュージシャンが実際に何をしているのかを説明するために、著者らはKIDと呼ばれる新しい考え方を導入しています。

  1. Knowing(知っている): ミュージシャンは、オーケストラがプロンプト(指示)の内容を理解するのを助けています。(例:「ああ、これは歴史の質問ではなく、数学の問題なんだな」)
  2. Intent(意図): ミュージシャンは、具体的にどの演算を実行するかを決定する存在です(例:「我々は間違いなく、引き算ではなく足し算を行うのだ」)。これが聖杯(究極の目標)です。 しかし、論文では、この「意図(Intent)」を実際に保持しているミュージシャンは見つからなかったと主張しています。
  3. Doing(実行している): ミュージカンは、オーケストラが答えを書き出すのを助けています。(例:「よし、答えは5だ。それを書き出そう」)

実際に分かったこと

彼らは「意図」のミュージシャンを見つける代わりに、本物のように振る舞っていた他の2種類のプレイヤーを見つけました。

  • 「軌道安定化奏者」(Knowingの役割): これらのミュージシャンは、オーケストラがコースから外れないようにする指揮者のようなものです。彼らを消音すると、オーケストラは何の種類の問題を解いているのか混乱してしまいます。しかし、彼らは「足し算」のスイッチを実際に持っているわけではなく、単に「数学の問題である」という雰囲気を維持しているだけなのです。新しい曲に彼らを移動させても、彼らは特定の数学演算ではなく、単にその「雰囲気」を維持するだけです。
  • 「ロジット・バイアス・ヘッド」(Doingの役割): これらのミュージシャンは、答えである「5」という数字を書くことが大好きすぎて、オーケストラをその数字へと押し進める書記のようなものです。彼らを消音すると、オーケストラは「4」や「6」と書いてしまうかもしれません。彼らは「正しい答え」を得るためには不可欠ですが、数学について「考えている」わけではありません。

「同じ答え」の罠

論文は、これらの偽物を捕まえるために彼らが使った巧妙なトリックを紹介しています。それは**「同じ答えによるコントロール(Same-Answer Control)」**です。

「2 + 2 は何ですか?」(答え:4)というプロンプトを想像してください。
次に、「3 + 1 は何ですか?」(答え:これも4)というプロンプトにおけるミュージシャンの「脳の状態」を取り出します。
その状態を「2 + 2」のプロンプトに貼り付けたとき、オーケストラが依然として「4」と答えたとしたら、それはミュージシャンが「足し算」の概念を転移させたからでしょうか?
いいえ。 それは単に、そのミュージシャンが「4」という数字に執着しているからです。

著者らは、多くの「成功した」転移が、単にミュージシャンが計算過程ではなく、回答の文字列に精通していただけであることを発見しました。彼らは「足し算のやり方」を転移させていたのではなく、「答えは4であるという知識」を転移させていたのです。

結論

この論文は、AIの「メカニズム」を見つけ出すために使われている標準的なツールは、騙されやすいものであると結論付けています。あるモデルのパーツが必要であり、読み取り可能であり、かつ可逆的であるからといって、それが私たちが考えているような特定の「意図」や「概念」を保持しているとは限らないのです。

  • 良いニュース: 私たちはより優れた地図を手に入れました。バンドを軌道に乗せ続けているだけのミュージシャン(Knowing)、単に最後の音符を書いているだけのミュージシャン(Doing)、そして実際にメロディを決定しているミュージシャン(Intent)を区別する方法を知りました。
  • 悪いニュース: 彼らがテストしたモデルにおいては、明確に「意図(Intent)」の決定者であると言えるミュージシャンは一人も見つかりませんでした。「意思決定」を行う部分は、AIの中で非常に薄く広く分散されており、単一のバイオリニストが「足し算」の楽譜を保持しているわけではないのかもしれません。

要するに、「元に戻す(Undo)」ボタンだけを信じてはいけません。 もし、あるコンポーネントの状態を新しい状況に移しても、それが同じことを行わせることができないのであれば、それはその特定のタスクの「脳」ではなく、単に非常に有能なアシスタントに過ぎないのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →