← 最新の論文
💬 NLP

Function-Vector Heads Are Two Populations: Writers and Cancellers in In-Context Learning

本論文は、関数ベクトル・ヘッドが同質なグループであるという仮定に対し、それらが正しい規則を促進する「ライター(writers)」とそれらを抑制する「キャンセラー(cancellers)」という二つの対立するサブ集団から構成されていることを明らかにすることで異議を唱えるものであり、これらは大きさのみによるランキングでは不可視であるが、特定およびアブレーション(除去)が行われた際にモデルの性能に大きな影響を与える。

原著者: Han-yu Wang

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Han-yu Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(あなたとチャットをするようなもの)を、いくつかの例に基づいてパズルを解こうとしている巨大なオーケストラだと想像してみてください。このオーケストラの中には、**アテンション・ヘッド(Attention Heads)**と呼ばれる特定の演奏家たちがいます。長い間、研究者たちは、最も重要な演奏家とは単に大きな音を奏でている演奏家のことだと信じてきました。もしある演奏家が非常に大きな音を鳴らしていれば、その演奏家は間違いなくオーケストラが正しい旋律を奏でる助けになっているはずだと考えていたのです。

しかし、この論文は、その仮定が間違っていることを明らかにしています。実は、「最も大きな音を鳴らしている」演奏家たちは、全く異なる、対立する2つのグループに属していることが判明しました。それが、**「ライター(Writers:書く者)」「キャンセラー(Cancellers:消す者)」**です。

以下に、この論文の発見を簡単な比喩を用いて解説します。

1. 大きな誤解:音量 vs 方向

以前の研究者は、これらの演奏家を音量(答えに対してどれだけ貢献したか)によってランク付けしていました。そして、最も大きな音を鳴らしている上位20人の演奏家は、全員が「助っ人」であると考えていました。

この論文の著者たちは、音量だけでは不十分であり、方向を知る必要があることに気づきました。

  • ライター(Writers): オーケストラを正しい答えへと押し進める大きな音を奏でます。
  • キャンセラー(Cancellers): 彼らもまた大きな音を奏でますが、オーケストラを間違った答えへと押し進めようとします。彼らは正しい答えを打ち消そうと積極的に動いています。

比喩: 綱引きを想像してください。

  • ライターは、ロープをゴールラインの方へと引いているチームです。
  • キャンセラーは、もう一つのチームで、同じくらい強くロープを引いていますが、反対の方向へと引いています。
  • もし、彼らがどれほど強く引いているか(大きさ)だけを見れば、両者が等しく重要な「引き手」であると考えてしまいます。しかし、方向を見れば、彼らが互いに争っていることがわかります。

2. 発見:2つの集団

研究者たちは、これらをさまざまな規模(小規模から大規模まで)の異なるモデルや、異なる種類の論理パズルでテストしました。その結果、ほとんどすべてのケースにおいて、「トップ」の演奏家たちがこれら2つの対立する陣営に分かれることがわかりました。

  • 「ライター」は、正しい答えの確率を上げます
  • 「キャンセラー」は、正しい答えの確率を下げます

研究者たちが「キャンセラー」の音を消した(アブレーションを行った)ところ、モデルのパズル解決能力は実際に向上しました。それは、まるで綱引きのチームからサボタージュ(破壊工作)を行う者を排除したようなものでした。突然、「ライター」たちは抵抗を受けることなく、ロープをゴールラインへと引き寄せることができるようになったのです。

3. なぜ以前の研究は見逃したのか

以前の研究(Todd et al., 2024など)は、貢献の「大きさ」のみを見る手法を用いていました。そのため、彼らは誤ってライターとキャンセラーを混ぜて捉えてしまい、その混ざり具合はパズルによって変化していました。

  • あるパズルでは「キャンセラー」の方が音が大きかったため、古い手法では彼らが主要な助っ人であると判断されました。
  • 別のパズルでは「ライター」の方が音が大きかったため、古い手法では彼らが主要な助っ人であると判断されました。

この論文は、方向(符号)を無視することは、英雄と悪党を混ぜ合わせ、彼らが皆単なる「大きな音の助っ人」であると勘違いすることになるのだと示しています。

4. キャンセラーは単なるミスなのか?

研究者たちは、「キャンセラー」がモデルの壊れたパーツや、単なる偶然のノイズではないことを確認するために、多くのテストを行いました。彼らは、これらが実在し、機能しているシステムの一部であることを証明しました。

  • 彼らは異なるものを見ている: ライターは例題の中の「ラベル(答え)」に注目します。一方、キャンセラーは「フォーマット(句読点や空白)」に注目します。彼らはページの異なる部分を見ているのです。
  • 彼らは内容に基づいている: キャンセラーは単にランダムに答えを抑制しているのではなく、例題の中で示された直後の答えを、具体的に抑制しようとしています。
  • 彼らは「コピー抑制器」ではない: 論文は、これらが単なる一般的な「コピーしないためのメカニメント」であるという考えを否定しました。これらはタスクの論理に特化したものです。

5. 「L11.H4」のキャラクター研究

論文では、特定の演奏家である L11.H4 に焦点を当て、それがどのように機能するかを詳しく見ています。

  • この演奏家は、論理パズルの場面では「キャンセラー」として機能します(間違った答えへと押し進めようとします)。
  • しかし、パズルを語彙タスク(反対語のマッチングなど)に変更すると、この同じ演奏家は役割を反転させ、「ライター」になります(正しい答えを助けます)。
  • 教訓: この演奏家は、本質的に「善」でも「悪」でもありません。その役割は、**「今示されたものを抑制すること」**です。デモンストレーションが正しい答えであれば、それを抑制します(キャンセラー)。もしデモンストレーションが(異なる文脈において)間違った答えであれば、その間違った答えを抑制することで、結果的に正しい答えを助けることになります(ライター)。

6. まとめ

この論文の主な結論は、AIモデルの最も「活動的な」部分を、単一の均一なグループとして扱うことはできないということです。

  • 旧来の視点: 「これらはトップ20の重要なヘッドだ。これらを使ってモデルを制御しよう。」
  • 新しい視点: 「これらトップ20のヘッドは、実は内戦状態にある。半分はモデルを正しい場所へ押し、半分は間違った場所へ押しやっている。モデルを制御したいのであれば、ライターを増幅させるのではなく、キャンセラーを黙らせる必要がある。」

この論文は、これがモデルを「安全」にしたり、医療や法律などの実社会での使用に即応できる状態にしたりすると主張しているわけではありません。単に、モデルが例からルールを学習する方法を理解するためには、内部の「演奏家」たちが協力し合っているのではなく、しばしば互いに戦っているという事実を認識しなければならない、と述べているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →