Polymorphism Is Rotation: Operational Mechanistic Interpretability from a Two-Layer Transformer to Pythia-70m
本論文は、独立して訓練されたトランスフォーマーが、一様ランダム回転によって関連付けられ互いに理解不可能な内部座標を用いて同一の関数を計算することを示しており、この「多型性」と呼ばれる現象は、単一の直交プロクラステス適合によって解決でき、それにより再訓練なしに特徴辞書とステアリングベクトルの直接転送を可能にする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたと友人が、同じ説明書から全く同じ複雑なレゴ城を建造していると想像してください。外見は完全に同じで、同じ機能(同じドア、窓、塔)を持つ城が完成します。
しかし、城の内部では、レンガの配置方法を示す「設計図」が全く異なります。実際、あまりにも異なるため、友人の内部設計図を使って自分の城を理解しようとすると、混乱してしまいます。城が異なるからではなく、同じものを記述するための「内部言語」が二つあるからです。
この論文はこの現象を**「多様性(Polymorphism)」**と呼びます。これは「同じ機能、異なる内部座標」を意味します。
以下は、研究者たちが発見した内容を、簡単な比喩を用いて解説したものです。
1. 「デコーダー」対「エンコーダー」(辞書の問題)
AI 研究において、科学者たちはモデルが何を考えているかを理解するために、その「特徴」(概念の辞書のようなもの)を調べようとします。彼らは、プロセスの「終端(デコーダー)」を見ると、2 つの異なるモデル間で辞書がほぼ同一であることを発見しました。まるで 2 人が全く同じ辞書を使って物語を書いているかのようです。
意外な展開: 研究者たちは、辞書(デコーダー)は同じであっても、その辞書の「読み方(エンコーダー)」が完全にぐちゃぐちゃになっていることに気づきました。
- 比喩: 2 人が本を読んでいると想像してください。A さんは普通に読み、B さんは本を 90 度回転させて逆さまに読んでいます。指差している単語(デコーダー)だけを見ると、完全に一致します。しかし、A さんの視点を使って B さんのメモを読もうとすると、そのメモは全く意味をなしません。「メモ(活性化)」は、回転した座標系にあるからです。
2. 壊滅的な失敗
研究者たちは、モデル A から「特徴辞書」を取り出し、それを直接モデル B に適用しようとしましたが、完全に失敗しました。モデルの内部思考の再構成は、平均的な答えを推測するよりも劣る結果となりました。
- 比喩: ロンドンでナビゲーションするためにニューヨーク市の地図を使おうとするようなものです。ランドマーク(デコーダー列)はリスト上では似ているかもしれませんが、通り(内部座標)の向きが異なります。ニューヨークの地図に従ってロンドンを進めば、すぐに道に迷います。
3. 魔法のような解決策:1 回の行列乗算
この論文の最大の発見は、これをどう修正するかです。モデルを再学習させたり、脳を変えたりする必要はありません。2 つのモデルを揃えるために、単一の数学的「回転」(プロクラステス適合と呼ばれる特定の数学的操作)を適用するだけで済みます。
- 比喩: あなたと友人が、回転するプラットフォームの反対側に立って彫刻を見ていると想像してください。同じ物体を見ていますが、角度が異なります。プラットフォームを友人の角度に合わせて回転させれば、視点が完璧に一致します。
- 結果: モデル B の内部データにこの単一の「回転」を適用すると、モデル A の辞書がモデル B で完璧に機能しました。「内部言語」は瞬時に翻訳されたのです。
4. それは特定の回転か、それともランダムか?
研究者たちは疑問に思いました。この回転は、意味のある特定のシフトなのか、それとも単なるランダムな混沌なのか?
- 発見: 本質的にランダムです。2 つの独立して学習されたモデル間の回転は、車輪のランダムな回転のようなものです。「特別な」角度ではなく、均一なランダム回転です。
- 比喩: 地球儀をランダムに回して止めた場合、その向きはランダムです。この論文は、2 つの AI モデルがゼロから学習されるたびに、互いに対してランダムな角度で止まった「地球儀」を持って終わることを示しています。
5. 「ステアリング(行動変更)」への意味
この論文は、モデルの振る舞いを変えるために使われる「ステアリングベクトル」(より丁寧にする、より創造的にするなど)もテストしました。
- 発見: 回転を修正せずに、モデル A の「ステアリング・ナッジ(微調整)」をモデル B に適用しようとすると、失敗するか、あるいは望むのとは逆のことが起こることが多いです。
- 比喩: おもちゃの車(モデル A)のリモコンを持っていると想像してください。そのリモコンを、別の向きを向いている別の車(モデル B)に使おうとすると、「前進」ボタンを押しても、2 台目の車は「左」や「後退」に進むかもしれません。まず 2 台目の車の向き(回転)を把握し、リモコンの信号をそれに応じて調整する必要があります。
「ルール」のまとめ
この論文は、これらのモデルがどのように関連するかについて、3 つの主要なルールを確立しています。
- 同じ機能、異なる座標: 個別に学習された 2 つのモデルは同じ仕事をするが、異なる内部「マップ」を使用する。
- デコーダーは嘘をつく: 「終端」の特徴が似ているからといって、モデルが同じように物事を理解しているわけではない。
- 修正は安価: 再学習なしに、単一の簡単な数学計算(1 回の行列乗算)で、全く異なる 2 つのモデルを揃えることができる。
発見の規模
研究者たちは 2 つのレベルでこれを証明しました。
- 「おもちゃ」モデル: 理論が真実であることを確認するために、すべてのレンガをチェックできた、小さく単純なモデル(104,000 パラメータ)。
- 「現実」モデル: 7000 万パラメータを持つ、より大規模で現実的な言語モデル(Pythia-70m)。ここでも同じ「ランダム回転」のルールが当てはまりました。
結論: AI モデルは、同じ言語を話す双子のようですが、異なるアクセントと向きを持っています。彼らは同じことをしますが、互いを理解するには、視点を変える(回転させる)だけで済みます。そうすれば、その内部の秘密は読み解けるようになります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。