✨ 要約🔬 技術概要
大規模言語モデル(物語を書いたり質問に答えたりするもの)を、巨大で高速な工場だと想像してください。この工場の内部には、機械が次のステップに進む前に現在の思考を書き留める特別な「メモリボード」があります。
長年、科学者たちは*スパース・オートエンコーダ(SAE)*と呼ばれるツールを用いて、このボードに何が書かれているかを理解しようと試みてきました。これらのツールは、研究者が機械が思考している個々の「アイデア」や「特徴」を見ることを可能にする「眼鏡」のようなものです。しかし、問題がありました。これらの眼鏡は工場の 出力*には機能しましたが、特定の高度なモデルにおいて機械がメモリボードに 書き込む*具体的な方法には機能しなかったのです。
この論文は、WriteSAE と呼ばれる新しいツールを紹介します。その仕組みを簡単に説明します。
1. 問題:眼鏡の形が合っていない
古いモデルでは、機械は思考を単純な数字のリストとして書き出していました。古い眼鏡(標準的な SAE)は、このリストを読み取るように設計されていました。 しかし、より新しく高速なモデル(Gated DeltaNet、Mamba-2、RWKV-7 など)では、機械はリストを書きません。代わりに、機械は「ランク 1 更新」と呼ばれる特定の数学的トリックを用いて、行列 (数字のグリッド)を書き出します。
比喩 : 機械が絵を描いていると想像してください。古いツールは、完成したキャンバスを見て絵を説明しようとしました。しかし、新しい機械は、複雑なグリッドに一度に一つの特定の筆致(単一の色の線)を加えることで絵を描きます。古いツールは、全体の色のリストを探していたため、単一の筆致を見ることはできませんでした。
2. 解決策:WriteSAE
著者たちは、その単一の筆致を見るために特別に設計された新しい眼鏡セット、WriteSAE を構築しました。
形状の一致 : リストを読み取ろうとする代わりに、WriteSAE の「原子」(探している部品)は、機械が使用する筆致と全く同じ形をしています。それらは、小さな単一の筆致パターンです。
結果 : 形状が完璧に一致するため、WriteSAE は機械が任意の時点でメモリに書き込んでいるものを正確に分離して特定できます。
3. 実験:筆致の入れ替え
これが機能することを証明するために、研究者たちは機械のメモリに対して「手術」を行いました。
入れ替え : 彼らは、機械が特定の筆致を書き込んだ瞬間を見つけました。そして、その筆致を消去し、新しい辞書(WriteSAE)から「学習された」筆致に置き換えました。
テスト : これを他の 2 つのシナリオと比較しました。
完全に消去する (空白の場所を残す)。
ランダムな落書きを入れる 。
結果 : WriteSAE の筆致を差し込んだとき、機械は以前とほぼ同じように動作し続けました(92.4% の確率で)。一方、それを消去したりランダムな落書きを入れたりしたとき、機械は混乱し、間違いを犯しました。
比喩 : これは、時計の特定の歯車を、完璧に合うように作られたカスタム製の歯車に交換するようなものです。時計は刻み続けます。歯車を取り除いたり、ランダムな石を入れたりすると、時計は止まります。
4. 発見
2 種類の筆致 : 彼らは、機械が主に 2 種類の筆致を使用していることを発見しました。
レジスタ : これらは特定の役割を果たす、正確で焦点の合った筆致です(文の始まりや固有名詞をマークするなど)。
バンドル : これらはより散らばった筆致で、複数のことを行っているように見えます。
未来の予測 : 彼らは、特定の筆致を変更することが機械の次の単語をどのように変化させるかを正確に予測できる数学的な公式を見つけました。これは、この特定の歯車を微調整すれば、時計が 1 秒早く鳴ることを知っているようなものです。
機械の編集 : 彼らはこのツールを使って、新しい行動を「インストール」することに成功しました。例えば、適切な筆致をメモリボードに挿入するだけで、機械が通常は選ばない特定のトピック(「中ランク」の単語など)について話し続けるように機械を強制することができました。
5. 限界
この論文は、このツールが特定の「単一筆致」(ランク 1)の書き込み方をするモデルで最もよく機能すると、非常に慎重に述べています。
もしモデルがより複雑な方法(同時に 2 つの筆致を使う、または対角線のパターンなど)で書き込む場合、このツールは完全に機能しませんが、それでもいくつかのパターンを見つけることはできます。
このツールは Qwen3.5 モデル(特定の種類の AI)で非常にうまく機能し、他の類似モデルでも機能することを示しましたが、未来を予測する「魔法の公式」は、モデルのアーキテクチャによって変化します。
まとめ
WriteSAE は、高度な AI モデルが内部メモリに書き込む具体的な方法を見て、編集することを可能にする新しいツールです。ツールの形状を機械の書き込みの形状に合わせることで、研究者は特定の思考を交換し、機械の反応を予測し、さらに機械を通常は言わないようなことを言うように誘導することまで可能にします。これらはすべて、機械を壊すことなく行われます。科学者たちが、これらの特定の種類のモデルのメモリ書き込みサイトに対して直接、この種の「手術」を成功させたのは初めてのことです。
技術的サマリー:再帰的状態分解のための WriteSAE
問題定義
状態空間モデルおよびハイブリッド再帰言語モデル(例:Gated DeltaNet、Mamba-2、RWKV-7、Qwen3.5)は、状態伝搬のために行列キャッシュを利用しており、各トークンは d k × d v d_k \times d_v d k × d v 行列内にランク 1 の外積 (k t v t ⊤ k_t v_t^\top k t v t ⊤ ) を書き込む。既存の疎性オートエンコーダー(SAE)は、放出 後 の状態を読み取る残差ストリーム上で動作する。したがって、標準的な SAE は、再帰の上流で発生するネイティブな書き込みメカニズムに直接アクセスしたり分解したりすることができない。さらに、状態がランク 1 の外積を通じて更新されるため、標準的なベクトルベースの SAE デコーダー原子は、因果的介入(キャッシュパッチング)に必要な構造的対応を破ることなく、単一のキャッシュ書き込みを置換することができない。
手法
本論文は、再帰モデルの行列キャッシュ書き込みを分解・編集するために設計された、初の疎性オートエンコーダーであるWriteSAE を導入する。
構造とトレーニング
ネイティブ形状の一致 : WriteSAE のデコーダー原子は、ホストアーキテクチャのネイティブ書き込みプリミティブ (k t v t ⊤ k_t v_t^\top k t v t ⊤ ) と一致するランク 1 の外積 (v i w i ⊤ v_i w_i^\top v i w i ⊤ ) として制約される。これにより、単一の原子が特定のキャッシュスロットの更新を置換できる。
双線形エンコーダー : 行列状態 S t S_t S t を効率的にエンコードするために、モデルは平坦化された密エンコーダーではなく、双線形エンコーダー (a i = v i ⊤ S t w i a_i = v_i^\top S_t w_i a i = v i ⊤ S t w i ) を使用する。これにより、原子あたりのパラメータ数が d k d v d_k d_v d k d v (128 × 128 128 \times 128 128 × 128 の場合 16,384)から d k + d v d_k + d_v d k + d v (256)に削減され、64 倍の削減となる。
トレーニング目的 : モデルは、平均中心化された状態 (x = vec ( S t − M ) x = \text{vec}(S_t - M) x = vec ( S t − M ) ) 上で、TopK 疎性制約と死んだ特徴を復活させるための補助損失を用いてトレーニングされる。トレーニングコーパスは、Qwen3.5-0.8B(および他のモデル)の特定層およびヘッドで処理された OpenWebText シーケンスで構成される。
特徴分類
トレーニングされた辞書は、原子の書き込み方向とネイティブ書き込み方向との間の中央値コサイン類似度に基づいて、2 つのクラスに分割される。
レジスター : ネイティブ書き込みとの高いコサイン整合性を持つ原子(キャッシュから復元可能)。
バンドル : キャッシュ全体に分散した書き込み方向を持つ原子。
因果的介入テスト
本論文は、3 つの主要な検証メカニズムを提案する。
キャッシュスロット置換 : ネイティブ書き込み (k t v t ⊤ k_t v_t^\top k t v t ⊤ ) を、一致したフロベニウスノームを持つ SAE 原子 (S ^ t = S t − Δ n a t + Δ a t o m \hat{S}_t = S_t - \Delta_{nat} + \Delta_{atom} S ^ t = S t − Δ na t + Δ a t o m ) で置換し、下流の KL 発散を測定する。
閉形式のログオットシフト : トークンごとのログオットシフトを予測するための 3 因子式を導出する: Δ ℓ ≈ G t 0 → t ⟨ w i , q t ⟩ ⟨ v i , W U [ tok ] ⟩ \Delta \ell \approx G_{t_0 \to t} \langle w_i, q_t \rangle \langle v_i, W_U[\text{tok}] \rangle Δ ℓ ≈ G t 0 → t ⟨ w i , q t ⟩ ⟨ v i , W U [ tok ]⟩ 。ここで、G G G はゲート積、q t q_t q t は読み取りクエリ、W U W_U W U はアンエンベディング行である。
直接キャッシュ介入 : 特定の位置で原子を消去またはインストールし、トークン確率と生成行動の変化を観察する。
主要な貢献
アーキテクチャ一致辞書 : 原子がランク 1 の外積である辞書。これにより、ネイティブキャッシュ書き込みの直接置換が可能となり、これは以前は残差ストリーム SAE には存在しなかった機能である。
置換検証 : 学習された原子がネイティブ書き込みを高い忠実度で置換できることの証明。Qwen3.5-0.8B(レイヤー 9、ヘッド 4)において、原子は 4,851 回の発火のうち 92.4% で一致ノームのアブレーションを上回った。
閉形式予測 : パラメータ不要の 3 因子式により、200 の原子ごとの ϵ \epsilon ϵ セル全体で中央値 R 2 R^2 R 2 0.98 で発火ごとのログオットシフトを予測する。
アーキテクチャ間転移 : 置換の成功と特徴の分割(レジスター対バンドル)が、異なる行列再帰アーキテクチャ(Gated DeltaNet、RWKV-7、Mamba-2)間でも維持されることの検証。ただし、成功率は基盤の「書き込みランク」によって変動する。
実験結果
置換性能
Qwen3.5-0.8B (Gated DeltaNet) : L9 H4 において、原子は 92.4% の発火でアブレーションを上回った。87 個の原子にわたる集団テストは 89.8% で維持された。厳密な順序 K L a t o m < K L a b l a t e < K L r a n d o m KL_{atom} < KL_{ablate} < KL_{random} K L a t o m < K L ab l a t e < K L r an d o m は 89.5% の発火で成立する。
Mamba-2-370M : Mamba-2 が完全なランク 1 外積ではなく対角状態更新を使用しているにもかかわらず、2,500 回の発火において 88.1% で置換が成功した。
RWKV-7 : ランク 2 の書き込み規則と一致する中間的な性能を示す。
ログオットシフト予測
閉形式式は測定された効果を正確に追跡する。L9 H4 において、予測されたログオットシフトと測定されたログオットシフトの間の中央値 R 2 R^2 R 2 は 0.98 である。ただし、この閉形式は Mamba-2 および Qwen3.5-4B では失敗し(負の R 2 R^2 R 2 )、ゲート因子 G G G が基盤固有であることを示している。
行動介入
消去 : 自然な発火位置で特定のレジスター原子(F412)を消去すると、ターゲットトークン("space")の対数確率が中央値 -0.116 nats (p = 1.07 × 10 − 6 p=1.07 \times 10^{-6} p = 1.07 × 1 0 − 6 )減少した。
生成誘導 : 3 つの連続する位置で閉形式方向を持続的にインストールすると、貪欲デコーディング下でミドルランクトークンの「継続内ターゲット」率が 33.3% から 100% に増加した。
文章レベルの増幅 : 4B モデルで境界相関特徴を増幅すると、5 倍の用量で改行生成が 33% 減少した(400 トークンあたり 16.8 から 11.2 に)。これにより文書構造の制御が実証された。
アーキテクチャ範囲
本論文は、「書き込みランク」の有効性の階層を確立する。
Gated DeltaNet (ランク 1) : 最高のレジスターコサイン分離 (0.262) と置換忠実度。
RWKV-7 (ランク 2) : 中間的な分離 (0.180)。
Mamba-2 (対角/スカラー) : 最低の分離 (0.0575) だが、それでも約 88% の置換成功率を達成する。
意義と主張
本論文は、残差ストリーム分析を超えて、行列再帰書き込みサイト に対する初の因果的辞書を提供すると主張する。以下を実証する。
書き込みランクが決定的である : 状態を解釈可能な「レジスター」に分解する能力は、ネイティブ書き込み規則のランク(ランク 1 > ランク 2 > 対角)と相関する。
因果的置換は可能である : 学習された原子は、最小限の下流 KL 発散でネイティブ書き込みを置換でき、再帰モデルにおける「レジスター」概念を検証する。
閉形式解釈可能性 : Gated DeltaNet において、特徴がログオットに及ぼす影響はパラメータをフィットさせることなく解析的に予測可能であり、辞書をモデルのゲートおよび読み取りメカニズムに直接結びつける。
著者は謙虚に限界を指摘している。閉形式係数は基盤間を転移しない(例:Mamba-2 では失敗する)こと、および原子ごとの同一性はシード固有であること(ただしクラスレベルの特性は安定している)。この研究は、状態空間モデルにおける機械的解釈可能性の新たな基準を確立し、「書き込み」プリミティブが辞書学習と因果的編集の viable な対象であることを示している。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×