← 最新の論文
🤖 machine learning

Relational Rank Geometry in Transformers: Detecting and Steering Hidden-State Relation Frames

本論文は、トランスフォーマーの隠れ状態における高次関係構造がプルッカー符号エントロピーによって検出可能であり、関係フレーム幾何学に対する標的介入によって効果的に制御可能であることを示し、それによって規模の異なるラマモデル全体で正しい行動出力を回復できることを実証する。

原著者: Mazen Kobrosly

公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Mazen Kobrosly

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(チャットボットを動かしているようなもの)を、大規模で賑やかな都市だと想像してみてください。この都市の内部では、「隠れ状態」と呼ばれる通りを介して情報が流れ動いています。多くの研究者は、個々の建物(ニューロン)、単一の信号機(アテンションヘッド)、あるいは特定の道路(方向)を研究することで、この都市を見てきました。彼らは、「この特定の建物は何をするのか?」と問いかけています。

この論文が問うているのは、異なる問いです:「複数の建物の間の『関係性』は、全体としてどのような姿をしているのか?」

著者のマゼン・コブロスリは、モデルが複雑な関係性(例えば「A は B に対して、C は D に対してである」といった関係)を理解する際、単にいくつかのランダムな場所が点灯するわけではないと提案しています。代わりに、関与するトークン(単語)は、モデルの内部空間において、特定の硬質な幾何学的形状を形成します。論文はこの現象を**「関係フレーム(Relation Frame)」**と呼んでいます。

以下に、この論文の発見を簡単なアナロジーを用いて解説します。

1. 「大工の水準器」(形状の検出)

これらの形状を見つけるために、著者は**プ吕ケル符号エントロピー(Plücker Sign Entropy)**と呼ばれるツールを発明しました。

  • アナロジー: 3 次元空間に浮かぶ 3 本の棒のセットを持っていると想像してください。これらを組み合わせてピラミッドを作ることができます。棒の順序を入れ替えると、ピラミッドは上下逆さまになったり、内側から外側へ裏返ったりします。この「反転」は、**向き(オリエント)**の変化です(左の手と右の手のような違い)。
  • テスト: 著者は、関連するはずの単語のグループ(例えば、特定の論理パズルを構成する 3 つの単語)と、単に混ぜ合わされた無意味な単語のグループを比較しました。
  • 発見: モデルが正しい関連する単語を処理すると、それらは非常に一貫性があり予測可能な幾何学的な向き(完璧に組み立てられたピラミッドのような)に配置されます。一方、単語が混ぜ合わされている場合、それらは一貫した形状を持たない、散らかった棒の山のように見えます。
  • 結果: この「幾何学的なシグネチャ」は、異なるサイズの Llama モデル(80 億、700 億、4050 億パラメータ)で見つかりました。モデルが大きいほど、この形状はより明確で一貫していました。

2. 「魔法のグリッド」(実験)

この形状が実際にモデルに正しい思考を引き起こすことを証明するために、著者は**エッジ・グリッド・アッセイ(Edge-Grid Assay)**と呼ばれるゲームを作成しました。

  • アナロジー: 8 行 8 列の表計算ソフトを想像してください。
    • クリーン状態: 「YES」のマークが完璧な対角線を描きます(1 行目は 1 列目、2 行目は 2 列目、など)。モデルはこれを正しく「対角パターン」として識別します。
    • 破損状態: 「YES」のマークが混ぜ合わされ、複数の行が同じ列を指すように配置されます。モデルはこれを正しく「重複パターン」として識別します。
  • 介入: 著者は、モデルが混乱している「破損」状態を取り出し、それを「誘導」しようと試みました。モデルを単に少し揺さぶるのではなく、それらの単語を表す内部の「データ雲」を物理的に再形成しようとしました。

3. 「粘土の彫刻」(モデルの誘導)

著者は、内部データをさまざまな方法で移動させることで、「破損」したモデルを修正しようと試みました。データを粘土の塊だと考えてください。

  • 試行 A: 重心の移動(重心のみ): 彼らは、粘土の塊全体を「クリーン」な答えの方向に押し動かすことだけを試みました。
    • 結果: 失敗。 モデルは混乱したままでした。重心を移動させても論理は修正されませんでした。
  • 試行 B: ノイズの追加: 彼らはデータにランダムなノイズ(雑音)を加えました。
    • 結果: 失敗。 モデルは混乱したままでした。
  • 試行 C: 塊の再形成(形状のみ): 彼らは塊を同じ場所に留めたまま、再形成して「クリーン」な答えの幾何学形状に一致させました。粘土をねじったり曲げたりして、それが「クリーン」な彫刻と全く同じに見えるまで調整しました。
    • 結果: 成功! モデルは突然、正しい答えを出すようになりました。

重要な洞察: 重要だったのはデータがどこにあったか(位置)ではなく、データが自分自身に対してどのように配置されていたか(形状)でした。モデルが正しく機能するためには、関係性の特定の幾何学的な「骨格」が必要なのです。

4. 「設計図の転送」(クロスプロンプトでの成功)

著者は、この「クリーンな形状」が普遍的な解決策かどうかをテストしました。

  • 彼らは、ある特定のパズルからの「クリーンな形状」を取り出し、構造は同じだが単語が異なる別のパズルに適用しました。
  • 結果: 成功しました!モデルは新しいパズルを解きました。
  • 注意点: これは、「クリーンな形状」が正しく解かれた例から来ている場合に限って機能しました。もし破損した例から「クリーンな形状」を転送しようとすれば、それは失敗しました。これは、モデルが単に特定の単語を暗記しているのではなく、「正しさ」のためのポータブルな幾何学的形式を学習していることを証明しています。

主張のまとめ

この論文が主張するのは、以下の 3 つの具体的な点のみです。

  1. 検出: プルケル符号エントロピーと呼ばれる数学的ツールを用いることで、モデルが関係性を特定の幾何学的形状(関係フレーム)として表現していることを検出できます。
  2. 介入: 単語を変更するのではなく、関係性の内部幾何学的「雲」を正しい例に一致するように外科的に再形成することで、モデルの推論エラーを修正できます。
  3. 特異性: これは、データの位置や大きさだけでなく、データの形状に起因して機能します。モデルは、正しい答えを得るために、この特定の幾何学的配置に依存しています。

この論文が主張していないこと:

  • AI の「魂」を発見したとは主張していません。
  • あらゆる種類の質問にこれが機能するとは主張していません(特定の論理グリッドでテストされました)。
  • モデルがこれらの形状を構築する完全な回路をマッピングしたとは主張していません(形状そのもののみを調べ、それを構築する「機械」については見ていません)。

要約すれば、この論文は、大規模 AI の「ブラックボックス」の内部において、関係性には明確で測定可能な 3 次元の形状が存在し、その形状を修正できれば AI の答えも修正できることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →