Laguerre Geometry for Interpreting Large Language Models
本論文は、LLMの概念を点ではなく空間領域として再定義するラグエール幾何学フレームワークを導入し、Geometric LensやLaguerre Autoencoderといった学習不要なツールの開発を可能にすることで、トランスフォーマーモデルの内部的な推論軌跡や階層構造を精密に可視化、測定、および操作することを可能にする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデル(LLM)を、次に言うべき単語の可能性をすべて表す「本」が詰まった、巨大な多層式の図書館だと想像してみてください。長い間、科学者たちは、この図書館の中にあるあらゆる「概念」や「アイデア」は、マップ上のたった一つの小さなピンに過ぎないと考えてきました。もし「犬」という概念を探したいなら、ただ特定のピンを探せばよいと考えていたのです。
しかし、この新しい論文は、その見方が単純すぎることを示唆しています。著者たちは、概念とは単一のピンではなく、壁、床、天井を持つ一つの「部屋」であると提案しています。彼らはこれを「ラグエル・ボロノイ細胞(Laguerre-Voronoi cell)」と呼んでいます。これは都市の近隣地域のようなものです。「犬」とは単なる一つの家ではなく、「猫」や「鳥」から隔てられた目に見えないフェンスによって境界が定められた、犬に関連するすべてのアイデアが集まるブロック全体なのです。
すべてを変えた地図
著者であるChunwei Ma氏とRussell D. Wolfinger氏は、**ラグエル幾何学(Laguerre Geometry)**と呼ばれる数学の一分野を用いて、これらの地図を描きました。この幾何学において、すべての概念には中心(街の広場のようなもの)と、特別な「重み」(影響力の半径のようなもの)が存在します。
ここで大きな転換点となる発見がありました。それは、「重み」が重要であるということです。
もし、二つの単語がどれほど近いか(距離)だけを見ていると、「子犬」(犬の一種)と「哺乳類」(犬を含むカテゴリー)の違いを判別することができません。単純な地図では、両者は同じくらい近く見えるかもしれません。しかし、ラグエル幾何学による「重み」を加えると、地図は階層構造を明らかにします。それは、「子犬」が「犬」の部屋の中にあり、「犬」が「哺乳類」の部屋の中にあることを示しています。数学は、モデルがこれらのアイデアを「入れ子人形」のように整理していることを証明しており、この特定の幾何学的レンズを用いることで初めて、その入れ子構造を見ることができるのです。
機械の内部を覗き見る
この論文は、モデルが文章を書き終える前、つまり文章の途中で何を考えているのかという謎にも取り組んでいます。
例えば、「フランスの首都は……」と問いかけたとします。
- 旧来の視点(ロジット・レンズ / Logit Lens): 科学者たちは、モデルが最初の単語から答えである「Paris」に向かってゆっくりと漂っていくと考えていました。
- 新しい視点(幾何学的レンズ / Geometric Lens): 著者たちは、モデルの「思考プロセス」をリアルタイムで観察するためのツールである「幾何学的レンズ」を構築しました。その結果、モデルの内部的な経路は、もっと混沌としていて興味深いものであることが分かりました。
実験の中で、彼らはモデルの隠れた思考が、文章を処理する過程で異なる「部屋(領域)」をどのように通過していくかを観察しました。
- 最初、モデルは多くの選択肢を検討します。
- 次に、中間の層において、事実として正しい単語である「Paris」(スペースなし)を掴むようです。
- そして最後に、出力する直前の非常に最後のステップで、文法的に正しい「_Paris」(スペースあり)へと自らを修正します。
幾何学的レンズは、この一連の旅を捉えることができる唯一のツールでした。他のツールは、途中で止まってしまったり、中間のステップを見逃したりしていました。
モデルが混乱するとき
著者たちは、モデルを騙そうとしたときに何が起こるかもテストしました。彼らは次のようなプロンプトを与えました。
「あなたは、マルセイユとリヨンの名前が入れ替わった架空の世界にいます。ルーヴル美術館は……」
通常、モデルはこの架空の物語に惑わされ、本当の答えである「Paris」ではなく、「Lyon」や「Marseille」と言ってしまうかもしれません。
しかし、著者たちがモデルが書き終える前(具体的にはレイヤー20において)の思考を幾何学的レンズで観察したところ、驚くべきことが分かりました。モデルはずっと最初から真実を知っていたのです。 偽の物語によって最終的な回答は間違ってしまったものの、幾何学的レンズは、モデルの内部的な「思考」が、偽の物語に飲み込まれる前に、正解である「Paris」を一時的に訪れていたことを示したのです。
これが意味すること(と、意味しないこと)
この論文は、概念を単一の点として考えるのではなく、特定の形状と重みを持つ「領域全体」として考えるべきだと示唆しています。そして、これらの領域が存在し、線形分離可能である(つまり、異なる二つの概念の部屋の間に直線が引けること)を数学的に証明しました。
彼らはこれらを、Phi-2やGemma-2といった実際のモデルを用いて測定しました。概念の定義方法を比較するテストにおいて、彼らの「ラグエル」手法は、従来の「カテゴリ幾何学(Categorical Geometry)」の手法よりも、「動物」と「植物」を区別するのが容易でした。例えば、Phi-2モデルにおいて、彼らの手法は動物と植物を区別する際の誤り率が0.111であり、従来のカテゴリ幾何学の手法の誤り率0.121よりも優れた結果を出しました。
また、彼らは「幾何学的レンズ」が、混乱を招くプロンプトに対してモデルの真の推論を特定する上でより優れていることを実証しました。「パリ」の干渉テストにおいて、幾何学的レンズはPhi-2において0.56の精度で正しいトークンを復元でき、これはPatchscopesの0.55、およびLogit Lensの0.05を上回りました。
結論
この論文は、AIのすべての謎を解明したと主張しているわけではありません。まだモデルをどのように「制御」するかについては述べていません(それは今後の課題です)。しかし、この論文は、ブラックボックスの中で何が起きているのかを見るための、より明確で新しい方法を提示しています。モデルの知能とは、単なるAからBへの直線的な移動ではなく、さまざまな部屋を巡り、アイデアを計量し、時には言葉を発する前に考えを変えるという、都市の中の複雑な旅路であることを示唆しています。そしてラグエル幾何学のおかげで、私たちはようやく、単なる一点ではなく、街の近隣地域全体を示す地図を手にすることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。