← 最新の論文
🤖 AI

Functional Subspace, where language models can use vector algebra to solve problems

本論文は、大規模言語モデルがその活性化空間内で機能的な部分空間を利用しており、そこではコンテキスト内学習タスクが証拠を蓄積する単純なベクトル代数演算によって解決されると仮説を立て、その証拠を提示する。

原著者: Jung H. Lee, Sujith Vijayan

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Jung H. Lee, Sujith Vijayan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(LLM)を、人間の言葉で「思考」する巨大で魔法のような脳ではなく、すべての情報が一冊の本として収められた、巨大な多階建ての図書館として想像してみてください。長い間、この図書館がどのように本を整理し、質問をされたときに正しい答えをどのように見つけていたのか、私たちは知りませんでした。

この論文は、その図書館を見るための魅力的な新しい方法を提案しています。LLM が問題を解決する際、図書館全体を単に「読み取る」のではなく、その特定のタスクのために記憶の中に特別で仮設的な部屋(「部分空間」)を構築し、その部屋の中で単純な数学(ベクトル代数)を用いて問題を解決すると示唆しています。

以下は、日常の比喩を用いた彼らの発見の概要です。

1. 「文脈」の部屋(イン・コンテキスト・ラーニング)

チャットでいくつかの例を与えるだけで、コンピュータに新しいトリックを教えることができることを知っていますか?例えば、以下のように入力するとします。

  • 「熱い:冷たい」
  • 「速い:遅い」
  • 「大きい:?」

コンピュータは「小さい」と推測します。これをイン・コンテキスト・ラーニング(ICL)と呼びます。この論文は問いかけます:コンピュータは再学習なしに、これをどのように理解するのでしょうか?

著者たちは、コンピュータがこの特定の会話のために専用の作業スペース(部分空間)を作成すると提案しています。まるで、シェフがサラダを注文されたのを見て、すぐに特定のまな板を片付け、ステーキやスープを無視してサラダの材料だけを集めるようなものです。コンピュータは、その膨大な知識の残りの部分から「サラダ」の論理を分離します。

2. 「ベクトル代数」のレシピ

コンピュータがこの特別なお部屋に入ると、人間の意味で言葉の「意味」を理解する必要はありません。代わりに、言葉を特定の方向を指す矢印(ベクトル)として扱います。

  • 比喩:「幸せ」を北を指す矢印、「悲しみ」を南を指す矢印だと想像してください。
  • 数学:コンピュータが「幸せ:悲しみ」というパターンを見ると、「答えを得るには、矢印を 180 度反転させる」というルールを学びます。
  • 結果:「速い:?」と尋ねると、コンピュータは「速い」の矢印を取り、それを反転させます(それが対義語のルールだからです)。そして「遅い」に到達します。

この論文は、これらのタスクにおいて、コンピュータは本質的にこれらの矢印に対して加算と減算を行っていると主張しています。深く「思考」しているのではなく、単純な幾何学的計算を実行しているのです。

3. 図書館が部屋を構築する方法

この論文は、コンピュータがそのアーキテクチャ内の 2 つの主要なツールを使用して、この部屋をどのように構築するかを説明しています。

  • 「記憶のスタック」(フィードフォワード・ネットワーク):これらはファイルキャビネットのように機能します。コンピュータが単語を見ると、その単語に関連する可能性のある答えのリストを引き出します。「ロンドン」と言えば、キャビネットは「イギリスの首都」「金融ハブ」「雨の多い都市」などを引き出します。
  • 「スポットライト」(セルフアテンション):これはどのファイルを使用するかを決定する部分です。プロンプトが地理に関するものであれば、スポットライトは「首都」のファイルに当たります。金融に関するものであれば、「ハブ」のファイルに当たります。

著者たちは、コンピュータが例(「熱い:冷たい」のペア)を処理するにつれて、この特別なお部屋に証拠を蓄積していくことを発見しました。ブロックを積み重ねるようなものです:すべての例が「対義語」の山にブロックを一つずつ加えます。最終的な質問に到達する頃には、その山は答えを予測するのに十分な高さになっています。

4. 部分空間の「魔法」

研究者たちは、モデルの層を流れるデータである内部の「残差ストリーム」を調べることでこれをテストしました。彼らは、データが移動している「主な方向」を見つけるために、PCA(主成分分析)と呼ばれる統計ツールを使用しました。

彼らが発見したもの

  • コンピュータは自然にこれらの低次元の部屋(部分空間)を作成します。
  • これらの部屋では、質問と答えの関係はほぼ完全に線形(直線のよう)です。
  • コンピュータが正解すれば、この部屋の数学は一つの様相を呈し、誤れば異なる様相を呈します。これは、コンピュータが実際にこの特定の「部屋」と「数学」を使用して意思決定を行っていることを証明しています。

まとめ

この論文は、大規模言語モデルが単にパターンに基づいて推測しているだけではないと主張しています。代わりに、いくつかの例を与えられると、彼らは以下のことを行います。

  1. 記憶の中に仮設的で専門的な部屋を構築します。
  2. 言葉を矢印(ベクトル)に変換します。
  3. その部屋の中で単純な数学(矢印の加算や減算など)を用いて答えを見つけます。

これは、AI の「創発的機能」、つまり新しいスキルを瞬時に習得しているように見える現象が、実際にはモデルが既存の知識をこれらの整然とした数学的部分空間に整理し、手元の謎を解いているに過ぎないことを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →