← 最新の論文
🤖 machine learning

Beyond Fixed Directions: Adaptive Representation Analysis of Reasoning and Memorization in LLMs

本論文は、LLMにおける推論および記憶タスクは単一の表現方向によってデコード可能である一方で、この方向は固定されたものではなく、基礎となる情報がアクセス可能な状態に維持されている間にも、強化学習の過程で大幅な幾何学的再編成が行われることを示している。

原著者: Shaheen Nabi

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Shaheen Nabi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の世界において、大規模言語モデルは複雑なパズルを解いたり、膨大な量の情報を想起したりすることが可能になっています。科学者たちは、こうしたデジタル脳が実際にどのように機能しているのかを長らく疑問に思ってきました。有力な説の一つは、論理的推論や単純な事実の想起といった特定の振る舞いは、モデルの内部メモリ内にある明確で固定された経路に結びついているというものです。モデルの精神を、あらゆる思考が痕跡を残す広大で多次元的な空間だと想像してみてください。もしこの考えが真実であれば、数学の問題を考え抜いているモデルと、単に事実を思い出しているモデルの違いは、特定の方向を指す一本の直線として可視化できるはずです。この概念は非常に魅力的であるため、一部の研究者は、見つけた経路が安定して信頼できるものになると想定し、それらの固定された線をガイドとしてモデルの思考能力を高めようと試みてきました。

しかし、新しい研究は、これらの経路が留まり続けるという仮定に異を唱えています。研究者たちは、Qwen3-0.6Bとして知られる小型の言語モデルを詳しく調査し、厳格なトレーニングが行われた際に、この「固定された方向」という考えが成立するかどうかを確認しました。彼らは、半分が論理的推論を必要とし、残りの半分が事実の想起を必要とする、慎重にバランスの取れた400個の例を集めました。文の長さや特定の語彙といったノイズを取り除くことで、発見された差異が、まさに思考のタイプそのものに起因することを保証しました。彼らの最初の発見は心強いものでした。それは、ある特定の時点においては、推論と記憶の差は実に明白であり、一本の線によってこれら二つのグループを完璧に分離できることを確認したという点です。実際、この単純な線は、あらゆる角度からデータを分析する複雑な高次元解析と同等の精度を発揮しました。

物語は、研究者たちが推論スキルを向上させるために設計された「グループ相対方策最適化(group-relative policy optimization)」と呼ばれる強力な手法を用いてモデルを訓練したところで、転換を迎えます。もし固定方向の仮説が正しいならば、推論と記憶を分ける線は、モデルが学習を進めても同じ場所に留まるはずだと彼らは予想していました。ところが、モデルは依然として二つのタスクの違いを完璧に理解していたものの、その知識の「実際の方向」は劇的に変化していたことが判明したのです。訓練後、かつて明確に「推論」を指していた線は、元の位置とは一致しないほど大きく回転していました。平均して、新しい方向は以前の方向と約45パーセントしか似ておらず、モデルの最も深い層では、内部表現のドリフト(漂流)はさらに顕著になり、半分以上に達していました。

この発見は、モデルが「何を知っているか」と「その知識をどのように保存しているか」との間の決定的な違いを明らかにしています。情報自体は消失していませんでした。モデルは訓練後も、数学の問題とトリビアの質問を完璧な精度で区別することができました。しかし、その区別を表現するために使用していた幾何学的な座標は、完全に再編成されていたのです。それはまるで、都市の地図が図書館の場所を教える上では依然として完璧に正確であるものの、地図上のコンパスの方向が回転してしまい、「北」がかつての「東」を指すようになったような状態です。研究者たちは、訓練前と訓練後のモデルの内部状態を比較することでこの変化を測定し、その変化が単なる微調整ではなく、モデルの内部景観の实质的な再編であったことを突き止めました。

本研究は、推論と記憶を分離する能力は強固である一方で、この能力が単一の不変の方向に依存しているという考えは誤りであると結論付けています。情報は存続しますが、それがモデルの精神の中を通る具体的な経路は流動的であり、学習とともに変化します。このことは、これらの内部方向を用いて人工知能を導こうとする将来の取り組みにおいて、科学者たちは一度経路を見つけたらそれが有効であり続けると仮定することはできないことを示唆しています。代わりに、ランドマーク(目印)はそのまま残っていたとしても、地図自体は常に描き直されているのだという事実を受け入れなければならないのです。知識の安定性は、それにアクセスするために用いられる経路の安定性を保証するものではありません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →