States Hidden in Hidden States: Implicit Discrete State Representations Emerge in LLMs' Hidden States
本論文は、大規模言語モデルが、隠れ状態内に不完全な暗黙的離散状態表現を形成・利用することによって、明示的な思考の連鎖(chain-of-thought)なしにどのように拡張された計算を実行するかを調査し、同時にその形成を特徴付け、計算誤差への寄与を特定するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが、手品師が帽子からウサギを取り出す様子を見ていると想像してください。あなたは、そのウサギが何もないところから突然現れたわけではないことは分かっていますが、トリックの詳細は見えていません。長い間、人工知能(AI)を研究してきた科学者たちも、似たような状況に置かれてきました。彼らは、大規模言語モデル(LLM)と呼ばれるこれらの巨大なコンピュータの脳が、詩を書いたり、数学の問題を解いたり、人間のようにチャットしたりといった驚くべきことができることを知っています。しかし、それらがその「心」の中で(それは単なる膨大な数字とレイヤーの集合体に過ぎませんが)、どのようにしてそれを行っているのかは、一種のブラックボックスとなっていました。
この論文を理解するには、2つの単純なことを知る必要があります。第一に、LLMは文章の次の単語を一つずつ予測することで機能します。第二に、これを行う際、彼らは**隠れ状態(hidden state)**と呼ばれる情報の「一時的なメモ書き(スクラッチパッド)」を作成します。この隠れ状態は、AIが考えている間に作る「心のメモ」のようなものだと考えてください。通常、私たちはAIが質問全体を読んでから答えを推測していると想定しています。しかし、もしAIが長い数字のリストを読んでいる間に、まるであなたが買い物代金を頭の中で計算するように、密かに「走行合計(running total)」を頭の中で保持しているとしたらどうでしょうか? この論文は、AIは実際にその「暗算」を行っているのか、それとも単に推測しているだけなのか?という問いを投げかけています。
暗算のマジック
あなたがパーティーにいると想像してください。誰かがあなたに、「17, 38, 32, 87...」という長い数字のリストを渡し、何も書いたり、手順を口に出したりせずに、即座にそれらをすべて足すように頼みました。ほとんどの人は苦労するでしょうが、世界で最も賢いAIモデルは、この芸が非常に上手くなりつつあります。彼らは最大15個の数字の列を見て、手順を示すことなく、即座に正しい合計を吐き出すことができます。
「States Hidden in Hidden States(隠れ状態の中に隠された状態)」と題されたこの論文は、まさにこれらのAIモデルがどのようにこのトリックを成功させているのかを調査しています。チューシン大学の研究者たちは、これらのモデルが単に推測しているのではなく、密かに**暗黙的な離散状態表現(Implicit Discrete State Representations: IDSRs)**を構築しているのではないかと仮説を立てました。
この難しい用語を分解してみましょう。AIが水を運ぶバケツをリレーしている作業員チームだと想像してください。
- 暗黙的(Implicit): 彼らは数字を声に出して叫んでいるわけではありません(テキストを生成しているわけではありません)。
- 離散状態(Discrete State): 彼らは手に特定の正確な数字を持っています(例えば、17と20を足した後の「37」のようなもの)。
- 表現(Representation): この数字は、AIの内部レイヤーにおける一つのパターンとして存在しています。
研究者たちは、AIがリストを読み進める中で、単に最後まで待ってから一度にすべてを計算しようとしているのではなく、実際にこれらの中間的な数字を保持していることを証明したいと考えました。
探偵の仕事:脳の中を覗き見る
この「心のメモ」が本当に存在するのかを確認するために、研究者たちはAIの内部レイヤーに対して「20の質問」ゲームを行いました。彼らは**プローブ(probe)**と呼ばれるツールを使用しました。プローブは、AIの内部メモを特定の瞬間に覗き見て、「今、何を考えているの?」と尋ねることができる、非常に高速で小さな探偵のようなものだと考えてください。
彼らはこれを、小型のモデル(Llama2-7Bなど)から巨大なモデル(GPT-4やQwen-72Bなど)まで、さまざまなモデルでテストしました。彼らはモデルに、2個から14個の数字を用いた加算問題を解かせました。
判明したこと:
- 大きくなればなるほど強くなる: この暗算能力は、モデルが大きくなるにつれて「創発(出現)」します。小さなモデルは2つか3つの数字を加算できますが、リストが8個に達すると崩壊します。しかし、最も大きなモデルは、11個、あるいは15個のリストでも驚くほどの正確さで処理できます。
- 隠されたメモは実在する: 研究者が「探偵プローブ」をAIの隠れレイヤーに使用したところ、モデルは確かに「走行合計」を保持していることが分かりました。例えば、AIが「17 + 24」を読んだ後、その内部状態には、まだ「41」という言葉を口に出していないにもかかわらず、「41」の表現が含まれていました。
- 完璧ではない: 悪いニュースは、この心のメモは完璧ではないということです。数字のリストが長くなるにつれて、「メモ」は少しぼやけていきます。研究者は、AIが最初の数ステップでは数字を完璧に保持できる一方で、15番目の数字に到達する頃には、内部表現の詳細が失われ始めることを発見しました。この「情報の欠落を伴う(lossy)」圧縮こそが、最も賢いモデルでさえ最終的な答えを間違える理由です。
AIはいかにして数字を構築するか
論文はまた、AIがどのようにしてこれらの数字を構築しているのかについても解明しました。これは驚くほど人間のやり方に似ています。
- 一桁ずつ: AIは数字全体を一度に計算するわけではありません。右側(一の位)から始まり、次に十の位、そして百の位へと、桁ごとに答えを構築していきます。これは、紙の上で筆算をする作業が、AIの脳内で完全に起きているようなものです。
- 「浅い」レイヤー vs 「深い」レイヤー: AIには多くの処理レイヤーがあります。研究者は、最初の10レイヤーが「計算機」の部分であり、単に生の計算を行っていることを発見しました。しかし、情報がより深いレイヤー(レイヤー10以降)に移動すると、AIは文章のコンテキスト(文脈)を混ぜ込み始めます。これは、計算機が周囲の会話に気を取られてしまうようなものです。この混ざり合いこそが、「ぼやけ」や最終的な答えのミスを引き起こす原因となります。
- 魔法ではなく線形: AIは、魔法のように一度に計算を行うのではありません。リストを直線的に処理します。もしA, B, C, Dという数字があれば、(A+B)を計算し、その結果にCを足し、次にDを足します。(A+B)と(C+D)を別々に計算して後で組み合わせることはしません。
「架け橋」実験
AIが単に推測しているのではなく、実際にこれらの隠れたメモを使用していることを証明するために、研究者たちは巧妙なトリックを行いました。彼らはAIのアテンション・メカニズムに「架け橋」を築きました。想像してみてください。AIが長い文章を読んでいる最中に、彼らはAIが文章の最初の方を見返すことをブロックし、直前に読んだものだけを見るように強制しました。
もしAIが文章全体に基づいて推測しているだけなら、このブロックによってAIは完全に壊れてしまうはずです。しかし、AIは「架け橋(直前の加算記号)」が見える限り、数学の問題を解き続けることができました。これは、AIが人間と同じように、一歩ごとに走行合計を次のステップへと運び続けていることを証明しました。
まとめ
この論文は、巨大なAIモデルが手順を示さずに数学を行うとき、彼らは実際に作業を行っていることを示唆しています。彼らは、読み進める中で走行合計を保持する、目に見えない内部的な「付箋(sticky notes)」を作成しているのです。
しかし、注意点があります。これらの付箋は完璧ではありません。数字のリストが長くなるにつれて、付箋は少し汚れ、AIは間違い始めます。研究者たちは、もしこれらの内部的なメモをより明確にし、情報の欠落を減らす方法を見つけることができれば、数学だけでなく、より複雑な推論タスクにおいてもAIを大幅に向上させることができると考えています。
今のところ、私たちはAIが魔法使いなのではなく、たとえその集計が長いリストの終わりで少しぼやけてしまったとしても、非常に優れた「心の集計」を行っているのだということを知っています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。