Extracting Algorithms in Pre-trained LLMs: A Case on Hidden Markov Models
本論文は、隠れマルコフモデルに対する事前学習済みLLMのインコンテキスト学習性能と、その内部メカニズムとの間の溝を、候補となるアルゴリズムを経験的に絞り込み、それらのTransformerによる実装を理論的に検証し、そして予測を駆動する低次元の線形表現を特定および因果的に操作するための主活性化プローブ(Principal Activations Probe)を導入することによって埋めるものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、指紋を探す代わりに、巨大なコンピュータの脳の中にある目に見えない「思考」を探している探偵だと想像してください。この科学分野は**メカニスティック・インタープリタビリティ(機械論的解釈可能性)と呼ばれ、「機械は実際にどのように考えているのか?」という単純だがトリッキーな問いを投げかけます。この論文の謎を理解するために、まずはその機械が何を解こうとしているのかを知る必要があります。それは隠れマルコフモデル(HMM)**というゲームをプレイしています。HMMは、空が見えない天気予報のようなものだと考えてください。あなたに見えるのは地面だけです。地面は濡れているか、乾いているか? 草は緑か、茶色か? 「隠れた」部分は、実際には見ることができない「天気(晴れ、雨、曇り)」であり、それが地面の状態を引き起こします。コンピュータの仕事は、濡れた草や乾いた舗装路の長い履歴を見て、次の天気がどうなるかを推測することです。
しばらくの間、科学者たちは、私たちが日常的に使っている超スマートなAIチャットボットである巨大な**大規模言語モデル(LLM)**が、この推測ゲームにおいて驚異的に優れていることを知っていました。コンテキスト(文脈)が長くなるにつれ、彼らの予測は理論上の最高性能(オラクル)に近づき、同じデータに適用された古典的な推論アルゴリズムに匹敵、あるいはそれを上回ることさえありました。しかし、彼らが「どのように」それを実現しているのかは誰も知りませんでしたでした。AIは確率のルールを密かに学習したのでしょうか? パターンを暗記しているのでしょうか? それとも、何か奇妙で新しいトリックを使っているのでしょうか? それは、手品師が帽子からウサギを取り出す様子を見ているようで、そこに隠しコンパートメントがあるのか、二羽目のウサギがいるのか、あるいは魔法の呪文が使われているのか、全く見当がつかない状態でした。この論文は、研究者が初めて、AIが使っている正確なトリックを暴くために、手品師の帽子の中を覗き見ることに成功した初めての事例です。
研究者たちは、AIの秘密の戦略を突き止めるために、大規模な実験を設定しました。まず、彼らは人間がこの天気予報ゲームを解くために使う様々な数学的アルゴリズムを「容疑者リスト」として、AIをテストしました。その結果、AIの挙動をあらゆる状況で説明できる単一の人間用アルゴリズムは存在しないことがわかりました。ある時はAIは単純なパターンマッチングのように振る舞い、またある時は複雑な確率トラッカーのように振る舞いました。これにより、容疑者のリストは主に3つのタイプの戦略に絞り込まれました。
次に、チームは理論的な問いを立てました。「トランスフォーマー(これらのモデルが使用する特定のAIアーキテクチャ)は、果たしてこれら3つの戦略を実行できるのか?」 彼らは数学的に、それが可能であることを証明しました。彼らはさらに、非常に単純で小さなバージョンのAIを構築し、特定の天気パターンのみを使って学習させました。この小さなAIの脳を調べたところ、それは自然に「有限ウィンドウ」戦略を学習していることがわかりました。つまり、宇宙の全歴史を記憶しようとするのではなく、直近の数個のヒント(例えば、過去6回または8回の観測結果)を見て推測を行っていたのです。
しかし、本当の魔法は、すでに学習済みの巨大なAIモデル(すでに私たちと会話ができるもの)を見た時に起こりました。彼らは**主成分活性化プローブ(PAP)**と呼ばれる新しいツールを考案しました。AIの脳を、28の異なるレーンを持つ巨大な高速道路だと想像してください。PAPは、どのレーンでも交通を止め、そこにどのような情報が流れているかを確認し、さらにはその情報を別のシナリオと入れ替えて、AIの判断が変わるかどうかを確認できるセンサーのようなものです。
彼らが発見したことは、非常に興味深く、かつ少し意外なことでした。AIは常に一つの戦略を使っているわけではなく、パズルの難易度に応じて内部表現を適応させているのです。
- イージーモード: 天気のヒントが非常に明確で、地面の状態が予測通りに変化する場合(低エントロピー)、AIの挙動は単純な**バイグラム(Bigram)**統計と一致します。これは、次に何が起こるかを予測するために、実質的に「最後に見たもの」だけを見ている状態です。
- ハードモード: ヒントがノイズが多く混乱している場合(高エントロピー)、AIはソフトn-gramと呼ばれるより複雑な戦略に依存します。AIは「信念(belief)」を追跡し始め、直近の短い期間の情報を統合します。これは、「地面が濡れているが、昨日は晴れていたことも覚えているので、曇りで雨の可能性がある」と判断するようなものです。
決定的なことに、研究者たちは、AIが単にこれらの「信念」を保持しているだけでなく、意思決定のために実際にそれを使用していることを証明しました。彼らはAIの脳を「パッチ(継ぎ当て)」することでこれを行いました。つまり、難しいパズルの「信念」を取り出し、それをAIが簡単なパズルを解いている最中の脳に貼り付けたのです。すると、AIの予測は即座に、その難しいパズルの答えと一致するように変化しました。これは、「信念」が単なる付随的なメモではなく、予測を駆動するエンジンであることを示しています。しかし、彼らは重要な区別も見つけました。「ハードモード」では、単純なバイグラム戦略は初期の層には存在するものの、モデルの下流の計算によって事実上**バイパス(回避)**されているのです。AIは、真の不確実性が求められる場合にのみ、単純なパターンを無視して、より豊かな「信念の追跡」へと移行します。
しかし、別のひねりもありました。AIの脳の初期層において、「信念」の情報は存在しており、読み取ることも容易なのですが、AIはそれを無視しているのです! それは、ダッシュボードに地図があるのに、窓の外を見ながら運転しているようなものです。AIはその地図を、脳の後半の層に入ってから使い始めます。これは、コンピュータの脳の中に「アイデア」を見つけられるからといって、そのコンピュータが実際にそのアイデアを「思考」に使っているとは限らない、ということを意味しています。
結局のところ、この論文は、これらの巨大なAIが世界の複雑で完璧な数学的シミュレーションを実行しているのではないことを示唆しています。代わりに、彼らは非常に効率的な近似器(アプロキシメーター)になることを学んでいるのです。彼らは、人間が行うように、直近の短い期間の履歴を観察し、そこで起きていることについての「信念」を更新することを学んでいます。彼らは、次の単語や次の天気を予測するために、完璧な統計学者である必要はありません。ただ、直近の過去を追跡するのが上手ければよいのです。この発見は、これらのモデルの「魔法」が、実は非常に構造化され、理解可能な「パターンの追跡プロセス」であることを示しており、デジタルな精神がどのように機能しているのかを真に理解するための大きな一歩となります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。