A Shared Subcircuit Lets LLMs Count Down Across Tasks
この論文は、Llama-3.1-70B-Instructにおいて、言語モデルが多様なタスクにわたって残りのトークン数を追跡することを可能にする共通の「カウントダウン・サブサーキット」を特定しており、異なるモデルやコンテキスト間で転移可能な、目標までの残り時間を推定するための汎用的なメカニズムを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、あるゲームをしていると想像してみてください。そこには厳しいルールがあります。書く文章は必ず正確に10単語でなければならず、さらに最後の一単語は必ず「telescope」でなければなりません。9単語で書けば負け、11単語なら負けです。
長い間、私たちは大規模言語モデル(LLM)——チャットボットの背後にある超スマートなAIの脳——は、こうしたタスクをただ推測して通り抜けているだけだと考えてきました。しかし、新しい研究は、機械の内部でより組織的なことが起きていることを示唆しています。研究者たちは、AIの中に、ゴールに到達するまで単語数をカウントダウンする、内蔵されたストップウォッチのように機能する、非常に特殊な「カウントダウン・サブサーキット(副回路)」が存在することを発見しました。
隠れたストップウォッチ
研究者たちはまず、特定のモデルである Llama-3.1-70B-Instruct に、固定の長さの文章を書くよう指示しました。彼らは、モデルがいつ停止すべきかをどのように知っているのかを知りたかったのです。モデルの「脳」を(具体的には、層ごとに情報がどのように処理されているかを)覗き見ることで、カウントダウンを担当している、3つのアテンション・ヘッド(小さな専門化された作業員のようなもの)からなる特定のグループが、レイヤー18に存在することを突き止めました。
L18H24、L18H28、L18H30 とラベル付けされたこれら3人の作業員は、単に推測しているわけではありません。彼らは、文章がいま現在どこにあり、どこで終わる必要があるのかという距離を実際に測定しているのです。
- 一人の作業員は、文章の早い段階で活動を開始します。
- もう一人は、中盤で動き出します。
- 三人目は、終盤にまさに起動します。
これらが一体となって、ターゲットとなる単語数に近づくにつれて強くなっていく、滑らかな「カウントダウン」信号を作り出します。それは、まるで異なるタイミングで鳴るように設定された3つの異なる目覚まし時計のようで、モデルが残り何単語(あるいは残りどれくらいの時間)があるのかを正確に把握できるようにしているのです。
「暗黙的」なカウントの魔法
ここからが本当に面白いところです。このカウントダウンは、AIに対して明示的に「10単語の文章を書いて」と指示した場合にのみ機能すると、あなたはおもうかもしれません。しかし、研究者たちは、モデルがもっと賢いことを発見しました。
彼らは、数字を一切与えないプロンプトでモデルをテストしました。代わりに、モデルにパターンを与えました。例えば、DNA配列やbase64コードのリストを見せ、それらがすべて全く同じ長さである状態を作りました。そのリストの続きを書くよう求められたとき、モデルは数字を必要としませんでした。モデルは単にパターンを「理解」したのです。モデルは前の例からターゲットとなる長さを推論し、同じカウントダウン・サブサーキットを使用して、正しい場所で停止しました。
この研究は、モデルがこの「目に見えない」長さの情報を、前の文字列の末尾に保存している(「次はこれくらいの長さになるはずだ」という隠されたメモのようなもの)ことを示唆しています。モデルは一つの文字列の終わりを見たとき、そのメモを読み取り、次のカウントダウンを開始するのです。
モデルやタスクを超えた普遍的なツール
研究者たちはそこで止まりませんでした。彼らは「教師なしプロービング(unsupervised probing)」という手法を用い、このカウントダウン・ツールが野生のどこに隠れているのかを調査しました。彼らは、ニュース記事、チャットログ、コードなど、膨大な量のテキストをスキャンし、これらの特定の作業員が作動している場所を探しました。
そして、カウントダウン・サブサーキットが驚くほど様々な場所で出現することを発見しました:
- 埋め込まれたツイート: モデルは自分がツイートを読んでいることを理解し、テキストに「ツイート」と書かれていなくても、280文字の制限に向かってカウントダウンを行いました。
- ASCIIテーブル: テーブルのフォーマットを行う際、モデルはすべての列が同じ幅になるようにスペースをカウントしました。
- 俳句: 5-7-5の構造のための音節数を追跡しました。
- SHAハッシュ: 64文字のコードがいつ終了するかを正確に把握していました。
これは、モデルが特定のタスクのためにルールを暗記しているのではなく、長さの追跡を必要とするあらゆる事柄に対して再利用可能な、汎用的な「カウントダウン・エンジン」を持っていることを示唆しています。
共通の設計図?
おそらく最も興味深い発見は、これがLlamaモデル特有の癖ではないということです。研究者たちは、このカウントダウン・サブサーキットの内部的な「幾何学(データの形状)」を、別のタスク(テキストを一行に収めるように折り返す作業)について研究された別のモデル、Claude 3.5 Haiku と比較しました。
彼らは、両方のモデルが、長さの情報を保存し処理するために、全く同じ数学的な形状を使用していることを発見しました。それはまるで、異なる工場で働く二つの異なる自動車メーカーが、どちらも自社の車に全く同じエンジンの設計を採用することに決めたかのようです。このことは、「カウントダウン・モチーフ」が、時間や空間を追跡する必要があるときに、多くのAIモデルが自律的に発見する、基本的な構成要素である可能性を示唆しています。
これが意味すること(そして意味しないこと)
論文は、彼らがこの特定の挙動を「リバースエンジニアリング(逆コンパイル)」したのだと注意深く述べています。彼らは、これらの特定のヘッドにおける信号を操作すれば、モデルが正しくカウントダウンをしなくなることを証明しました。彼らは信号を「測定」し、パターンを「観察」したのです。
しかし、彼らはAIが一般的にどのように考えるかという謎を解明したと主張しているわけではありません。彼らは、単に「いつ停止するかを知る」という特定の仕事において、AIが非常に具体的で、再利用可能で、驚くほど普遍的なツールを使用していることを示しているのです。これは、複雑で混沌としたAIの世界においても、整然とした、整理されたサブルーチンが存在し、それが機械が世界を理解する助けとなっていることを示す、小さくも強力なピースなのです。
ですから、次にAIが完璧な俳句を書いたり、正確に何スペース使うか指示されなくてもテーブルを整形したりしているのを見かけたら、覚えておいてください。その奥深くのどこかで、レイヤー18にいる3人の小さな作業員が、静かに時計を刻み、すべてがちょうど良く終わるように見守っているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。