← 最新の論文
🤖 AI

Decomposing how prompting steers behavior

本論文は、プロンプティングがいかに内部表現を変容させることで大規模言語モデルおよび視覚言語モデルを制御するかを明らかにする入れ子状の幾何学的分解フレームワークを導入し、アフィン変換、具体的には次元間をまたぐ線形混合が、指示されたタスク構造に一致するように表現を再編成し、目標とする振る舞いを回復させるための鍵となるメカニズムであることを示している。

原著者: Fan L. Cheng, Nikolaus Kriegeskorte

公開日 2026-06-03
📖 1 分で読めます☕ さくっと読める

原著者: Fan L. Cheng, Nikolaus Kriegeskorte

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(LLM)や視覚言語モデル(VLM)を、巨大で複雑な工場だと想像してみてください。その工場の中では、原材料(猫の写真や、悲しい物語についての文章など)が、一連のコンベアベルト(モデルのレイヤー)を通って流れていきます。原材料が移動するにつれて、それらは加工され、形を変えられ、整理されていきます。

通常、工場の生産物を変えるには、機械を作り直す(モデルを再学習させる)必要があります。しかし、プロンプティングとは、マネージャーが工場にやってきて、「色で分けるのをやめて、今度はサイズで分けろ!」と新しい指示を叫ぶようなものです。機械自体は変わりませんが、出力は突然変化します。

この論文は、シンプルかつ深い問いを投げかけています。**「マネージャーの叫びが、実際にどのようにコンベアベルト上のアイテムを並べ替え、異なる分類を行わせるのか?」**という問いです。

以下に、日常的な比喩を用いた彼らの発見の解説をまとめます。

1. 実験:「魔法の地図」

研究者たちは、一連のアイテム(例えば1,000枚の異なる画像)を用意し、それをモデルに2種類の異なる指示とともに提示しました。

  • プロンプトA: 「この写真に人はいますか?」(はい/いいえの回答)。
  • プロンプトB: 「この写真には何人の人がいますか?」(数値による回答)。

彼らは、異なる深さにおけるモデルの「内部状態」(コンベアベルト上のアイテムの配置)を観察しました。その結果、プロンプトAとプロンプトBでは、アイテムの形状が異なっていることを見出しました。

そこで彼らは、次のように問いかけました。「『はい/いいえ』の配置を、『カウント(数え上げ)』の配置へと変換する、シンプルな地図を描くことはできるだろうか?」

2. 5つのレベルの「地図」(入れ子状の分解)

答えを見つけるために、彼らは数学的な「地図」(変換)を、最も単純なものから複雑なものへと5つのタイプに分けて試しました。これらは、本の山を並べ替えるさまざまな方法だと考えてください。

  1. 平行移動(スライド): 本の山自体には一切触れず、ただテーブル上の新しい場所にスライドさせること。
  2. 剛体+一様スケーリング(剛体移動): 本の山を移動させ、全体をわずかに大きくしたり小さくしたりするが、お互いの相対的な形はそのまま維持すること。
  3. 剛体+軸スケーリング(引き伸ばし): 移動させた上で、特定の方向に対して引き伸ばすこと(例:水平方向にはゴムシートを引っ張るが、垂直方向には引かない)。
  4. アフィン(混合): 移動、引き伸ばし、そして混合。これは、「上の本」と「横の本」を混ぜ合わせて、新しい位置を作り出すようなものです。
  5. 非線形(歪み): テーブル自体を曲げたり、複雑で予測不可能な方法で本をねじ曲げたりすること。

3. 大きな発見:それは主に「混合」である

研究者たちは以下のことを発見しました。

  • 「スライド(平行移動)」が大きな役割を果たしている。 内部状態を新しい場所に移動させるだけで、変化の大部分が説明できます。
  • しかし、「混合(アフィン)」こそが秘訣である。 スライドも助けになりますが、モデルが新しいタスクを完全に理解するためには、内部の特徴を混合(次元間の線形混合)する必要があります。
  • 「歪み(非線形)」は必要ない。 驚くべきことに、複雑でねじれた数学を用いる必要はありませんでした。「混合(アフィン)」を加えるだけで、モデルの挙動はほぼ完璧に再現されました。複雑な非線形の要素は、それほど価値をもたらしませんでした。

比喩: レゴブロックで作られた城(プロンプトA)が入った箱を想像してください。これを宇宙船(プロンプトB)に変えたいとします。

  • プラスチックを溶かす(非線形)必要はありません。
  • 単に箱を部屋の別の場所にスライドさせる(平行移動)だけでは足りません。
  • 城を解体し、パーツを引き伸ばし、そして新しい構造へと並べ替え、混合する必要があります。この論文は、この「並べ替えと混合」こそが、プロンプトが機能する核心的なメカニズムであることを明らかにしました。

4. 「因果関係」のテスト:その地図は本当に機能するか?

これが単なる偶然ではないことを証明するために、彼らはモデルに対して「手術」を行いました。

  1. モデルに「はい/いいえ」のプロンプトを含む画像を入力します。
  2. 特定のレイヤーで、プロセスを停止させます。
  3. その内部状態に対して、彼らの「混合地図」を適用します。
  4. モデルに処理を最後まで完了させます。

結果: モデルは、技術的にはまだ「はい/いいえ」の質問を受けているにもかかわらず、突然「カウント(数え上げ)」の回答を始めました! これにより、幾何学的な変換(地図)が挙動の変化を**引き起こしている(原因となっている)**ことが証明されました。

5. モデルごとに異なる戦略

異なる工場に異なるマネージャーがいるように、異なるAIモデルも異なる戦略をとります。

  • OPT-2.7B は、初期段階で「引き伸ばし」や「混合」(複雑な変換)に大きく依存しているようです。
  • Llama3 や Qwen3 は、初期段階でより単純な「スライド(平行移動)」に依存しているようです。おそらく、データを正しい場所へ移動させるための特定の「指示コード」を使用しています。

まとめ

この論文は、AIに新しい指示を与えたとき、モデルは根本的に脳を書き換えたり、複雑でねじれた数学を行ったりする必要はないと結論付けています。代わりに、モデルは主に、内部的な理解を新しい場所へとスライドさせ、新しいタスクに適合するように特徴を直線的な方法で混合(アフィン変換)しているのです。

これにより、AIモデルがどのように指示に「耳を傾ける」のかについて、明確な幾何学的イメージが得られました。彼らは本質的に、内部データの高度で多段階の並べ替えを行っており、その並べ替えのうち、どれくらいが単純なスライドであり、どれくらいが複雑な混合であるかを、私たちは今や正確に測定できるようになったのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →