← 最新の論文
💬 NLP

Prompt-Model Interaction Reaches the Fixed Points: A deterministic, task-free structural readout -- and the factorizations of it that failed

本論文は、プロンプトとモデルの相互作用が短期間のうちに決定論的かつタスクに依存しない不動点構造へと収束することを示し、この現象がタスクの性能や、接頭辞の長さやアテンション・シンクといった提案された要因ではなく、特定のプロンプトとモデルの組み合わせによって駆動されていることを明らかにしている。

原著者: Nicolás Vera Zúñiga

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Nicolás Vera Zúñiga

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界において、大規模言語モデルはしばしば汎用的なツールとして扱われる。問いを投げかければ、モデルは答えを提供するというものだ。長年、研究者たちは、問いの立て方(具体的な言葉、フォーマット、あるいはスタイル)が結果を劇的に変え得ることを知っていた。あるモデルには極めて優秀に見えるプロンプトが、別のモデルには愚かに見せることがあり、意味のない些細なテキストの変化でさえ、「最高」とされるモデルのランキングを入れ替えてしまうことさえある。この現象は「プロンプト・モデル相互作用」として知られ、数学の問題解決やコード作成といったタスクにおいて十分に文書化されてきた。しかし、一つの拭いきれない謎が残っていた。この感受性は、モデルがタスクを実行するために用いる複雑なメカニズムに属するものなのか、それともモデルが情報を処理する仕組みそのものに備わった根本的な特性なのか、ということである。これに答えるために、科学者たちは、モデルが「何もしようとしていない」状態のモデルを観察する必要があった。指示も、目標も、正解であるというプレッシャーもない、純粋でタスクのない存在状態へと剥き出しにされたモデルを観察する必要があったのである。

独立した研究チームは、タスク自体を排除することでこの調査を進めようと試みた。モデルに問題を解かせる代わりに、短いテキストのシーケンスを入力し、モデルが次の単語、そしてその次の単語を予測し続けるループの中で、何が起こるかを観察した。モデルはランダムにサンプリングしているのではなく、最も可能性の高い次の単語を選ぶという厳格で決定論的なルールに従っていたため、このプロセスは、ボールが丘を転がり落ちて谷間に落ち着く様子に似ていた。場合によっては、ボールは単一の安定した谷に転がり込み、永遠にそこに留まることもあれば、ループに陥ったり、目的もなく彷徨ったりすることもある。研究者たちは、モデルの予測がどれほど頻繁にその安定した状態に落ち着くかを測定し、これを「固定点分数(fixed-point fraction)」と呼んだ。彼らは、シーケンスが始まる前に、わずか9つの単語またはトークンの短い接頭辞を加えた場合に、この挙動がどのように変化するかをテストした。目的は単純であった。ごくわずかな追加テキストが、モデルが何を目指そうとしていない時であっても、モデルの内部的な軌道を根本的に変え得るのかどうかを見極めることである。

結果は衝撃的であり、研究者たちの予想をも裏切るものだった。彼らは、プロンプトとモデルの相互作用が、このタスクのない読み取りにおいてもフルパワーで作用していることを発見した。わずか9つのトークンの条件付けテキストを加えるだけで、測定された読み出し値を、その可能な全範囲のほぼ全域へと移動させるのに十分であった。あるモデルにとっては、この小さな追加が、混沌とした彷徨うような予測パターンを、完璧に安定したものへと変えた。また別のモデルにとっては、逆に、以前は安定していたパターンを破壊し、予測をループへと突き落とした。その効果は非常に強力で、モデルの挙動の構造的な分類さえも完全に変えてしまうほどであった。これを比較するために、研究者たちはこの変化を、標準的なベンチマークにおけるモデルの性能を通常60ポイント以上向上させる大規模なプロセスである「インストラクション・チューニング」の影響と比較した。その力強いトレーニングはモデルのタスク性能を大幅に動かしたが、この特定の構造的な読み取りについては全く変化させなかった。対照的に、わずか9語の接頭辞が、モデルの挙動を一方の極端からもう一方の極端へと反転させることができたのである。これは、プロンプト・モデル相互作用が、単にモデルが指示に従う際の癖ではなく、モデルがテキストの断片を読み取る際の、深く構造的な事実であることを証明していた。

研究者たちはなぜこのようなことが起こるのかを説明しようと、もっともらしいいくつかの自然な仮説を立てた。彼らは、追加されたテキストの長さが原因なのか、あるいは内容(平易な散文なのか、フォーマットされたコードなのか)が原動力なのかと考えた。また、その効果が普遍的なもの、つまり常にモデルを同じ方向へ押し出すものなのか、それとも指示に従うように訓練された特定のタイプのモデルに見られる特有の性質なのかも検討した。彼らは、まず小規模なモデルのグループから始め、その後、より多様なアーキテクチャやテキストタイプを含むようにサンプルを広げることで、これらのアイデアを厳密にテストした。彼らが提案した五つの候補となる説明は、サンプルの拡大によってすべて失敗に終わった。効果は単にテキストの長さによるものではなかった。実際、その関係は滑らかでも予測可能でもなく、あるモデルは単語一つに対して激しく反応する一方で、他のモデルはそれを無視することもあった。テキストの内容もまた、パターンの説明にはなり得なかった。あるモデルに有効なことが他のモデルでは通用しないことが多く、変化の方向はテキストとモデルの特定の組み合わせによって反転した。指示学習済みのモデルがこれらの変化に抵抗するという考えでさえ、より多様なテキストをテストした際には誤りであることが判明した。

これら五つの説明が崩れ去った後に残ったのは、単純で、執拗な現実であった。その効果は、プロンプトとモデルのどちらか一方に属するのではなく、その「ペア」に属していたのだ。単一の固定された9語の接頭辞が、4つの異なるモデルを完全な安定状態へと導く一方で、他の2つのモデルを完全な混沌へと押し込むことがあった。あるモデルの予測を固定させたのと同じテキストが、別のモデルの予測を崩壊させたのである。この挙動は、実世界で一般的なテキストを使用しても存続したため、奇妙な言葉やランダムな言葉を用いたことによるアーティファクトではないことが証明された。研究者たちはまた、モデルの内部メカニズム、具体的にはモデルがシーケンスの最初のトークンにどれだけの注意を払っているかについても調査した。有力な理論の一つは、初期トークンが「シンク(吸収源)」として機能し、モデルの注意を吸収して結果を決定するというものであった。しかし、これを測定したところ、その理論は変化の方向を予測できなかった。あるモデルでは、アテンション・シンクが増加すると安定性も上昇したが、別のモデルでは、アテンション・シンクが増加したにもかかわらず安定性が急落した。機械的な説明は、実世界のテキストに対しては成立したが、彼らのプローブで使用されたランダムな入力に対しては完全に崩壊した。これは、研究者たちが、その機械的理論が適用される領域の外側にいたことを示唆していた。

本研究は、この現象の解説単位は、プロンプトとモデルのペアそのものであると結論付けている。特定のモデルが特定のプロンプトに対してどのように反応するかを予測できる、単一の普遍的なルール(テキストの長さ、内容、あるいはモデルのタイプに関するルール)は存在しない。研究者たちは、自らの普遍的なルールへの試みが、しばしば微妙な誤りによって躓いたことを発見した。すなわち、変動の余地がない量に対して、硬直した基準を適用してしまったことである。例えば、当初はすべてのモデルが同じ方向に動くという普遍的な方向性を見出したと考えていたが、後に、自身のサンプルサイズが小さいために例外を見逃していたことに気づいた。サンプルを広げ、成立しないパターンを受け入れることを拒むことで、彼らは自分たちの発見に誠実さを担保した。最終的な全体像は、深い「特異性」を描き出している。モデルがテキストの断片を読み取る方法は、モデルの一般的な特性でもなければ、テキストの一般的な特性でもない。それは、その特定のテキストが、その特定のモデルと出会った時にのみ立ち上がる、独自の相互作用なのである。研究者たちは、科学界に対し、この検証を継続することを呼びかけているが、新たな要因が同様の厳格なサンプルの拡大テストを生き残たない限り、答えは、この相互作用がペア固有の事象であり、単純な分類を拒むものであるという状態のままである。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →