← 最新の論文
💻 computer science

How Many Different Outputs Can a Transformer Generate?

本論文は、トランスフォーマーが多様な出力シーケンスを生成する能力が本質的にプロンプトの長さによって制限されることを立証し、アクセス可能なシーケンスの数がプロンプトに対して線形に増加する一方で、ある臨界閾値を超えるとアクセス可能なシーケンスの割合が指数関数的に減少することを示し、これによりコピーや暗記などのタスクにおける経験的な失敗を説明する。

原著者: Maxime Meyer, Mario Michelessa, Caroline Chaux, Vincent Y. F. Tan

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Maxime Meyer, Mario Michelessa, Caroline Chaux, Vincent Y. F. Tan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

「トランスフォーマーは何種類の異なる出力を生成できるか?」という論文を、平易な言葉と創造的な比喩を用いて解説します。

大きなアイデア:トランスフォーマーの「有限な図書館」

チャットボットの背後にある AI モデルであるトランスフォーマーを、無限で魔法のような脳ではなく、巨大でハイテクな図書館として想像してみてください。

この論文が問いかけるのは、シンプルな疑問です:この図書館が実際に生成できる「本」(単語の並び)は何種類あるのでしょうか?

著者たちは驚くべき限界を発見しました:図書館がどれほど大きくても、どれほど時間をかけても、生成できるユニークな物語の数は有限です。 考えられる物語のほとんどは本質的に「アクセス不能」です。たとえ異なるプロンプトで仕掛けようとしても、図書館にはそれらを書き記す物理的なスペースや「インク」が根本的に不足しているのです。

核心的な比喩:ピクセル化された地図

なぜこのようなことが起こるのかを理解するために、トランスフォーマーの内部思考プロセスを巨大な地図(「埋め込み空間」と呼ばれます)として想像してみてください。

  1. 地図はピクセル化されている: コンピュータは有限の精度を持つ数値(固定されたピクセル数のデジタル写真のようなもの)を使用するため、この地図は滑らかで連続的ではありません。小さな離散的な「タイル」や「ピクセル」で構成されています。
  2. ゾーン: この地図上で、異なる領域は異なる次の単語に対応します。AI の内部の「ポインタ」がゾーン A に着地すれば「猫」と書き、ゾーン B に着地すれば「犬」と書きます。
  3. サイズの問題: AI に長く長い物語を書かせようとすればするほど、単語の組み合わせの数は爆発的に増加します。
    • 長さ 100 のすべての可能な文をこの地図に収めようとする様子を想像してみてください。
    • 地図が有限のタイルでできているため、特定の長い文に対応する「ゾーン」は信じられないほど小さくなります。単一のピクセルよりも小さくなるのです。
    • ゾーンがピクセルより小さくなると、AI はそれを隣接するゾーンと区別できなくなります。文字通り、その特定の長い文を書くための経路を「見る」ことができないのです。

3 つの主要な発見

この「ピクセル化された地図」について、論文は以下の 3 つの主要な事実を証明しています。

1. 「プロンプト」は鍵だが、限界がある
入力するテキストである「プロンプト」を、図書館の特定の扉を開くと想像してください。

  • 論文は、AI が書ける物語の長さが、鍵(プロンプト)の長さに比例して線形的に増加することを示しています。
  • 比喩: 1 語のプロンプトを与えれば、AI は 10 語の物語しか書けないかもしれません。10 語のプロンプトを与えれば、100 語の物語を書けるかもしれません。しかし、無限に単語を追加し続けることはできません。やがて「鍵」は、より長く新しい経路を開くためのユニークな組み合わせを使い果たしてしまうのです。

2. 失敗の「断崖」
特定の長さの閾値が存在します。

  • 断崖より手前: AI は完璧に機能します。要求されたほぼすべての短いシーケンスをコピーしたり生成したりできます。
  • 断崖を超えると: 生成できる物語の数は断崖から転落するように急激に減少します。わずかに悪化するのではなく、突然、ほとんどの長いシーケンスの生成が不可能になるのです。
  • 比喩: 最初の 50 段がしっかりした階段だと想像してください。しかし、51 段目は罠の床板になっています。ある長さを過ぎると、AI が特定の長い単語列を正常に生成する確率は、指数関数的に急速にゼロに近づきます。

3. 「詰め込み」実験
研究者たちは、特殊で最適化されたプロンプト(マスターキーのようなもの)を使用して、特定の長いシーケンスを AI の記憶に「詰め込む」ことでこれをテストしました。

  • 結果: 短いシーケンスでは、AI に強制的に出力させることができました。しかし、シーケンスが長くなりすぎると、いかに「詰め込み」を行っても機能しませんでした。プロンプトをどれだけ調整しようとしても、AI はそのシーケンスを生成できませんでした。
  • これは、AI モデルが完璧に長いテキスト列をコピーするといった単純なタスクで失敗することがある理由を説明します。これは訓練の誤りではなく、アーキテクチャそのものの構造的な限界によるものです。

なぜこれが起こるのか?(「丸め誤差」の比喩)

論文は、これが有限の精度に起因すると主張しています。

  • 比喩: 1 ミリメートルごとに目盛りしかない定規で絵を描いていると想像してください。直線を引くのは簡単です。しかし、目盛りから 0.0001 ミリメートル離れた点で曲がる必要のある、非常に複雑で長く曲がりくねった経路を描こうとすると、その定規では不可能です。最も近いミリメートルに丸めざるを得ません。
  • 結果: 長いシーケンスにわたって、これらの微小な丸め誤差が蓄積します。AI の内部の「ポインタ」は、特定の長い文を書くために必要な微小で正確な経路から逸脱し、異なるゾーンに落下して、異なる単語を生成してしまうのです。

まとめ

  • トランスフォーマーは無限ではない: 生成できるユニークなシーケンスの数には、厳密な数学的限界が存在します。
  • これは幾何学の問題です: この限界は、AI 内部の「地図」の形状とサイズ、そしてコンピュータが無限の精度を保存できないという事実から生じます。
  • 「断崖」: 性能は短いタスクでは優れていますが、長いタスクでは徐々にではなく、突然崩壊します。
  • これは根本的なものです: これはモデルが「愚か」だったり、訓練が不十分だったりするためではありません。無限の時間とデータがあっても、アーキテクチャそのものがほとんどの長いシーケンスを生成できないのです。

この論文は、この限界がトランスフォーマー設計の根本的な性質であり、小さなモデルから現在使用されている巨大なモデルに至るまで、すべてのサイズのモデルに適用されると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →