← 最新の論文
🤖 machine learning

Barriers to Universal Reasoning With Transformers (And How to Overcome Them)

本論文は、標準的な連鎖思考トランスフォーマーがコピーと検索の固有の限界によりより長い推論トレースへの一般化に失敗する一方で、これらの障壁を克服するために固有の案内トークンと値変化符号化を用いて拡張可能な語彙を採用することで、長さ一般化可能なチューリング完全性を達成し得ることを示している。

原著者: Oliver Kraus, Yash Sarrof, Yuekun Yao, Alexander Koller, Michael Hahn

公開日 2026-04-29
📖 1 分で読めます☕ さくっと読める

原著者: Oliver Kraus, Yash Sarrof, Yuekun Yao, Alexander Koller, Michael Hahn

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

「トランスフォーマーによる普遍的推論の障壁(およびその克服方法)」という論文を、平易な言葉と創造的な比喩を用いて解説します。

全体像:忘れっぽい「賢い学生」

複雑なパズルを解くことを学んでいる、非常に賢い学生(トランスフォーマー)を想像してください。彼らを助けるために、教師は思考を段階的に書き留めるための「メモ用紙」を与えます。これを**思考の連鎖(Chain-of-Thought、CoT)**と呼びます。

これまでの研究では、このメモ用紙があれば、理論上、どんなに難しいパズルでも学生は解けることが示されていました。まるでスーパーパワーを与えられたかのようでした。

しかし、この論文の著者たちは重大な欠陥を発見しました:この学生は練習したパズルを解くのが得意ですが、パズルが長くなるとひどく失敗します。 10 ステップのパズルで訓練しても、論理が同じであっても 20 ステップのパズルは解けません。彼らは推論が破綻する「天井」にぶつかったように見えるのです。

この論文は問いかけます:なぜこれが起きるのか、そしてそれを修正できるのか?


二つの大きな障害

著者たちは、学生の脳(トランスフォーマー)に、より長いタスクへの汎化を妨げる 2 つの特定の「バグ」があることを発見しました。

1. 「コピー機」バグ(反復的なコピー)

学生が本から長い指示リストをメモ用紙に書き写す必要があると想像してください。

  • 問題点: リストが短ければ、簡単にコピーできます。しかし、リストが長くなると混乱します。長いページの途中から必要な行を正確に見つけ出し、場所を失わずにコピーすることができなくなります。
  • 論文の主張: 標準的なトランスフォーマーは、長さが変化する任意の文字列を「コピー」することに苦労します。彼らはテキストの途中で迷子になってしまうのです。

2. 「最後に見たもの」バグ(検索)

学生が「X の値」といった変数を追跡していると想像してください。

  • 問題点: 学生が「X = 5」と書き、後に「X = 7」と書き、さらに「X = 5」と再度書いた場合、現在の値が何かを知る必要があります。長い思考の連鎖の中で、学生はどの「5」が最新のものかを忘れがちです。ページの端にある古い「5」を、新しいものではなく取り出してしまうかもしれません。
  • 論文の主張: モデルは、長い変更履歴の中で最新の更新を見つけることに苦労します。1,000 ページの日記から、最後にリンゴを食べたタイミングを探すようなものです。

解決策:メモ用紙への書き方の新手法

著者たちは、これらのバグを修正するための 2 つの巧妙なトリックを提案しています。学生の脳を変えるのではなく、メモ用紙に指示を記述する方法を変えるだけです。

トリック #1:「名前札」(シグポストトークン)

コピー機バグを修正するために、著者たちはパズルの各項目に固有の ID カード、つまり「名前札」を与えることを提案します。

  • 仕組み: 「50 行目へ移動」と言う代わりに、「名前札 #42 の項目へ移動」と指示します。
  • 効果: リストが長くなっても、学生は 50 行目を見つけるために数える必要はありません。特定の「名前札」を探すだけです。まるで、必要な本を見つけるために棚全体をスキャンする必要がないよう、すべての本に固有のバーコードが付けられた図書館のようなものです。

トリック #2:「変更ログ」(値変更符号化)

「最後に見たもの」バグを修正するために、著者たちは学生が書き留める内容を変えることを提案します。

  • 旧方式: 学生は毎回現在の完全な状態を書き留めます(例:「X は 5」→「X は 7」→「X は 5」)。これによりノイズが増え、どれが最新か判断しにくくなります。
  • 新方式: 学生は何が変わったかだけを書き留めます。
    • 「X は 7」と書く代わりに、「X は 5 から 7 に変わった」と書きます。
    • 再び「X は 5」と書く代わりに、「X は 7 から 5 に変わった」と書きます。
  • 効果: 現在の値を見つけるために、学生は変更回数を数えるだけです。「5 から 7」そして「7 から 5」という変化が見えれば、現在の値は 5 だとわかります。これは、ドルを払うたびに銀行残高をすべて書き直すのではなく、取引の帳簿を記録するのと同じようなものです。

結果:理論と現実

この論文は、これらのアイデアを 2 つの方法でテストしました。

  1. 数学的証明(理論):

    • 悪い知らせ: 固定された単語セット(有限アルファベット)と標準的な書き方に固執する場合、学生は特定の複雑さを超えるパズルを解くことを学習できません(具体的には、TC0と呼ばれる問題クラスを超えられません)。彼らは数学的に立ち往生しています。
    • 良い知らせ: 学生に無限のユニークな名前札(シグポスト)を使用し、「変更ログ」方式を採用することを許可すれば、理論上、どんなに長くてもどんなパズルでも解くことが可能になります。
  2. 実験(現実):

    • 著者たちは、3 つの難しいタスクに対して、ゼロから小さなコンピュータモデルを訓練しました。
      • パリティ: 数字の列に 1 が奇数個か偶数個かを数える。
      • ブール評価: 複雑な論理パズル(真/偽)を解く。
      • S5 順列: 入れ替えられる 5 つの物体の動きを追跡する。
    • 結果:
      • 標準的な方法で訓練されたモデルは、パズルが長くなると失敗しました。
      • 名前札変更ログで訓練されたモデルは、以前に見たことのない長いパズルを解く能力が大幅に向上しました。
    • また、Llama や Mistral などの巨大な事前学習済み AI モデルでもテストを行いました。再訓練を行わずに、単に回答時に名前札変更ログを使用するようにプロンプトするだけで、長く難しい問題を解く能力が劇的に向上しました。

結論

この論文は、思考の連鎖(Chain-of-Thought)は魔法ではないと結論付けています。AI に「段階的に考えろ」と指示するだけでは、その思考方法が長いリストの中で迷子になりやすい場合、十分ではありません。

AI を長期的な推論において真に信頼できるものにするためには、思考を 2 つの主要な罠を回避する形でフォーマットする必要があります。

  1. 何も失われないよう、各ステップに固有の名前札を与える。
  2. 古い情報に混乱しないよう、変更点のみを記録する。

推論の形式を修正することで、AI モデルは現在の限界を突破し、はるかに難しい問題を解決できるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →