← 最新の論文
🤖 machine learning

Planning with Transformers: Chain of Computation and Structured Context Windows

本論文は、理論的なチューリング完全性と経験的な計画実行性能の間の溝を埋めるために、トランスフォーマーベースの言語モデルを構造化コンテキストウィンドウ(SCW)を用いた反復ループに統合するフレームワークであるChain of Computation(COC)を導入するものであり、特殊なコンテキスト管理と算術サポートを通じて、BlocksWorldやTower of Hanoiのような複雑な計画タスクにおいて小規模モデルがほぼ完璧な成功を達成することを可能にする。

原著者: Ehsan Futuhi, Nathan R. Sturtevant

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Ehsan Futuhi, Nathan R. Sturtevant

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、少し忘れっぽい天才的なロボットに、複雑なパズルを解く方法を教えようとしていると想像してみてください。あなたは、ロボットに超スマートな脳(大規模言語モデル、またはLLM)を与えて、「とにかく自分で考えろ」と言えば成功すると思うかもしれません。しかし、人工知能の世界では、これらのモデルは驚異的なパターン認識能力を持っていますが、長い多段階の旅を計画することを求められると、時として苦戦することがあります。物語を書いたりチャットをしたりすることには長けていますが、ブロックを動かしたり「ハノイの塔」を解いたりするような厳密な論理パズルとなると、ルールや直前に取った手順を忘れて迷ってしまうことがよくあります。これは大きな問題です。なぜなら、AIが倉庫の整理やロボットのナビゲーションといった現実世界のタスクを支援できるようにするためには、愚かなミスをすることなく、先を見通して計画を立てる必要があるからです。研究者たちが問い続けている大きな疑問は、「AIは計画を立てるにはあまりにも無能なのか、それとも単に、間違った道具を使っているだけなのか?」ということです。

この論文は、AIが必ずしも無能なのではなく、一度に多くのことをやりすぎているだけだと示唆しています。著者であるEhsan FutuhiとNathan R. Sturtevantは、「計算の連鎖(Chain of Computation: COC)」と呼ばれる新しい考え方を提案しています。AIに、まるで人間に本一冊を一度に暗記させるかのように、巨大な一息でソリューション全体を書かせるのではなく、彼らはAIを「構造化コンテキスト・ウィンドウ(Structured Context Window: SCW)」という特別な「メモ帳」を備えたループの中に配置します。これは、ロボットに付箋のメモ帳を与えるようなものです。全体の計画を記憶しようとする代わりに、ロボットはメモ上の一つの指示を見て、その小さなステップを実行し、次の指示をメモに書き込み、次にどこを見るべきかを指し示します。それは、ロボットがリーダーであり、かつフォロワーでもある「フォロースタイル」のゲームのようなもので、常に自分自身の地図を更新していくのです。

研究者たちは、このアイデアを3つの古典的なパズル、すなわち「ハノイの塔」(ディスクを棒の間で移動させる)、「BlocksWorld」(ブロックを積み上げる)、「パンケーキ・パズル」(パンケーキをひっくり返して並べ替える)でテストしました。その結果、AIにこの「メモ帳」システムを与えると、ゼロから学習させた比較的規模の小さいAIモデルであっても、驚異的な精度でこれらのパズルを解けることがわかりました。ブロックとパンケーキのパズルでは99.89%以上の成功率を記録しました。魔法のトリックは、AIが全履歴を記憶する必要はなく、単に現在の指示を読み、次のステップを導き出すための計算を行い、次にどこを見るべきかを書き留めるだけで済んだことにあります。

しかし、この論文は特定の弱点も発見しました。パズルが非常に大きくなったとき(例えば、多くのディスクがあるハノイの塔の場合)、AIはミスをし始めましたが、それは計画を忘れたからではありません。実際には、AIは単純な算数でつまずいていたのです。ロボットが次のステップを決めるために「ディスク番号7マイナス1」を計算しなければならないとき、特にその特定の数字をこれまで見たことがなかった場合、計算を間違えることがありました。著者たちは、AIが計算を代行するか、あるいは複雑な計算を必要としない「スタック」システムを使用することで、AIが最も困難なバージョンのハノイの塔(ディスク20枚まで)をも完璧に解けることを示しました。これは、AIの計画を立てる脳自体はかなり強力であるが、そのポテンシャルを最大限に引き出すためには、算数とメモリ管理の助けが必要であることを示唆しています。

大きな構図:なぜAIは計画に苦戦するのか

この論文がなぜ重要なのかを理解するために、まずこの物語の二つの主要な登場人物、**大規模言語モデル(LLM)プランニング(計画立案)**について理解する必要があります。

LLMとは、エッセイやコードを書くような、あなたが耳にしたことのある超スマートなAIの脳のことです。これらは膨大な量のテキストで学習し、文章の中の次の単語を予測することを学びます。膨大な量を読んできたため、彼らはパターンを認識することに長けています。もしドラゴンの物語を書くように頼めば、彼らは何千ものドラゴンの物語を見ているので、それができます。しかし、「プランニング」は異なります。プランニングとは、迷路を解いたり旅行の計画を立てたりすることのようなものです。数ステップ先を考え、自分が何をしたかを記憶し、ルールを破らないようにしなければなりません。

長い間、科学者たちは、LLMLがチャットには優れている一方で、プランニングには極めて劣っていることに気づいていました。もしLLMに、ブロックの山を落とさずに一箇所から別の場所へ移動させるよう頼むと、ルールを破ったりステップを忘れたりする計画を提示することがよくあります。これは、現実世界で物事を正しい順序で行う必要がある中で、AIを役立たせたいと考えている私たちにとって、もどかしいことです。

LLMは実際には「チューリング完全」である、という理論があります。これは、コンピュータができるあらゆる計算(複雑なプランニングを含む)を彼らもできるはずである、という数学的な言い回しです。しかし、実際には失敗しているように見えます。この論文が取り組んでいる大きな疑問は、**「なぜか?」**ということです。AIの脳は根本的にプランニングに向いていないのか、それとも、単にやり方が間違っているだけなのでしょうか?

問題点:「ワンショット」の罠

あなたがルービックキューブを解こうとしていると想像してください。もし誰かがあなたに、立ち止まって考えることなく、20手や30手の全手順をたった一つの文章で書き出すように求めたら、あなたは間違えてしまうかもしれません。途中のステップを忘れたり、色を混ぜてしまったりするかもしれません。

これは、標準的なLLMにプランニングを求める際に起こることです。通常、私たちは「このパズルを解いて」というプロンプトを与えますが、するとAIは一度にすべての動きのリストを生成しようとします。論文ではこれを「シングルパス、フルコンテキスト(Single-Pass, Full Context)」と呼んでいます。問題は、パズルが大きくなるにつれて、動きのリストも長くなることです。AIはそのすべての動きを同時に自分の「頭(コンテキスト・ウィンドウ)」の中に保持しておかなければなりません。リストが長くなるにつれ、AIはコントロールを失い始めます。それは、友人と会話をしながら、同時に買い物リスト、電話番号、そして数学の問題もすべて記憶していなければならないようなものです。最終的に、AIは混乱し、早い段階でミスを犯し、すると計画全体が崩壊してしまいます。

著者らは、AIがプランニングが下手なのではなく、巨大で整理されていない指示のリストを保持するのが苦手なのだと主張しています。

解決策:「計算の連鎖(Chain of Computation: COC)」

これを修正するために、著者らは**「計算の連鎖(Chain of Computation: COC)」**と呼ばれる新しいシステムを構築しました。AIに一度にすべての計画を書かせるのではなく、AIをループの中に配置します。

AIが工場で働くロボットだと想像してください。ロボットに工場の全貌を描いた巨大な設計図を与える代わりに、**「構造化コンテキスト・ウィンドウ(Structured Context Window: SCW)」**を与えます。SCWは、古いコンピュータで使用されていた長い紙テープや、非常に長い付箋のようなものだと考えてください。

この新しいシステムにおけるロボットの動きは以下の通りです:

  1. 読む: ロボットはテープの最初にある最初の指示を見ます。
  2. 考える: その一つの指示に基づいて、次に何をすべきかを判断します。
  3. 書く: テープの末尾に新しい指示を書きます。
  4. 指し示す: 「この指示の次にある指示を見よ」という「ポインタ(矢印のようなもの)」を書き込みます。
  5. 繰り返す: ロボットは新しい指示へと「目」を動かし、再び実行します。

ロボットは、計画全体を記憶する必要はありません。現在の指示だけに集中し、次に何をすべきかを決定すればよいのです。それは、ロボットが絶えず自分自身の地図を更新していく、「フォロースタイル」のゲームのようなものです。

論文では、**「ポインタ」**と呼ばれる特別なツールを紹介しています。このポインタは、ロボットが次にどの部分を見るべきかを正確に伝えます。これが重要なのは、ロボットの「注意(アテンション)」を、膨大なテキストの海に溺れるのではなく、小さく管理可能な情報へと集中させ続けることができるからです。

実験:ロボットのテスト

著者らは、この新しいロボットがより良く計画を立てる方法を学べるかどうかを確認するために、3つの有名なパズルでテストを行いました。

1. BlocksWorld
これは、テーブルの上にいくつかのブロックが積み重なっており、それらを特定の形に並べ替えるパズルです。動かせるのはスタックの最上部のブロックだけです。

  • 結果: ロボットはこのパズルにおいて驚異的な成績を収めました。パズルが非常に複雑になっても(40個のブロック)、ロボットは100%の確率で完璧に解決しました。ロボットは「すべてを一度バラしてから、再度積み上げる」という戦略を学習し、見たことがない新しい配置に対してもそれを適用することができました。

2. パンケーキ・パズル
このパズルでは、さまざまなサイズのパンケーキが積み重なっています。パンケーキをサイズ順に並べ替えるために、スタックの上部を(フライパンでひっくり返すように)ひっくり返すことができます。目標は、サイズ順に並べることです。

  • 結果: BlocksWorldと同様に、ロボットは素晴らしい成果を上げました。40枚のパンケーキがあっても、ほとんどすべてのパズルを解決しました。唯一の「失敗」は、パンケーキがすでに並んでいるときに、それでもひっくり返そうとしたときでした。しかし、ひっくり返してまた戻せば最終的な結果には影響しないため、結局は目標に到達しました。これは、ロボットがパズルの核となる論理を学習したことを示しています。

3. ハノイの塔 (TOH)
これが最も難しいパズルです。3本の棒があり、大きさの異なるディスクが積み重なっています。ディスク全体を別の棒へ移動させなければなりませんが、大きなディスクの上に小さなディスクを置くことは決してできません。必要な移動回数は指数関数的に増加します(非常に速く膨大になります)。

  • 結果: ここでは、ロボットは優秀でしたが、完璧ではありませんでした。ディスクが少ないとき(15枚まで)は約92%のパズルを解決しました。しかし、パズルが難しくなるにつれて、ミスをし始めました。

ミステリー:なぜロボットは失敗したのか?

著者らは単に「うまくいった」で終わらせませんでした。彼らは、なぜロボットが最も困難なパズルで失敗したのかを知りたいと考えました。彼らは、ハノイの塔におけるロボットのミスを詳しく調査しました。

彼らは、ロボットが計画を理解できていないために失敗したのではないことを突き止めました。ロボットは、どのディスクをどこへ動かすべきかを正確に理解していました。問題は**「算数」**でした。

計画を追跡するために、ロボットは「もし7枚のディスクがあるなら、まず上の6枚を動かす必要がある」といった単純な算術を行う必要がありました。ロボットは「7マイナス1」を計算して「6」を得る必要がありました。論文では、ロボットがこれまで見たことがない数字(非常に大きなディスク番号など)に遭遇したとき、計算を間違えることがわかりました。「7マイナス1」を「5」や「8」と計算してしまい、その結果、計画全体が脱線してしまうのです。

これは大きな発見でした。つまり、ロボットの「プランニング脳」は実際に完璧に機能していたということです。失敗は論理にあるのではなく、計算機(電卓)にあるのでした。

修正:算数とメモリへの助け

これを証明するために、著者らは2つの異なる修正を試みました。

修正1:記号的数学 (Symbolic Math)
彼らは、ロボット自身に計算をさせないように指示しました。代わりに、「記号的」な指示を与えました。例えば、「ディスク6を動かせ」と言う代わりに、ロボットは「ディスク(n-1)を動かせ」と言います。そして、別の単純なコンピュータプログラム(算術モジュール)が実際の計算を行い、ロボットに本当の数字を伝えます。

  • 結果: これを行うと、ロボットの成功率は上がりました。計算ミスを心配する必要がなくなったため、パズルを完璧に解くことができました。これは、プランニングの部分は問題なく、算数がボトルネックであったことを証明しました。

修正2:スタック (PDA)
著者らは、ハノイの塔においては、ロボットがテープ内を飛び回って指示を探す必要さえなく、単にスタックの「トップ」に新しい指示を追加し、その「トップ」を見るだけでよいことに気づきました。これは、コンピュータサイエンスにおける「スタック(後入れ先出し)」の仕組みそのものです。
彼らは、ロボットの仕事を決定性プッシュダウン・オートマトン (Deterministic Pushdown Automaton: PDA) として再構成しました。これは、スタックのみを使用する機械という専門用語です。

  • 結果: この新しいセットアップを用いることで、ロボットは20枚のディスク(100万回以上の移動が必要!)という非常に困難なハノイの塔のパズルさえも、100% の確率で解きました。スタックが自動的に処理してくれるため、次の指示を見つけるための複雑な計算をする必要がありませんでした。

これが意味すること

この論文は、大規模言語モデルが本質的にプランニングが苦手なのではない、ということを示唆しています。問題は、私たちが一度にすべてをやらせようとしていたことでした。計画を記憶し、計算を行い、そして巨大なテキストの壁を凝視しながら、次のステップを考えるということを同時に求めていたのです。

タスクを小さな反復ステップに分解し、AIにメモリを管理するための「メモ帳(SCW)」を与えることで、AIは非常に効果的に計画を立てることができるようになります。この論文は、ゼロから学習させた比較的小規模なAIモデルであっても、適切なツールを与えれば、複雑なプランニング戦略を学習できることを示しています。

重要な教訓は、AIの「推論」は強力であるが、その「算術」と「メモリ管理」には助けが必要であるということです。プランニングの論理と数学を分離し、ステップを管理するための構造化された方法を与えれば、AIは以前は不可能だと思われていた問題を解決できるのです。

著者らは、大きな一歩を踏み出したものの、まだ学ぶべきことは多いと結論づけています。彼らは、どのように「ポインタ」システムがAIを助けているのか、そしてこの手法が将来、より複雑で現実世界のプランニングタスクにどのように応用できるかを調査したいと考えています。しかし現時点では、構造化された仕組みさえあれば、AIは非常に優れたプランナーになり得ることを証明したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →