✨ 要約🔬 技術概要
非常に賢いものの、少しだけ短期記憶が苦手なロボットアシスタントがいると想像してください。あなたはそのロボットに、複雑なコンピュータプログラムを実行する方法を教えたいと考えています。問題は、ロボットはある一定数のステップまでしか同時に「思考」できず、その後は物語の始まりを忘れてしまうことです。プログラムが長すぎると、ロボットは迷子になってしまいます。
この論文は、その問題に対する解決策を提示しています。研究者たちはMicroPy と呼ばれる、小さく簡略化されたプログラミング言語を構築し、標準的な AI モデル(トランスフォーマー)に、この言語で書かれた(これまで見たこともないものも含む)あらゆるプログラムを実行できる汎用コンピュータとして振る舞うよう教えました。
以下に、彼らが日常の比喩を用いてどのように行ったかを示します。
1. 言語:MicroPy(「レゴセット」)
MicroPy を Python や C++ のような本格的なプログラミング言語ではなく、非常に厳格で簡略化されたレゴの組み立て手順集として考えてください。
「もしこれなら、あれをする」「この値を参照する」「このオブジェクトを変更する」といった基本的なブロックを持っています。
これは理論上、あらゆる計算を行える「汎用」言語の簡略化版であるため、AI がこれらの特定のレゴブロックを理解することを学べば、理論上は何でも 構築できることになります。
2. 問題:「長い物語」の問題
通常、AI が数学の問題を解いたり、コードをステップバイステップで実行したりする際(この手法は「思考の連鎖」と呼ばれます)、すべてのステップを書き留めます。
比喩: 本を読んでいるが、頭の中に最後の 10 ページしか保持できないと想像してください。本が 1,000 ページある場合、最後のページに到達する頃には冒頭を忘れてしまいます。第 1 章で誰が悪役だったかを忘れてしまったため、ミステリーを解決できないのです。
コンピューター用語では、長い計算によって「コンテキストウィンドウ」(AI の短期記憶)がすぐに埋まってしまうことを指します。
3. 解決策:PENCIL(「片付けチーム」)
研究者たちはPENCIL と呼ばれる特別なトリックを使用しました。PENCIL は、AI が記憶を管理するのを助ける魔法のような「片付けチーム」と考えてください。
仕組み: AI が小さなサブタスク(数値の計算や関数の完了など)を完了すると、PENCIL チームは即座に AI の記憶から中間ステップの散らかった部分を消去し、最終結果のみを保持します。
比喩: 複雑な料理を作っていると想像してください。すべての汚れた鍋、フライパン、食材の包装紙をカウンターに置いたままにすると(やがてキッチン全体が埋まってしまう)、使った直後に皿を洗い、片付けてしまいます。カウンターに置くのは完成した料理だけです。このようにすれば、狭いキッチンでもスペース不足になることなく、大規模な宴会料理を作ることができます。
これにより、AI はトレーニング時に使用されたプログラムよりも60 倍長い プログラムを実行できるようになります。なぜなら、その「キッチンカウンター」が散らかることを許さないからです。
4. トレーニング:ランダムな練習対実際のテスト
研究者たちは、有名な人間が書いたコードを見せることで AI を教えたわけではありません。代わりに、彼らは数百万ものランダムで無意味な MicroPy プログラム を生成しました。
比喩: 学生にチェスを教える際、無作為で意味のない手を打つコンピューターと対戦させるようなものです。学生は特定の有名な対局を暗記するのではなく、駒の動き方や取り方のルール を学びます。
AI がこれらのランダムな練習からルールを学んだ後、実際に何かを行う実際の人間が書いたプログラム でテストされました。例えば:
ビット(二進データ)のコピーと反転。
大きな二進数の加算と乗算。
論理パズル(SAT 問題)の解決。
5. 結果:汎用コンピュータ
結果は驚くべきもので、完璧でした。
AI はすべての人間が書いたテストで100% の精度 を達成しました。
テストプログラムはトレーニング中に AI が目にしたものよりもはるかに長く複雑でしたが、AI はそれらを完璧に処理しました。
この論文は、標準的な AI モデルを汎用コンピュータとして振る舞うようにトレーニングできることを証明していると主張しています。AI は単に答えを暗記したのではなく、指示を実行する論理 を学び、完全に新しい未見のプログラムにも対応できるようにしたのです。
まとめ
要約すると、この論文は、標準的な AI に学習するための簡略化された言語と、長いタスクを管理するのを助ける「メモリクリーナー(PENCIL)」を与えれば、それが汎用コンピュータとして振る舞うことを学べることを示しています。それは、これまで見たこともない指示を受け取り、それを完璧に実行でき、これらのモデルが単に次の単語を予測するだけでなく、本当に「思考」し計算することを学べることを証明しています。
以下は、論文「Training Transformers as a Universal Computer」の詳細な技術的サマリーです。
1. 問題定義
チェーン・オブ・トークン(CoT)を拡張したトランスフォーマーが計算的に万能(チューリング機械をシミュレート可能)であるという理論的研究はあるものの、表現力 (理論的に表現可能なもの)と学習性 (勾配ベースの最適化を通じて実際に学習できるもの)の間には大きな隔たりがあります。
現在の課題は以下の通りです:
汎化の失敗 : モデルは長さ汎化(例:訓練で見たことのない長い数の加算)や構成的汎化(プリミティブの新しい組み合わせを解くこと)に苦戦しています。
コンテキストのボトルネック : 標準的な CoT は、タスクの時間計算量 T T T に比例する O ( T ) O(T) O ( T ) のコンテキスト長を必要とします。これにより、限定されたコンテキストウィンドウ内での、長く複雑なプログラムの訓練および推論が非現実的になります。
万能な学習の欠如 : 以前のニューラルインタプリタの訓練試行は、特定の事前設計された関数や専門的なアーキテクチャに依存することが多く、標準的なトランスフォーマーが一般的でチューリング完全な言語を解釈することを学習できることを示すには至っていませんでした。
ここで扱われる中心的な問いは、標準的なトランスフォーマーを訓練して万能なコンピュータとして機能させ、未見のプログラムや長さに汎化させることは可能か 、というものです。
2. 手法
著者らは、新しいプログラミング言語、メモリ効率の良い実行スケッフォールド、および特定の訓練レジームを組み合わせたフレームワークを提案します。
A. MicroPy: 計算可能な万能言語
著者らは、簡素化されつつもチューリング完全なオブジェクト指向プログラミング言語であるMicroPy を設計しました。
意味論 : これは、検索 (retrieval)と書き換え (rewriting)のルールという、小さく有限なセットに依存しています。
検索 : 文脈(スタックフレームまたは状態)から関数定義、変数バインディング、または属性値を検索すること。
書き換え : 現在の状態に基づき、プリミティブ(例:IF、SEQ、LookupAttr)をより単純な式に還元すること。
構造 : プログラムは手続き定義と式から構成されます。実行には、式をステップバイステップで還元し、可変状態(オブジェクトの属性)とスタックフレーム(局所変数のため)を管理するプロセスが含まれます。
目的 : これらの有限なルールを学習することで、モデルは任意の MicroPy プログラムを解釈することを学習し、実質的に万能なインタプリタとして機能します。
B. PENCIL スケッフォールド:限定コンテキスト実行
コンテキスト長のボトルネック(O ( T ) O(T) O ( T ) )に対処するため、著者らはPENCIL (Yang et al., 2025 による)を利用します。
メカニズム : PENCIL は、完了した中間計算を回収する還元ルールを導入します。サブ計算(スタックフレーム)が完了すると、中間の推論ステップは消去され、最終結果のみが保持されます。
計算量 : これにより、コンテキスト長は時間計算量 O ( T ) O(T) O ( T ) ではなく、空間計算量 O ( S ) O(S) O ( S ) によって制限されます。
アナロジー : これはプログラミング言語におけるスタックの規律のように機能します。関数が戻ると、その局所的なスタックフレームがポップされ、長時間実行されるプログラムであってもコンテキストウィンドウのサイズを管理可能な範囲に保ちます。
C. 訓練データ生成
モデルは、ランダムに生成された MicroPy プログラム から生成された実行トレースを用いて訓練されます。
2 つのサンプラー :
プログラムレベルサンプラー : 確率的文脈自由文法を通じて、多様な構文構造を生成します。
プランサンプラー : 目標とする「プラン」(スタック構造)をサンプリングし、それを実現するプログラムをコンパイルすることで、稀なランタイム構成(特定のスタックスケルトンと検索パターン)のカバレッジを確保します。
監督 : 訓練目的は、ステップごとの実行トレースにおける次のトークン予測 です。モデルは、現在のコンテキストに基づいて次の書き換えステップ(検索または局所還元)を予測します。
制約 : 訓練プログラムは多様性を確保しつつモデルを圧倒しないよう、トレース行数を 128 行に制限しますが、評価でははるかに長いプログラムでテストされます。
D. モデルアーキテクチャ
アーキテクチャ : RoPE(回転位置埋め込み)を備えたデコーダ専用トランスフォーマー(5950 万パラメータ)。
最適化 : 埋め込みには AdamW を、2 次元行列パラメータには Muon を使用します。
入力 : 手続き定義 + 評価する式 + 現在の状態/スタック。
出力 : 実行トレースの次のステップ(トークンごと)。
3. 主要な貢献
MicroPy 言語設計 : 検索と書き換えルールの有限セットに基づく意味論を持つチューリング完全言語の作成。これにより、構成的学習が促進されます。
万能学習の実証的証拠 : 万能言語のランダムなトレースのみで訓練された標準的なトランスフォーマーが、一度も見たことのない複雑な人間作成のプログラムを実行することに汎化できることを初めて実証しました。
PENCIL の統合 : PENCIL スケッフォールドの成功した適用により、固定されたコンテキストウィンドウ内で、訓練時に見たものよりも最大60 倍長い トレース長を持つプログラムをトランスフォーマーが実行できるようにしました。
完全な汎化 : ビット操作、算術、論理解決に関する保持されたタスクにおいて 100% の精度を達成し、強力な構成的および長さ汎化を実証しました。
4. 実験結果
モデルは、訓練データよりも実質的に長く、意味的に有意義な保持された人間作成の MicroPy プログラム で評価されました。
評価されたタスク :
ビット操作 : リンクドリスト内のビットのコピーと反転。
算術 : ビット文字列表現を使用した二進加算と乗算。
論理 : SAT 検証と SAT 解決(バックトラッキング探索を使用)。
性能 :
精度 : 試験されたコンテキストウィンドウ内のすべてのタスクで、モデルは100% のトークンレベル精度 を達成しました。
長さ汎化 : 訓練プログラムは 128 行に制限されていましたが、モデルは最大7,552 行 のトレース長を持つプログラムを正常に実行しました。
分布のギャップ : 訓練プログラムの分布とテストスイートの分布の間にはほぼゼロの重なりがあり、モデルが特定のプログラムを暗記したのではなく、実行のルール を学習したことを確認しました。
演算カバレッジ : 訓練ジェネレータは、テストスイートで使用されたすべての演算タイプ(例:If、LookupVar、TailApp)を網羅しており、モデルが訓練中にすべての必要なプリミティブを目にしていたことを保証しました。
5. 意義と含意
万能計算は学習可能 : この論文は、計算的万能性がトランスフォーマーの理論的な性質に留まらず、適切な言語における標準的な次のトークン予測訓練を通じて獲得可能な能力であることを示す強力な実証的証拠を提供します。
構成的性への帰納的バイアス : 結果は、PENCIL などのコンテキスト管理スケッフォールドと組み合わされたトランスフォーマーが、句構造 と構成的意味論 に適した帰納的バイアスを有することを示唆しています。これはプログラミング言語と自然言語の両方の構造を反映しています。
ギャップの埋め合わせ : この研究は、I/O トレースを学習する「ニューラルコンピュータ」と形式的インタプリタの間のギャップを埋め、単一のモデルが形式的でチューリング完全な言語を実行することを学習できることを示しています。
将来の方向性 : 著者らは、プログラミング言語インタプリタの学習を可能にする同じメカニズムが、トランスフォーマーが自然言語タスクにおいてこれほど効果的である理由を説明する可能性があると示唆しています。両者とも構成的意味論に依存しているためです。今後の研究では、これをより豊かな言語や、明示的な実行トレースなしの推論へと拡張することが考えられます。
要約すると、この論文は、実行が効率的にコンテキストを管理するようにスケッフォールドされている場合、標準的なトランスフォーマーを訓練して、チューリング完全な言語の任意のプログラムを完全な精度で実行可能な万能コンピュータ として機能させることができることを実証しています。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×