あなたが一度も見たことがないビデオゲームの中に放り込まれたと想像してみてください。指示もなければ、チュートリアルもなく、どのボタンが何の役割を果たしているのか、何をすれば勝利できるのかを教えてくれる人もいません。ただボタンを押し、何が起こるかを観察し、試行錯誤を通じてルールを理解していくしかありません。これが、人工知能が「未知の世界」に直面したときに日常的に経験している現実です。長い間、AI研究者たちは、コンピュータが優れた「推測器」になれるよう教えようとしてきました。パターンを暗記したり、何百万もの例から学習したりすることを期待したのです。しかし、ルールが完全に変わったり、全く新しいゲームが登場したりすると、それらの推測器はしばしば行き詰まり、運良く成功するまでボタンをランダムに押し続けるだけになってしまいます。コンピュータサイエンスのこの分野における大きな問いは、「どうすればAIは、何百万回もの練習を必要とすることなく、人間のように素早く効率的に新しいゲームを学習できるのか?」という点にあります。
本論文では、この問題を解決するためにゲームの仕組みそのものを変える、「Twin」と呼ばれる巧妙な新システムを紹介します。Twinは単に推測するのではなく、好奇心旺盛な探偵のように振る舞い、コンピュータプログラムの中でゲームのルールの完璧に機能するコピーである「デジタルツイン」を構築します。このように考えてみてください。あなたが新しいゲームをプレイするとき、「ここをクリックすると、ブロックが赤くなる」といったメモを頭の中に作るかもしれません。Twinは単にメモを取るだけでなく、「もしここをクリックしたら、ブロックは赤くなる」と記述する小さなコードを実際に書き出します。そして、実際のゲーム内で本当の動きを行う前に、そのコードを用いて自分の頭の中でシミュレーションを実行します。もしシミュレーションではブロックが青になると表示されたのに、実際のゲームでは赤になった場合、Twinは自分のコードが間違っていると判断します。そして、間違いを修正するために即座にコードを書き換えます。Twinは、この「記述、テスト、修正」という自らのルールブック作成のプロセスを、デジタルツインが現実の世界を完璧に予測できるようになるまで繰り返します。そして、その時初めて、実際の行動に移るのです。
結果は驚くべきものです。研究者たちは、ルールや目的が隠されている25種類の全く新しい謎めいたグリッドゲーム(ARC-AGI-3と呼ばれるベンチマークの一部)を用いてTwinのテストを行いました。これらのゲームにおいて、特別な補助なしで直接プレイした標準的なAIモデルは、わずか1つのゲームをクリアし、スコアは100点満点中7.8点という低い数値にとどまりました。標準的な「補助ツール」を備えた賢いAIであっても、61.1点までしか向上しませんでした。しかし、自らルールを書き出す機能を持つTwinは、25ゲーム中23ゲームをクリアし、93.3点という圧倒的なスコアを叩き出しました。さらに驚くべきことに、Twinは報酬や「ゲームオーバー」の信号を受け取る前に、87.2%のレベルにおいて「勝利とは何か」を解明していました。これは、目標が何であるかを推測し、その推測をデジタルツインの中でテストし、シミュレーションがうまくいくと判断した場合にのみ計画を実行するというプロセスによって達成されました。
本論文は、利用可能な世界モデルを構築することは、人々が考えていたよりも実は単純なことであるが、肝心なのは「目的」を見つけ出すことであると示しています。Twinは単にゲームに反応するのではなく、リアルタイムでゲームの論理を構築し、これまでのあらゆる動きに対して自身の作業内容を検証し、そして自信を持って次のステップを計画します。AIに自分自身のシミュレーターを書く方法を与え、行動を起こす前にそのシミュレーターが機能することを証明させることで、未知のゲームを初めてプレイする人間と同じくらい効率的に学習できることが分かったのです。これは、スマートなAIの秘訣は、単に脳を大きくすることではなく、行動を起こす前に自分自身の理論をテストするためのより優れた方法を持つことにあることを示唆しています。
技術要約:Twin – テスト時デジタルツインを用いた未知のゲームのプレイ
問題提起
本論文は、事前の指示、デモンストレーション、または明示的なルールがない状態で、未知のインタラクティブなグリッドワールド・ゲームを学習するエージェントの課題に取り組んでいる。特定のベンチマークとして、ARC推論ベンチマークの後継であるARC-AGI-3(各タスクが64×64のカラーグリッドゲーム)を用いている。エージェントは以下の事項を解明しなければならない:
- ダイナミクス(動態): アクション(例:クリック)に応じて世界がどのように遷移するか。
- ゴール(目標): 隠された勝利条件(述語 R:S→{0,1})。
評価指標は**アクション効率(action efficiency)**であり、初めてプレイする人間よりも少ないアクション数でゲームをクリアしたエージェントに高いスコア(0–100)を与える。従来のフロンティアモデルは、環境の明示的なモデルを構築し、その中で推論する能力を欠いているため、ほとんどのゲームで失敗する(スコアは約7.8%)。
手法:Twinシステム
Twinシステムは、「テスト時世界モデル推論(Test-time World-model Inference)」アプローチを採用している。環境をブラックボックスとして反応するのではなく、コーディングエージェントが、ゲームの世界モデルの実行可能な仮説として機能するPythonプログラム(「ツイン」)を記述する。このモデルは、検証、探索、計画のループを通じて継続的に洗練される。
コアコンポーネント
実行可能なツイン(The Executable Twin):
step(grid, action) -> grid および goal_reached(grid) -> bool を実装したPythonファイル。
- 最初はアイデンティティ・スタブ(空の関数)として始まり、反復的に修正される。
- これにより、正確なリプレイ、決定論的な長期的ロールアウト、および解釈可能なアーティファクトが可能になる。
検証・探索・計画ループ(The Validation-Explore-Plan Loop):
システムは、非対称な目的を強制する厳格なハーネスの下で動作する:
- 適合(制約条件): スコア対象となるアクションが行われる前に、ツインは過去に観察されたすべての遷移を再現しなければならない。
- 到達可能性(楽観的探索): ダイナミクスが検証された後、エージェントはゴールへの経路を探索する。
ループは以下の4つのステージで構成される(図1参照):
- 観察とログ記録(Observe & Log): エージェントは現在のグリッドを観察し、遷移 (s,a,s′) を追記専用ログ D に追加する。
- 検証(Validate): ハーネスは、現在のツインコードに対してログ D 全体をリプレイする。不一致(カウンターエグザンプル)が発生した場合、ツインのアクションはブロックされる。
- 探索(Explore):
- ダイナミクスの壁(Dynamics Wall): 検証に失敗した場合、システムはエラーの頻度と多様性に基づいて修正対象をランク付けし、エージェントに
step 関数の修正を促す。
- ゴールの壁(Goal Wall): 検証は通過したがゴールへの経路が存在しない場合、システムは「進捗シグナル」(例:色の変化、領域のコンパクトさ)に基づき、候補となるゴール状態を提案する。そして暫定的な
goal_reached 述語を生成する。
- 計画(Plan): 検証済みのツイン内で幅優先探索(BFS)を実行し、提案されたゴールへの最短経路を見つける。
- 検証済み実行(ExecuteChecked): エージェントはアクションを一つずつ提出する。実環境の結果がツインの予測と一致すれば、計画は継続される。不一致が発生した場合、アクションは停止され、遷移はログに追加され、ループは修復のために再起動される。
ゴール発見戦略
ゴールの推論は、報酬が得られるまで報酬が存在しないため、より困難な側面である。Twinは、勝利条件を一つの仮説として扱う:
- 報酬が存在しない段階から、システムは進捗を示すように見える到達可能な状態に基づき、候補となるゴール述語を提案する。
- 候補は、観察された非ゴール状態すべてにおいて
false を返す場合にのみテストされる(これにより一貫性が確保される)。
- レベルの境界(boundary)が仮説を確定させる。候補状態に到達しても境界に達しない場合、その仮説は永久に拒絶される。
主な貢献
- テスト時世界モデル推論: エージェントは、自身が計画を立てるためのシミュレータを自ら記述する。環境は、ブラックボックスではなく、検査可能で、反証可能で、かつ修復可能な「実行可能な仮説」となる。
- ハーネスによる検証の強制: 検証をプロンプトの指示に頼る他のエージェントとは異なり、Twinのハーネスは、ツインが全インタラクション履歴を再現するまで、スコア対象のアクションを機械的にブロックする。これにより、エラーの累積を防ぐ。
- 非対称な目的の処理: システムは、観察されたダイナミクスへの適合という「ハードな制約」と、ゴールへの探索的な検索を分離している。報酬が届く前にゴールを仮説化することで、最初のアクションから目標指向の計画を可能にする。
- 効率性: Twinは183レベル中179レベルをクリアし(97.8%)、クリアしたレベルにおいて人間の使用アクション数よりも少ないアクション数を使用している。
実験結果
25の公開ARC-AGI-3ゲーム(183レベル)で評価:
- パフォーマンス: Twinは平均スコア 93.3/100 を達成し、25ゲーム中23ゲームをクリアした。
- 比較:
- ベースモデル (GPT-5.6 Sol): スコア 7.8%(1ゲームクリア)。
- 標準的なハーネス (Codex): スコア 61.1%(13ゲームクリア)。
- Twin (提案手法): スコア 93.3%(23ゲームクリア)。
- その他のシステム: OPINE-World (78.4), Prime Agent (78.3), EWM (63.8)。
- アクション効率: クリアしたゲームにおいて、Twinは人間が使用するアクション数の平均 0.61倍 しか使用していない。また、全システムが同じレベルをクリアできた13ゲームのうち、11ゲームで競合他社よりも少ないアクション数でクリアした。
- アブレーション解析: Twinのハーネスを取り除いた場合(ベースモデルのみ)、スコアは61.1に低下し、性能向上がモデルそのものではなく手法によるものであることが確認された。
- ゴール推論: 最初のゴール仮説は、クリアしたレベルの 87.2% (156/179) で正しかった。残りのレベルは探索によって解決された。
- ダイナミクスの正確性: ツインは「初見」の状態-アクションのペアを79.0%正確に予測しており、単純な再生を超えた汎化性能を示している。
意義と主張
本論文は、**「利用可能な世界モデルを構築することは予想以上に単純である」一方で、「正しいゴールを推論することの方がより困難な問題である」**と主張している。
- パラダイムシフト: Twinは、未知のゲームとのインタラクションを「実行可能な仮説の構築」として扱うことができることを示した。これは、焦点が「サンプリングへの回答」(多くの出力を生成してフィルタリングする)から、「世界モデルの推論」(計算量を投じて検証済みのモデルを構築する)へと移行することを意味する。
- 堅牢性: ハーネスによるリプレイ検証により、モデルのエラーが蓄積しないことが保証される。これは、他のシステムが失敗するような長期的なゲームにおいて極めて重要である。
- 限界: 本システムは、決定論的なダイナミクスと小さな離散状態を前提としている。真に潜在的な状態(フレームに表示されない変数)や確率的なダイナミクスには苦戦する。また、固定された探索予算に依存しているため、ホライゾンの先にあるゴールは発見されない可能性がある。
著者らは、現在のシステムが人間レベルのアクション効率を達成しているものの、今後の課題はゴール推論の速度向上と、より複雑で部分観測的な、あるいは確率的な環境への対応にあると結論付けている。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録