← 最新の論文
🤖 AI

Persistent Computational State: A Session-Centric Runtime for Generative World Models

本論文は、現在の生成型ワールドモデルがステートフルなシミュレーション・タスクをサポートできていない原因は、アーキテクチャの限界ではなく、永続的な計算状態を破棄してしまうリクエスト中心のランタイム設計にあると論じ、効率的なバイト単位で同一のワールドモデルのロールアウトを促進するために、非再計算可能な状態の即時的なチェックポインティングと復元を可能にするセッション中心のランタイムを提案するものである。

原著者: Zhen Lin

公開日 2026-07-27
📖 1 分で読めます☕ さくっと読める

原著者: Zhen Lin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、単にスクリプトを再生するだけでなく、実際に「生きている」ビデオゲームを構築していると想像してください。この種のゲームでは、あなたがキャンプファイアから立ち去っても、火は燃え続けます。坂道を転がるボールを放置すれば、それは転がり続けます。これは「生成的な世界モデル(generative world models)」の夢です。つまり、単に綺麗な絵を生成するだけでなく、一貫した、生きている現実をシミュレートできるAIシステムです。しかし、ここに落とし穴があります。この世界を生かし続けるためには、プレイヤーが目を離して再び見たときでも、コンピュータは極めて微細な詳細に至るまで、何が起きたのかを正確に覚えておく必要があるのです。

長い間、科学者たちは、これらのAIモデルが失敗しているのは、AIが「物忘れが激しい」あるいは「記憶力が悪い」からだと考えてきました。彼らは、AIの脳が物語全体を保持するには容量が足りないのだと想定していました。しかし、この論文は異なる問いを投げかけます。もし、問題がAIにあるのではないとしたら? もし、問題がゲームを実行しているコンピュータ・システムの方にあり、プレイヤーが休憩を取るたびに、AIのメモをコンピュータが勝手に捨ててしまっているとしたらどうでしょうか? 著者たちは、世界の一貫性を保つためにAIが必要とする「記憶」とは、魔法のような超能力ではなく、コンピュータ・システムが誤って削除していた、いくつかの特定のデータに過ぎないことを発見しました。


「忘れたの?」という大ミステリー

AIビデオ生成の世界には、もどかしいグリッチ(不具合)が存在します。AIに「ベッドの上でジャンプする猫」を見せるよう指示し、次に「その猫が歩いて離れていく様子」を見せるとします。そして次に、「猫がベッドに戻ってくる様子」を見せるよう頼みます。完璧な世界であれば、猫は全く同じ場所に、毛並みも同じように乱れた状態で着地するはずです。しかし、2026年、研究者たちが14種類の異なるモデル(MBenchというテストを使用)と23種類の異なるモデル(WRBenchを使用)を用いてこれをテストしたところ、同じ悲しい結果が出ました。猫は正しく戻ってこなかったのです。世界は「ドリフト(漂流)」していました。ベッドの見た目は変わり、猫の位置は狂い、物理法則は壊れていました。

専門家たちはこれらの壊れた世界を見て、「AIモデルが弱すぎる。新しいトレーニングや、より大きな脳、そして記憶する方法を学ぶための特別なメモリ・モジュールが必要だ」と指摘しました。彼らは、問題はモデルの「脳」の中にあると考えていたのです。

しかし、Zhen Lin氏率いるこの論文の著者たちは、探偵のように動くことに決めました。彼らは、犯人はAIの脳ではなく、AIを実行しているコンピュータ・システム、すなわち「ランタイム(実行環境)」ではないかと疑ったのです。

探偵の実験:「タイムトラベル」テスト

彼らの理論を証明するために、研究者たちは巧妙な実験をセットアップしました。彼らは動作しているAIモデルを取り上げ、シーンを生成させました。そして、シーンが複雑になる直前、コンピュータが保持している2つの非常に具体的なものの「スナップショット」を撮りました。

  1. AIが最後に見た「最後の画像」(単純な数値のリストとして保存)。
  2. 「乱数生成器(RNG)」の状態。これは、AIの内部的な「サイコロのロール」のようなものです。AIが決定を下したり、新しい詳細を作成したりするたびに、デジタルなサイコロを振ります。もし、サイコロがどの数字に落ちたかを正確に保存しなければ、次のロールは異なるものになり、世界は変化してしまいます。

このスナップショットを撮った後、研究者たちはAIに「旅」を強制しました。AIが持とうとしている「暗黙的な」記憶を完全にかき乱すほど、長く、荒 WILD な一連のイベントを生成させたのです。その後、彼らは旅を停止し、コンピュータが保持していたすべてを破棄し、スナップショットを復元しました。

結果は衝撃的でした。AIがスナップショットから継続して生成したビデオは、AIが一度も離れていなかった場合に生成されるビデオと、バイト単位で完全に一致したのです。完璧でした。猫は全く同じ場所に、着地しました。ピクセルは同一でした。

これは、AIがすべてを完璧に記憶できることを証明しました。問題はAIが物忘れをしたことではなく、AIがそれを使用する前に、コンピュータ・システムがメモ(スナップショット)を捨ててしまっていたことだったのです。

「リクエスト」対「セッション」の混同

なぜコンピュータはメモを捨ててしまったのでしょうか? 実は、コンピュータはチャットボット(宿題のために会話をするようなもの)向けに設計されたルールに従っていたことが分かりました。チャットボットは「リクエスト」単位で動作します。あなたが質問をし、コンピュータが答え、その後、次の人の準備をするためにデスクを片付けます。これはチャットボットにとっては素晴らしいことです。なぜなら、文脈を忘れてしまっても、コンピュータは以前の言葉を読み直して理解できるからです。

しかし、世界モデルは異なります。これらは「セッション」単位で動作します。セッションとは、連続した物語です。もし物語を一時停止して後で戻ってきた場合、あなたは本を読み直してほしいのではなく、まさに中断した場所から再開してほしいはずです。

著者たちは、欠けているデータのピースを**永続的計算状態(Persistent Computational State: PCS)**と呼んでいます。これは、世界の一貫性を保つために「必ず」保存しなければならない、ごく小さな必須データのリストです。

  • 単純なモデルの場合、PCSは単なる最後の画像とサイコロのロール(約1.38 MB)です。
  • 「メモリバンク」を持つより複雑なモデルの場合、それはそのバンクとサイコロのロール(約185 KB)です。
  • 過去のデータを使用する「ウィンドウ」を持つモデルの場合、それはそのウィンドウとサイコロのロール(約1.67 GB)です。

この論文は、すべてを保存する必要はない(それは巨大で低速になるため)ことを示しています。ただPCSを保存すればよいのです。さらに素晴らしいことに、このデータを保存・復元するのにかかる時間はわずか0.012ミリ秒です。これは、ビデオの1ステップを生成するのにかかる時間(1.85秒)よりも5桁も速いのです。実質的に「無料」と言えます。

「関連性」対「新しさ」のひねり

また、論文は、コンピュータのメモリがいっぱいになったときに、どのようにメモリを管理すべきかについて、驚くべき発見をしました。チャットボットでは、コンピュータは通常「新しさ(Recency)」のルールを使用します。つまり、新しいものを作るために、最も古いメッセージを捨てます。しかし、世界モデルにとって、これは災難です。

あなたが映画を見ていると想像してください。コンピュータが「古い」という理由で10分前のシーンを捨て、1分前のシーンだけを残すと決めたとします。もしその映画が、結末を理解するために10分前の出来事を覚えている必要があるとしたら、映画は成立しません。

著者たちは、メモリ管理のさまざまな方法をテストしました。そして、世界モデルにおいては、「関連性(Relevance)」のルールが必要であることを発見しました。たとえ古かったとしても、カメラが「戻ってくる」瞬間(リターン)にとって重要な部分を保持しておくべきなのです。

  • コンピュータがメモリを非常に節約しなければならない状況(利用可能なメモリが2 MBのみ)において、「新しさ」のルールでは16の世界のうち6つしか保存できませんでした。
  • 一方、「関連性」のルールは、16の世界すべてを保存しました。

これは大きな転換です。世界を生かし続けるためには、チャットボットのように考えるのをやめ、どのプロットポイントが最も重要であるかを知っている「ストーリーテラー」のように考えなければならないということです。

大きな教訓

この論文は、AI世界モデルの「物忘れ」は、AIの脳のバグではないと結論付けています。それは、コンピュータ・システムの「家事(管理)」のバグなのです。AIは覚える準備ができていましたが、システムがメモをゴミ箱に放り込み続けていたのです。

「永続的計算状態(スナップショットとサイコロのロール)」を保存するようにシステムを変更し、メモリが不足した際に何を保持するかを判断するよりスマートな方法を用いることで、研究者たちは以下のことを示しました:

  1. 世界を完璧に復元できる。 AIは、長い旅の後であっても、以前と全く同じ状態に戻ることができる。
  2. コストはほとんどかからない。 この状態を保存するのにかかる時間はマイクロ秒単位である。
  3. より多くのセッションを実行できる。 コンピュータは、重たいメモリ全体を高速なグラフィックスカード上に保持し続ける必要がないため、メモを通常のハードドライブに保存できる。これにより、単一のグラフィックスカードで、以前よりも約2,300倍多くのアクティブなセッションを処理できるようになる。

著者たちは、単にメモリを修正する方法を見つけたのではありません。彼らは、その「修正」が、実はコンピュータの時間と空間の管理方法における単純な変更であったことを見出したのです。世界は失われていたのではなく、ただ待っていただけなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →