← 最新の論文
🤖 AI

Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory

本論文は、ノイズの多いポーズ推定や視点の再訪の少なさに起因する課題を克服するために、階層的なポーズフリー・メモリ圧縮器、不確実性を考慮したアクション・ラベリング・モジュール、および再訪密度の高いファインチューニング戦略を採用することで、現実世界の環境において一貫した1000フレーム以上の視覚生成を実現する、堅牢なインタラクティブ・ワールドモデルであるInfinite-Worldを導入する。

原著者: Ruiqi Wu, Xuanhua He, Meng Cheng, Tianyu Yang, Yong Zhang, Zhuoliang Kang, Xunliang Cai, Xiaoming Wei, Chunle Guo, Chongyi Li, Ming-Ming Cheng

公開日 2026-02-04
📖 1 分で読めます☕ さくっと読める

原著者: Ruiqi Wu, Xuanhua He, Meng Cheng, Tianyu Yang, Yong Zhang, Zhuoliang Kang, Xunliang Cai, Xiaoming Wei, Chunle Guo, Chongyi Li, Ming-Ming Cheng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがビデオゲームをプレイしているところを想像してみてください。あなたは部屋の中を歩き回り、窓の外を眺め、角を曲がることができます。ほとんどの「世界モデル」(動きに合わせて世界がどのように見えるかを理解し、予測しようとするAIシステム)は、短期記憶デバイスのようなものです。数秒間の出来事を見せることはできますが、もし長い時間(例えば1,000ステップ)歩き回ろうとすると、混乱し始めます。ドアがどのような見た目だったかを忘れてしまったり、突然壁が消えてしまったりすることがあります。

「Infinite-World」という論文は、この問題を解決するために設計された新しいAIシステムを紹介しています。これは、1,000フレーム(約30〜40秒の連続したビデオ)以上の世界を、正気を失ったり部屋のレイアウトを忘れたりすることなくシミュレートできます。

以下に、その仕組みを簡単な比喩を用いて説明します。

1. 問題点:「ぼやけた地図」と「震えるカメラ」

現実世界のビデオは乱れています。

  • ジッター(震え): 手持ちのカメラでビデオを撮影すると、手が震えます。AIは、カメラが動いたのか、それともカメラが単に揺れただけなのかを判別できません。これにより、AIに世界の動きを正確に教えることが難しくなります。
  • メモリの限界: ほとんどのAIは、これまでに見た「すべてのフレーム」を覚えようとします。もし1,000フレームを覚えさせようとすると、彼らの「脳」は容量がいっぱいになり、クラッシュしたり、ハルシネーション(そこに存在しないものを捏造すること)を起こしたりします。

2. 解決策:3つのスマートなトリック

トリックA:「要約する司書」(階層的なポーズフリー・メモリ圧縮)

非常に長い本を読んでいるところを想像してください。一文字一文字すべてを覚えようとすると、最後まで読み終える頃には最初の方を忘れてしまいます。

  • 他のAIがすること: 彼らは、テーブルの上に本をすべて開いたままにしようとします。すると、散らかって重くなってしまいます。
  • Infinite-Worldがすること: 「要約する司書」を使用します。
    • 短期記憶: 直近の数ページについては、詳細を鮮明に保ちます。
    • 長期記憶: さらに過去に遡るにつれ、司書は一文字一文字を覚えるのをやめます。代わりに、前の章の「要約」を作成します。
    • 魔法の仕組み: この要約は固定サイズに圧縮されます。10ページ読もうが1,000ページ読もうが、司書はポケットの中に小さな要約カードを一枚持っておくだけで済みます。これにより、AIはデータに圧倒されることなく、部屋の概要(窓がどこにあるか、机がどこにあるかなど)を覚えることができます。これはGPSやカメラマップ(ポーズ情報)を必要とせず、ただ「何が重要か」を要約することを学習することで実現しています。

トリックB:動きのための「信号機」(不確実性を考慮したアクション・ラベリング)

現実世界のビデオデータにはノイズがあります。カメラが動いたのは、あなたが歩いたからかもしれませんし、手が震えたからかもしれません。

  • 問題: もし、手ブレのあるビデオに基づいて「左に動く」ということをAIに教えると、AIは「左に動く」とは「カメラを振る」ことであると学習してしまうかもしれません。
  • 解決策: 著者らは、動きに対して「信号機システム」を作りました。
    • 青(進め): 動きが明確で強い。AIはこれを実際の動作として学習します。
    • 赤(止まれ): 動きが極めて小さい、あるいは単なるノイズ。AIはこれを無視します。
    • 黄(不明): 動きがぼやけている、あるいは混乱している。無理にAIに推測させるのではなく、これを「不明」とラベル付けし、「この特定の瞬間からは学習しないでください」と指示します。
    • 結果: AIは明確で強い動きからのみ学習するため、カメラの揺れに惑わされることなく、あなたの操作に対して正確に反応できるようになります。

トリックC:「練習走行」(再訪密度の高いファインチューニング)

著者は、AIに長い経路を記憶させる方法を教えるには、膨大な時間のランダムなビデオは必要ないことに気づきました。必要なのは、特定の種類の練習です。

  • 洞察: 直線に10マイル歩けば、出発点は二度と見ることができません。しかし、円を描いて歩き、元の場所に戻ってくれば、世界の形を学ぶことができます。
  • 戦略: 彼らは、カメラが円を描いて同じ場所を何度も何度も再訪する、わずか30分間のデータセットを使用しました。これを用いて、AIの長期記憶を「呼び起こす」作業を行いました。これは、学生に図書館中のランダムな本を読ませるのではなく、特定の概念を本当に理解しているかを確認するために、集中した短い小テストを行うようなものです。

結果

これら3つのトリックを組み合わせることで、Infinite-Worldは「熟練のストーリーテラー」となります。

  • あなたが部屋の中を長時間歩き回る様子を見守ることができます。
  • 窓が左側にあったことを、あなたが通り過ぎて戻ってきた後でも覚えています。
  • トレーニングビデオが多少揺れていたとしても、あなたの「左に動く」というコマンドに正確に反応します。
  • これらすべてを、大量のデータを一度に保持するためのスーパーコンピュータを必要とせずに実行します。

要するに、彼らはスマートな要約と、乱れたデータの丁寧なフィルタリングを用いることで、迷ったり、忘れたり、クラッシュしたりすることなく、長い時間「世界を探索する」ことができるAIを構築したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →