← 最新の論文
💻 computer science

WorldKV: Efficient World Memory with World Retrieval and Compression

WorldKV は、エビクトされた KV キャッシュチャンクの選択的検索とトークン圧縮を組み合わせることで、長期のワールドメモリを維持しつつフル KV 手法と比較してスループットを 2 倍にし、一貫性のあるリアルタイムの自己回帰型動画生成を可能にするトレーニング不要なフレームワークである。

原著者: Jung Yi, Minjae Kim, Paul Hyunbin Cho, Wooseok Jang, Sangdoo Yun, Seungryong Kim

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Jung Yi, Minjae Kim, Paul Hyunbin Cho, Wooseok Jang, Sangdoo Yun, Seungryong Kim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが非常に賢いAIによってリアルタイムで生成される世界を舞台にしたビデオゲームをプレイしていると想像してください。あなたは歩き回り、角を曲がり、探索することができます。その目標は、世界が「リアル」で一貫しているように感じさせることです。部屋から出て5分後に戻ってきたとき、その部屋は全く同じように見えるべきであり、別の部屋になったり、ぼやけたごちゃごちゃしたものになったりしてはいけません。

この論文WorldKVは、現在のAIモデルが抱える特定の課題に取り組みます。以下に、日常的な比喩を用いた簡単な解説を示します。

課題:「短期記憶」対「巨大なバックパック」

現在のAI動画モデルには、記憶を処理する2つの主要な方法があり、どちらも欠点があります。

  1. 「スライディングウィンドウ」(短期記憶): AIが、直前に生成した数秒間しか見えない目隠しをしていると想像してください。あなたが離れて戻ってくると、AIは去った部屋を「忘れています」。そのため、その部屋にあるものを推測しようとしますが、しばしば幻覚(作り話)を起こして新しい家具を追加したり、壁を変更したりします。これは高速ですが、世界の一貫性は保てません。
  2. 「完全な履歴」(巨大なバックパック): 忘却を防ぐために、AIが過去に目にしたすべてを記憶に保持するとします。これは、一歩歩くごとに重くなるバックパックを背負っているようなものです。最終的に、そのバックパックは重すぎて(データが多すぎて)、AIの動作が極端に遅くなったり、コンピュータの容量が完全に不足したりします。世界の一貫性は得られますが、リアルタイムでの動作は停止してしまいます。

解決策:WorldKV

著者たちは、WorldKVという「トレーニング不要」のフレームワークを提案しています。これは、AIに学習方法を再教育する必要はなく、既存のメモを整理するより賢い方法を与えただけであることを意味します。彼らは2つの主要なテクニックを使用します。

1. ワールド検索:「賢い司書」

古い記憶を捨ててしまう(スライディングウィンドウのように)か、すべてを即座の作業スペースに保持してしまう(重いバックパックのように)のではなく、WorldKVは賢い司書のように機能します。

  • 仕組み: AIがシーンを生成すると、その記憶の「断片」を棚(コンピュータのメモリ内)に保存し、カメラアングルや実行されたアクション(例:「右に回転」)でラベル付けします。
  • 魔法: 後でその部屋に戻ると、AIはライブラリ内の「すべて」を見るわけではありません。ラベルを確認します。「ああ、ユーザーが再び右に回転している」と。すると、その視点に一致する特定の記憶断片だけを棚から即座に取り出し、アクティブな作業スペースに戻します。
  • 結果: AIは、履歴全体を一度に背負うことなく、部屋を完璧に記憶します。

2. ワールド圧縮:「重複ファイルクリーナー」

司書がいても、動画フレームは非常に似ているため、記憶の棚は混雑します。ゆっくり歩きながら壁を100枚撮影した場合、その99枚はほとんど同じように見えます。

  • 仕組み: WorldKVはこれらの記憶断片を見て、「これは新しい情報か、それとも既にあるもののコピーか?」と問いかけます。数学的なトリックを用いて「アンカー」フレーム(最も重要なもの)を見つけ、他のフレームの冗長で重複した部分を削除します。
  • 結果: 各記憶断片のサイズを約半分に縮小します。これは、重複した写真のフォルダをzip圧縮するようなものです。これで、AIは容量不足にならずに、同じ棚に2倍の履歴を収められるようになります。

結果:両者の長所を兼ね備える

この論文は、2つの異なるAIモデル(小型と大型)でこれをテストし、WorldKVが「金髪姫」の領域(ちょうど良い状態)を達成することを見つけました。

  • 一貫性: 履歴全体(完全なKV)を保持した場合とほぼ同様に世界を記憶し、「スライディングウィンドウ」方式(何かを忘れる)よりもはるかに優れています。
  • 速度: 履歴全体を保持する場合と比較して約2倍高速に動作し、リアルタイム速度を維持します。
  • 追加トレーニング不要: 既存のモデルに対して、再トレーニングなしですぐに使用できます。

要約の比喩

AIを長い旅をする旅行者だと考えてください。

  • スライディングウィンドウ: 旅行者は旅の最後の5分間しか覚えていません。1時間前に訪れた場所に戻ろうとすると、道に迷ってしまいます。
  • 完全なKV: 旅行者は旅のすべての瞬間の詳細を巨大なジャーナルに書き留めます。道に迷うことはありませんが、500ポンド(約227kg)の重い本を運んでいるため、歩くのに遅すぎます。
  • WorldKV: 旅行者は最後の5分間のための小さく活動的なノートを持っています。しかし、旅の残りの部分の圧縮された要約を保管する賢いファイルキャビネットも持っています。特定の場所を思い出す必要があるとき、彼らはキャビネットから適切な要約を素早く引き出し、ノートに加えます。道に迷うことはなく、通常のペースで歩くことができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →