← 最新の論文
💻 computer science

MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens

MemRoPE は、指数移動平均によるメモリトークンの進化とオンライン RoPE インデックスを組み合わせたトレーニング不要のフレームワークであり、既存の手法が抱える長期生成における忠実度の低下やアイデンティティの崩れを解決し、分単位から時間単位にわたる高品質な無限動画生成を実現します。

原著者: Youngrae Kim, Qixin Hu, C. -C. Jay Kuo, Peter A. Beerel

公開日 2026-03-17
📖 1 分で読めます☕ さくっと読める

原著者: Youngrae Kim, Qixin Hu, C. -C. Jay Kuo, Peter A. Beerel

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文「MemRoPE」は、**「1 時間以上も続く、途切れることなく、同じキャラクターや風景が崩壊しない動画を作る技術」**について書かれています。

これまでの AI 動画生成は、長くすると「誰が映っているかわからなくなる(顔が変わる)」、「背景がぐちゃぐちゃになる」、「動きが止まってしまう」という問題がありました。MemRoPE は、それを解決する画期的な方法です。

専門用語を使わず、3 つの重要なアイデアで説明します。

1. 問題:「記憶の限界」と「忘れっぽさ」

これまでの AI は、動画を生成する際、**「直前の数秒の記憶しか持っていない」**状態でした。

  • 例え話: 長い映画を作る監督が、前のシーンのことを全く覚えていない状態で、次のシーンを撮り続けているようなものです。
    • 10 分経つと「主人公の顔が別人になっている」。
    • 30 分経つと「背景の街並みが消えている」。
    • 1 時間経つと「物語が破綻している」。

これを防ぐために、過去の映像をすべて保存しようとしても、AI のメモリ(脳の容量)には限界があり、古くなると捨ててしまう(FIFO 方式)しかありませんでした。

2. 解決策:MemRoPE の「2 つの魔法」

MemRoPE は、特別なトレーニングなしで、AI に**「賢い記憶術」**を授けます。

① 「記憶の二重構造」(Memory Tokens)

AI に**「長期的な記憶」「短期的な記憶」**の 2 つのノートを持たせます。

  • 長期的な記憶(Long-term): 「主人公の顔」や「全体の雰囲気」など、変わらない重要な要素を、ゆっくりとまとめ上げて保存します。まるで、古いアルバムに写真を貼り付けていくように、全体のストーリーを忘れないようにします。
  • 短期的な記憶(Short-term): 「今、風が吹いている」「人が走っている」といった最新の動きを、鮮明に覚えておきます。

例え話:
まるで、**「老舗の料理長」**が厨房で働いているようなイメージです。

  • 長期的な記憶は「レシピと味付けの基礎」。何十年経っても変わらない「あの店の味」を守ります。
  • 短期的な記憶は「今日の仕入れと調理中の様子」。今、鍋に何を入れているかを正確に把握します。
    この 2 つを組み合わせることで、「昔からの味(一貫性)」を守りつつ、「今現在の動き(自然さ)」も表現できるようになります。

② 「位置の自由」(Online RoPE Indexing)

これが最も重要な技術的工夫です。
これまでの AI は、映像の「いつ(時間)」と「どこ(位置)」を、記憶する瞬間に**「ラベルを貼って固定」**していました。そのため、過去の映像をまとめようとすると、ラベルがズレてしまい、情報が壊れてしまう(「回転する」イメージ)という問題がありました。

MemRoPE は、**「ラベルを貼らずに、必要な時にだけ貼る」**という方法をとります。

  • 例え話:
    • 古い方法: 本棚に本を並べる際、「1 番、2 番、3 番」と番号を刻み込んで固定してしまう。新しい本を入れると、番号がズレて本棚が崩れる。
    • MemRoPE の方法: 本には番号を書かず、必要な時に「今から 1 番、2 番、3 番」とその場で番号を振る
      これにより、過去の情報を「まとめ直す(圧縮する)」ことが可能になり、1 時間経っても情報が壊れずに済みます。

3. 結果:1 時間動画の成功

この技術を使うと、**「1 時間」**という途方もない長さの動画を生成しても、以下のようなことが起こります。

  • 主人公の顔は最初から最後まで同じ。
  • 背景の東京の街並みは、ネオンが光り続けるが、建物は崩れない。
  • 動きは自然で、急に止まったりしない。

まとめると:
MemRoPE は、AI に**「過去の全体像を忘れない長期的な記憶」「最新の動きを捉える短期記憶」を持たせ、さらに「情報を整理する仕組み」を工夫することで、「トレーニング不要で、1 時間以上の高品質な動画を、メモリを消費せずに作り続ける」**ことを可能にしました。

まるで、**「記憶力抜群の映画監督」**が、何時間でも撮影を続け、物語の矛盾やキャラクターの崩壊を一切許さないような状態を実現したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →