← 最新の論文
💻 computer science

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

本論文は、ブロック相対的 RoPE、KV フラッシュ、RoPE カットという 3 つのコンポーネントを統合した「\infty-RoPE」を提案し、既存の自己回帰型動画拡散モデルの時間的制約、制御性の低下、連続的なカット割りの欠如といった課題を解決し、トレーニング不要で無限の長さかつ細やかな制御が可能な映画のような動画生成を実現するものです。

原著者: Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

公開日 2026-03-20
📖 1 分で読めます☕ さくっと読める

原著者: Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「たった 5 秒の動画しか作れない AI に、無限に続く映画のような動画を、何の追加学習もなしに作らせる魔法」**を紹介したものです。

タイトルにある「Infinity-RoPE(インフィニティ・ロープ)」という名前ですが、これは「無限に伸びるロープ」のようなイメージを持ってください。

以下に、専門用語を避け、身近な例え話を使ってわかりやすく解説します。


🎬 従来の AI の問題点:「記憶の限界」と「硬直した時間」

これまでの動画生成 AI は、3 つの大きな壁にぶつかっていました。

  1. 記憶の限界(1024 フレームの壁):
    従来の AI は、時間を「絶対的な番号(1 番目、2 番目…)」で覚えていました。しかし、その番号には上限(1024 まで)が決まっていて、それを超えると AI は「いつの出来事だっけ?」と混乱し、動画が崩壊してしまいました。

    • 例え話: 1024 ページまでしか書けないノートに、1025 行目を書こうとして、ページが破れてしまうような状態です。
  2. 指示への反応が遅い:
    「立ち上がって、ジャンプして、座って」といった指示を途中で変えようとしても、AI は過去の記憶(キャッシュ)を全部持っているので、新しい指示にすぐ反応できず、動きがボヤけていました。

    • 例え話: 運転中に「右折して」と言っても、前の目的地への道案内を完全に忘れない限り、曲がりきれない状態です。
  3. 映画のような「カット」ができない:
    連続した動画の中で、いきなり「昨日のシーン」や「別の場所」に切り替える(カットイン)ことができませんでした。AI は「なめらかに繋がること」しか知らなかったからです。


✨ 解決策:「∞-RoPE(インフィニティ・ロープ)」の 3 つの魔法

この論文では、AI を「リトレーニング(再学習)」させることなく、推論(動画を作る)の瞬間だけに 3 つの工夫を加えることで、上記の問題をすべて解決しました。

1. Block-Relativistic RoPE(相対的な時間軸)

「移動する窓」の考え方

  • 従来の方法: 時間を「1 秒、2 秒、3 秒…」と絶対的な数字で固定していました。
  • 新しい方法(相対的): 時間を「今から 3 秒前、2 秒前、1 秒前」という**「今」を基準とした相対的な距離**で捉え直します。
  • 例え話:
    電車に乗っている人を想像してください。
    • 従来の AI は「駅 A から 100km 先」という絶対的な位置を覚えていて、100km を超えるとパニックになります。
    • 新しい AI は「今いる電車(現在のフレーム)から見て、後ろに 3 駅、2 駅、1 駅」という相対的な距離で記憶します。
    • 電車がどこまで走っても、「後ろ 3 駅」のイメージは変わらないので、無限に走り続けても混乱しません。 これにより、5 秒の動画しか知らない AI でも、何時間でも続く動画を作れるようになります。

2. KV Flush(記憶の掃除)

「古いメモを捨てて、今に集中する」

  • 仕組み: 新しい指示(プロンプト)が入ってきたら、過去の「ノイズ」になるような古い記憶を捨て、**「全体の要約(グロバール・シンク)」「直前の 1 枚」**だけを残してリセットします。
  • 例え話:
    会話中に話題が変わったとき、前の話題の細かいメモを全部捨てて、「今話していること」だけに集中するのと同じです。
    • これにより、「立ち上がって」から「ジャンプして」と指示を変えても、AI は過去の「立ちっぱなし」の記憶に引きずられず、瞬時にジャンプの動作を始めることができます。

3. RoPE Cut(映画のカット)

「時間軸をハサミで切る」

  • 仕組み: 連続した時間軸の中に、意図的に「ギャップ」を作ります。
  • 例え話:
    映画で「昼間の公園」のシーンから、いきなり「夜の都会」のシーンに切り替わる時、時間は「1 秒、2 秒…」と連続していませんよね?
    • この技術は、AI の時間軸をハサミでパッと切り、**「10 秒後」や「別の場所」**という新しい座標にジャンプさせます。
    • 背景や照明がガラッと変わっても、主人公の顔や服装はそのままなので、**「同じ人が別の場所にいる」**という映画のような演出が可能になります。

🏆 結果:何がすごいのか?

この「∞-RoPE」を使えば、以下のようなことが可能になります。

  • 無限の長さ: 5 秒の動画しか作れない AI でも、1 時間、2 時間と続く動画が作れます。
  • 自由自在な操作: 「走って」「泳いで」「空を飛んで」と、途中で指示を変えても、スムーズに反応します。
  • 映画のような演出: 1 つの動画の中で、場所や時間を劇的に変える「カット」を入れることができます。

📝 まとめ

この研究は、「AI に新しいことを教える(学習させる)」のではなく、「AI の考え方を少し変える(時間軸の捉え方を変える)」だけで、劇的な進化をさせたという点が画期的です。

まるで、「5 分しか歩けない靴」を履いたまま、相対論の魔法を使って「無限に歩き続けられる」ようになったようなものです。これにより、ユーザーは手軽に、長く、制御しやすい高品質な動画を作れる未来が近づきました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →