← 最新の論文
🤖 AI

Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention

本論文は、近似最近傍探索による時間キャッシュの圧縮とアテンションの疎性化を通じて、視覚的品質を維持しつつ、メモリ使用量を一定に保ったまま5〜10倍の高速化を実現する、学習不要のフレームワークであるFAST-ARを提案する。

原著者: Dvir Samuel, Issar Tzachor, Matan Levy, Michael Green, Gal Chechik, Rami Ben-Ari

公開日 2026-06-15
📖 1 分で読めます☕ さくっと読める

原著者: Dvir Samuel, Issar Tzachor, Matan Levy, Michael Green, Gal Chechik, Rami Ben-Ari

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に長い物語を、一文ずつ書いていく場面を想像してみてください。新しい文章を書くたびに、その文章が完璧に適合しているかを確認するために、これまでに書いたすべての文章を読み返さなければなりません。

AIによる動画生成の世界では、まさにこれが起きています。AIはフレームごとに動画を作成していく際、これまでに生成したすべての内容を記録した「メモリバンク(KVキャッシュ)」を保持しています。次のフレームを作成するために、AIはこの増え続けるメモリバンク全体を見なければなりません。

問題は? 動画が長くなればなるほど、このメモリバンクは巨大になります。AIは、次の文章を書くために、より多くのテキストを読み込まなければならなくなります。これにより、プロセスは以下のようになります:

  1. どんどん遅くなる(毎秒新しい本が増え続ける図書館の中で、特定の単語を探そうとするようなものです)。
  2. よりコストがかかる(背負うのが重すぎるバックパックのように、コンピュータのメモリを使い果たしてしまいます)。

この論文は、これを解決するための「FAST-AR」と呼ばれる新しい手法を紹介しています。これは、AIに「スーパー・スマートな近道」を与え、疲れたり記憶を失ったりすることなく長い物語を書けるようにするものだと考えてください。

FAST-ARが使う3つの「魔法のトリック」がこちらです:

1. 「重複発見器」(TempCache)

問題点: 動画の中では、多くのものが長い間、変化せずに存在し続けます。もし猫が庭を歩いているなら、フレーム100とフレーム101では、背景の木々や猫の毛並みはほとんど同一に見えます。従来のAIは、全く同じものを二度記憶することで時間を無駄にしていました。
解決策: FAST-ARは、「おい、この木の完璧なコピーはすでにメモリ内にあるよ。もう一度書き留める必要はないね」と気づく、賢い司書のように振る舞います。
これは「似たような重複」がある瞬間を統合することで、メモリを圧縮します。すべてのフレームを一つずつ覚えるのではなく、シーンの「本質」を覚えるのです。これにより、動画がどれほど長くなっても、メモリサイズは小さく一定に保たれます。

2. 「関連事項の読解者」(AnnCA)

問題点: 非常に長いプロンプト(詳細な記述)に基づいて物語を書いている場面を想像してください。プロンプトには「猫が歩き、バンが通り過ぎ、次に犬が現れる」と書かれているかもしれません。AIが現在「猫」を描いているとき、プロンプト内の「バン」や「犬」という言葉を見る必要はありません。しかし、古いAIモデルは毎回プロンプトの「すべて」を読み、エネルギーを浪費してしまいます。
解決策: FAST-ARは、「高速検索」ツール(近似最近傍探索と呼ばれます)を使用して、「この特定のフレームにとって、プロンプト内のどの言葉が実際に重要か?」を瞬時に判断します。
それは無関係な言葉を無視します。もし猫が画面上にいるなら、AIは「猫」という言葉にだけ注意を払います。これにより、膨大な計算量を節約できます。

3. 「フォーカス・フィルター」(AnnSA)

問題点: 動画内部において、AIはあらゆるピクセルを他のあらゆるピクセルとの関係性において見ています。これは、隣に立っている人に話しかけるだけでいいのに、スタジアムにいる全員に同時に話しかけようとしているようなものです。
解決策: FAST-ARは、似たもの同士をグループ化します。もしあるピクセルが「猫」の一部であるなら、そのピクセルは猫の一部である他のピクセルとだけ対話します。背景や、関連のない他のオブジェクトは無視します。これは、一つの巨大で騒がしい群衆ではなく、小さく集中した会話の輪を作ることによく似ています。

結果:短距離走者ではなく、マラソンランナーへ

論文によれば、これら3つのトリックを用いることで、AIは以前よりも5倍から10倍速く動画を生成できることが示されています。

  • 従来の方法: 動画が長くなるにつれて、AIはどんどん遅くなり、最終的にはメモリ不足に陥ります(ランナーが疲れて立ち止まってしまうようなものです)。
  • FAST-ARの方法: AIは、動画が10秒であっても2分であっても、常に一定の速いペースで走り続けます。速度とメモリ使用量は変わりません。

要約すると: FAST-ARは、AIに対して「古いメモを読み返すのをやめ、不要な言葉を無視し、対話している相手だけに集中する方法」を教えます。これにより、AIは自身のメモリに足を取られることなく、高品質で長い動画を作成できるようになるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →