← 最新の論文
💻 computer science

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Pusa V1.0 は、ベースモデルの元の生成能力を完全に維持したまま、画像から動画への変換、開始・終了フレームの条件付け、および動画の拡張を含む、微細なゼロショット時間制御を可能にする非破壊的なベクトル化時間ステップ適応(VTA)法を導入し、事前学習済み動画拡散モデルにおいて実装する。

原著者: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

公開日 2026-05-27
📖 1 分で読めます☕ さくっと読める

原著者: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがゼロから特定の種類の料理を調理するのが極めて得意な一流のシェフがいると想像してください。その料理は「テキストから動画へ」です。あなたはそのシェフにレシピ(テキストプロンプト)を与えると、彼は美味しい動画を即座に作り出します。このシェフこそが「ベースモデル」(具体的には Wan-T2V というモデル)です。

しかし、問題があります。もしあなたが特定の開始材料(例えば猫の写真)を与えて、「この猫から始まる動画を作って」と頼むと、シェフは混乱してしまいます。従来の方法では、シェフはゼロから全く新しい調理法を学ぶ必要があり、その過程で元の料理を上手に作る能力を失ってしまうことがよくありました。これは、たった一つの新しい技を覚えるために、シェフにこれまでの全ての調理訓練を忘れるよう強制するようなものです。

ここに Pusa V1.0 が登場します。

問題点:「硬直した時計」

現在の動画 AI モデルは、硬直した同期時計のように機能します。動画を並んだドミノ倒しと想像してください。これらの古いモデルでは、すべてのドミノ(フレーム)が全く同じ速度とタイミングで倒れなければなりません。

  • もし最初のドミノ(開始画像)を立たせたまま、残りを倒したい場合、時計は壊れてしまいます。
  • この問題を解決するために、他のモデルはシェフを「再訓練」しようとしますが、これは高価で遅く、しばしば元の料理を作る能力を損ないます。

解決策:「個別のリモコン」

Pusa は ベクトル化タイムステップ適応(VTA) という概念を導入します。

動画全体を制御するマスター時計の代わりに、Pusa はすべてのフレームにそれぞれ独自のリモコンを与えます。

  • フレーム 1(開始画像)は「一時停止」に設定されたリモコンを受け取ります。
  • フレーム 2は「ゆっくり移動」に設定されたリモコンを受け取ります。
  • フレーム 3は「速く移動」に設定されたリモコンを受け取ります。

これにより、AI は各フレームを独立して進化させることができます。最初のフレームはあなたが置いた場所に正確に留まり、残りの動画はそれを中心に自然に流れていきます。

魔法の技:「非破壊的」手術

Pusa の最も印象的な点は、それがどのように学習するかという点です。

  • 従来の方法:「画像から始める」という技を習得するために、古いモデル(Wan-I2V など)は巨大で破壊的な大改造を余儀なくされました。彼らは数百万の例で再訓練され、実質的にシェフの脳を再構築する必要がありました。これは計算資源の面で莫大なコストがかかり、元のテキストから動画への変換タスクを忘れることもしばしばありました。
  • Pusa の方法:Pusa は「外科的」な調整を行います。シェフの脳を再構築するのではなく、既存の脳に小さな専門的な道具(ベクトル化タイムステップ)を追加するだけです。
    • 比喩:シェフが既に完璧に調理できる能力を持っていると想像してください。彼を解雇して新しい人を雇う代わりに、彼に最初の鍋を攪拌するのをいつ止めるかを正確に指示するタイマーを渡すだけです。シェフの中核となるスキルは 100% 維持されます。

結果:安価、高速、多用途

Pusa はゼロから全てを再学習する必要がないため、その結果は驚異的です。

  1. 超効率的:他のモデルが数百万の例と巨大な計算予算(計算コストで 10 万ドル以上)を必要としたのに対し、Pusa はわずか4,000 の例と、そのごく一部のコスト(約500 ドル)でトップクラスの成果を達成しました。
  2. ゼロショットのスーパーパワー:シェフの脳が上書きされなかったため、Pusa は画像から始めることだけでなく、追加の訓練なしで即座に他の複雑な技も行う能力を獲得しました。
    • 開始・終了フレーム:AI に開始と終了の両方の画像を与え、その間を埋めさせること。
    • 動画拡張:短い動画をシームレスに長くすること。
    • テキストから動画へ:テキストプロンプトから動画を作成する元の能力を完璧に維持しました。

まとめ

Pusa V1.0 は、車を分解せずにエンジンを進化させるようなものです。フレームを強制的に歩調を合わせて歩かせる代わりに、各フレームに独自の「時間ダイヤル」を与えることで、このモデルは(特定の画像から始めるような)複雑な動画タスクを驚異的な効率で処理できます。これは元のモデルの知性を維持しつつ、新しい柔軟な能力を解き放ち、高品質な動画生成をより安価でアクセスしやすくします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →