← 最新の論文
💻 computer science

InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter

本論文は、事前学習済みビデオ生成モデルのための軽量なアダプターであるInfinityEditを紹介するものであり、これは、忠実な時間的連続性と無限の編集リクエストにわたる安定した生成品質を確保することにより、ストリーミングビデオの無制限かつ指示に基づく編集を可能にする。

原著者: Yunze Tong, Mushui Liu, Canyu Zhao, Shiyi Zhang, Didi Zhu, Peng Zhang, Wanggui He, Jinlong Liu, Ying Chen, Hao Jiang, Pipei Huang, Bo Zheng

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Yunze Tong, Mushui Liu, Canyu Zhao, Shiyi Zhang, Didi Zhu, Peng Zhang, Wanggui He, Jinlong Liu, Ying Chen, Hao Jiang, Pipei Huang, Bo Zheng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

サッカーの試合のライブ中継を見ている場面を想像してみてください。突然、スタジアム全体が水彩画のように見えたり、カメラが空からボールを追うように急降下したりしてほしいと思ったとします。人工知能の世界では、このような変化を生み出すことは通常、硬直したプロセスです。現在のツールは、完成した短いビデオクリップを取り込んで加工することはできますが、そのクリップを「閉じた箱」として扱います。それらは既にあるものを書き換えることはできますが、次に何が起こるかという「未来」にまで手を伸ばして変更を加えることは容易ではありません。もしビデオが再生され続ければ、古いルールは機能しなくなり、新しいスタイルやカメラアングルは消えてしまいます。この限界により、物語がまだ展開している最中のライブストリームや進行中のシーンを編集することは困難になっています。

研究チームは、終わることのないビデオを編集する新しい方法を開発することで、この問題に取り組んできました。彼らはこのアプローチを「インフィニティ・ビデオ・エディティング(無限ビデオ編集)」と呼んでいます。ビデオを固定された時間枠に押し込める代わりに、彼らの手法は、人工知能に(新しい視覚スタイルやカメラの動きといった)変化を適用させ、その変化を自然に永遠に継続させる新しいフレームを生成し続けることを可能にします。このシステムは単に過去を書き換えるのではありません。変化を未来へと運び去る方法を学習し、新しい指示が次々と届いても、ビデオが整合性を保ち高品質であり続けるように設計されています。

研究者たちはまず、既存のビデオエディターが単純な前提に基づいていることに気づきました。それは、「ビデオはすでに完成している」という前提です。既存のツールはソースとなるクリップを取り込み、それと全く同じ長さの編集版を作成します。これは短編映画やSNSの投稿には適していますが、ライブゲームや防犯カメラの映像のような、連続的なストリームには適していません。このような状況では、ビデオは成長し続けます。もし経過の途中で映像のスタイルを変えたい場合、その編集は新しく現れるすべてのフレームにまで拡張されなければなりません。古い手法ではこれは不可能です。なぜなら、それらは開かれたスト流(ストリーム)ではなく、静的なクリップを遡って見るように設計されているからです。

この問題を解決するために、チームはまず、コンピュータにこの特定の課題を処理する方法を教える仕組みを構築しました。彼らは膨大なトレーニング例のコレクションを作成しました。既存のビデオを取り出し、それを「これをコミックブックのようにして」や「カメラを下に動かして」といった指示とペアにしました。決定的なのは、コンピュータに既存のフレームを変更させるだけではなかった点です。彼らは、元の映像から継続しつつ、要求された変化を適用した新しいビデオセグメントを生成しました。これにより、システムに対して、編集とは単なるスナップショットへのフィルター適用ではなく、物語が進むための「新しい方向性」であることを教え込んだのです。彼らは、新しいビデオセグメントが現実的に見えること、そしてシーンの流れを壊すことなく変更が正しく適用されていることを確認するために、このデータを慎重にフィルタリングしました。

このデータを用いて、彼らは「InfinityEdit」と呼ばれる新しいシステムを導入しました。このシステムは、非常に長いビデオを作成することに長けた強力なビデオ生成器に、小さく軽量な「アダプター」を取り付けることで機能します。メインの生成器を、連続した画像を書き続けることができる熟練したアーティストだとすれば、アダプターは、描画中のスタイルを即座に変更できる特別な筆のようなものです。メインの生成器は「凍結」された状態であり、安定した高品質なビデオを作成するための核となる知識が変更されることはありません。学習するのはアダプターのみです。アダプターは生成器とユーザーの指示の間に位置し、新しい編集リクエストが届いた時にのみ介入する準備を整えています。

ユーザーが指示を送ると、アダプターはビデオのわずか一区間だけ起動します。アダプターは指示とビデオの直近の履歴を受け取り、その変化を適用した新しいフレームの塊(チャンク)を生成します。この新しい塊は「架け橋」として機能します。この最初の編集済みセグメントが作成されると、アダプターはオフになり、再びメインの生成器が制御を引き継ぎます。メインの生成器は、新たに編集されたフレームを自身の「履歴」として認識しているため、自然とその新しいスタイルやカメラアングルでビデオを継続させることができます。これにより、編集が「点火」され、システムはそれを自動的に前方へと運び続けます。このプロセスは無限に繰り返すことができます。もし後から二つ目の指示が届いたとしても、アダプターは再び起動して新しい変化を適用し、生成器はその時点から継続していきます。

研究者たちは、このアプローチが、長いビデオ生成において通常問題となる2つの大きな課題を解決することを発見しました。第一の課題は「一貫性」です。多くのシステムでは、生成中のビデオを編集しようとすると、変化が次第に薄れたり失われたりすることがよくあります。新しいフレームが進むにつれて、元のルックに戻ってしまうのです。InfinityEditは、編集が発生するたびに重要な参照点をリセットすることで、これを防ぎます。これにより、ビデオは直近の変化に固定され、ビデオが継続する限りスタイルやカメラアングルが安定したまま保たれます。

第二の課題は「品質」です。コンピュータがフレームごとにビデオを生成する場合、小さなミスが時間の経過とともに蓄積し、映像がぼやけたり歪んだりすることがあります。研究者たちは、不完全な履歴を扱うようにアダプターを訓練しました。彼らは意図的に、前のフレームにわずかな欠陥がある例をシステムに与え、入力が完璧でなくてもクリーンな結果を生み出せるように学習させました。このトレーニングにより、システムは多くの編集を経た後でも安定性を保ち、ビデオが長くなるにつれて品質が劣化することを防ぐことができます。

テストにおいて、システムは進行中のビデオストリームに対して幅広い種類の編集を正常に適用できました。シーンの視覚スタイルを変更したり、カメラの動きを変えたり、オブジェクトの外観を変更したりすることができ、その後、それらの変更を維持したままビデオの生成を継続できました。結果は、ビデオが指示に忠実であり、元の状態にドリフト(回帰)しないことを示しました。システムは品質を損なうことなくこれらの変更を繰り返し処理でき、ビデオが終了するのを待つのではなく、進行中のビデオストリームをリアルタイムで編集することが可能であることを証明しました。

この成果は、ビデオとの新しい種類のインタラクションへの扉を開きます。完成した製品を編集する代わりに、ユーザーはビデオが生成されている最中にそれを導くことができるようになりました。ライブスポーツ放送のスタイルをリアルタイムで変更することも、長い録画中に仮想カメラの視点を変えることも、この技術は、物語が展開している間、編集を生き続けさせる方法を提供します。研究者たちは、安定した事前学習済みの生成器と、柔軟で軽量なアダプターを組み合わせることで、時間に縛られないビデオ編集ツール、すなわち真に無限の創造的可能性を持つストリームを作り出せることを示したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →