← 最新の論文
💻 computer science

Loopy: Seamless Video Loop Generation via Anchored Looping Shift of Positional Embedding

Loopyは、Diffusion Transformer内に層固有の時系列制御を活用して線形な時間知覚を循環的なものへと変換する、アンカー付き位置エンコーディング・シフティング戦略を導入することで、高品質でシームレスなビデオループ生成を実現する新しいフレームワークである。

原著者: Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Xin Wang, Di Lin

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Xin Wang, Di Lin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

デジタル世界において、シームレスなループは連続性の小さな奇跡です。それは、最後のフレームが最初のフレームへと完璧に流れ込み、無限の時間の錯覚を生み出すことで、途切れることなく永遠に再生されるビデオのことです。こうしたループは、ウェブサイトのバナーにある炭酸飲料の泡、ゲームの背景で揺れる草、あるいはソーシャルメディアのアニメーションステッカーなど、いたるところで見られます。数十年の間、これらのループを作成するには、人間のエディターが映像を丹念につなぎ合わせる必要があり、それは時間がかかりコストの高いプロセスでした。近年、人工知能はこの作業を自動化し、単純なテキストによる記述からビデオを生成することを約束しています。しかし、研究者がこれらの強力なAIモデルに対し、完璧なループを作成するよう求めたとき、それらはしばしば失敗しました。ビデオはガタついたり、動きが止まったり、あるいは終わりと始まりが一致しなかったりしたのです。問題は、AIに創造力が欠けていたことではなく、AIが「時間が円としてどのように機能するか」を理解していなかったことにありました。

ある研究チームが、AIの時間経過に対する認識方法を変えることで、このパズルを解きました。彼らは、現在のビデオ生成AIモデル(トランスフォーマーと呼ばれる複雑な内部構造に依存しているもの)が、時間を一本の直線として扱っていることを発見しました。これらのモデルは、各フレームがシーケンス内のどこに位置するかを把握するために特定のメカニズムを使用していますが、これはまるで人が一歩ずつ十まで数を数えるようなものです。これは明確な始まりと終わりがある映画には適していますが、ビデオが始点に戻る必要がある場合には破綻してしまいます。研究者たちは、これらのAIモデル内において、すべてのシステム部分が時間の追跡において等しく優れているわけではないことを突き止めました。モデルのいくつかのレイヤーはフレームの順序に対して非常に厳格ですが、他のレイヤーはより柔軟です。決定的なことに、彼らはシステム全体にとってのマスターリファレンス(参照点)、あるいはアンカー(錨)として機能する特定のレイヤーを特定しました。

ハオティアン・ドン氏率いるチームは、単に最初のフレームを最後に繰り返すように指示してAIにループを強制しようとしても、うまくいかないことに気づきました。AIはしばに、最も抵抗の少ない経路を選んでしまい、静止した動かない画像を作成したり、あるいは最後のフレームと最初のフレームの間で不自然な飛びを生じさせたりすることがありました。そこで彼らは、ビデオにループを強制するのではなく、AIの内部的な時間の地図を変更することに決めました。彼らは、AIモデルの異なる部分に対してタイミング信号を特定の方法で調整する戦略を開発しました。彼らは、ビデオの意味と内容を維持するために「アンカー」となるレイヤーはそのままの状態に保ち、AIが伝えている物語を依然として理解できるようにしました。他のレイヤーについては、ビデオの終わりが数学的に始まりと結びつくようにタイミング信号をシフトさせました。これにより、AIの時間に対する認識を、直線から完璧な円へと変容させたのです。

研究者たちが「アンカード・ポジション・エンベディング・シフティング(anchored position embedding shifting)」と呼ぶこの調整により、AIは最初から最後まで、そして再び最初へと自然に流れるビデオを生成できるようになりました。彼らがこの手法をテストしたところ、その結果は驚くべきものでした。AIは、戦士が剣を振るう様子、結露したグラスに入ったコーラ、あるいは雪の中を跳ねるキツネなどの高品質なループを、動きの断絶を見せることなく作成できるようになったのです。チームはまた、この技術が透明な背景を持つビデオにも有効であることを示しました。これは、異なるシーンの上に動くオブジェクトを配置する際に、固形物のボックス(枠)を必要とするゲーム開発者やデジタルアーティストにとって不可欠な機能です。彼らは、新たに生成されたこれらのループの小さなセットを用いてAIを訓練することで、従来の試みが抱えていたグリッチ(不具合)なしに、多様でリアルな動きを生み出すシステムを作り上げました。

このアプローチの成功は、AIの内部ロジックに対する敬意に基づいています。研究者たちは、時間を線形として捉えるモデルの自然な傾向に抗うのではなく、アンカーレイヤーを安定した参照点として利用しながら、残りのシステムを円形のパターンへと優しく導くことで、モデルと共生しました。この手法は他の既存の技術と比較検証され、滑らかで連続的な動きを作り出す上で優れていることが判明しました。これにより、視覚的に一貫しているだけでなく、細部や動きにおいても豊かなビデオの生成が可能になります。研究者たちは彼らのモデルを公開しており、時間の境界が見えなくなり、ループが真にシームレスとなる新しいデジタルコンテンツの波への扉を開いています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →