← 最新の論文
💻 computer science

VicEdit: Learning to Edit Videos from Visual In-Context Examples

本論文は、大規模な新データセット(VicEdit-400K)と、視覚的なインコンテキスト・エキザンプルとテキストによる指示を効果的に統合して優れた編集性能を実現するモダリティ適応型セマンティック蒸留およびデュアルコンテキスト注入といった新技術を活用することで、ビデオ編集を前進させる統一フレームワークであるVicEditを紹介するものである。

原著者: Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

長年、ビデオ編集の夢は、単にコンピュータに何をすべきかを伝えることでした。映画のシーンにある車の色を変えたり、曇り空を夕焼けに置き換えたりしたい場合、「空をオレンジ色にして」といった文章を入力すれば、ソフトウェアが最大限の努力をしてくれました。この「指示ベースの編集」として知られる手法は、目覚ましい進歩を遂げてきました。これは、言語を理解し、画像や動画をゼロから生成できる強力な人工知能モデルに依存しています。しかし、根本的な問題が残っています。言葉は、シーンの特定のルックや雰囲気(ルック・アンド・フィール)を捉えるには、しばしば曖昧すぎるのです。テキストによる説明では「赤い車」と言うことはできても、その赤の正確な色合いや、光が金属に当たる様子、あるいは車両の特定の動きを容易に伝えることはできません。コンピュータが文章のみからこれらの詳細を推測しようとすると、色がドリフトしたり、物体が間違った場所に現れたり、動きが硬く不自然に感じられたりと、結果が正しくないことがよくあります。

これを解決するために、研究者たちはコンピュータへの教え方として、単に言葉で伝えるのではなく、例を見せるという異なる方法を模索し始めました。「インコンテクスト学習(in-context learning)」と呼ばれるこの概念は、人間が職人の技を学ぶ過程に似ています。壁の塗り方をマニュアルで読む代わりに、弟子は熟練の職人が特定の表面に特定の筆致をどのように適用するかを観察します。元の壁と完成した結果との関係性を観察することで、弟子は正確なテクニックを学ぶのです。ビデオ編集の世界において、これはコンピュータに、単一の画像、ビフォー・アフターを示す一対の画像、あるいは望ましい変化を示す短いビデオクリップといった、視覚的なリファレンス(参照資料)を提供することを意味します。これまでの課題は、単一のシステムでこれらすべての異なる種類の視覚的な手がかりを同時に扱うことができず、システムにそれらを効果的に使う方法を教えるための大規模な例のコレクションも存在しなかったことでした。

研究チームは現在、VicEditと呼ばれる新しいシステムによって、この溝を埋めました。彼らの研究は、テキストによる説明だけに頼ることから、視覚的な例を主要なガイドとして使用することへの重要な転換を象徴しています。このシステムを構築するために、チームはまず膨大なトレーニングデータのライブラリを構築しました。彼らは40万件の高品質な例を生成し、「VicEdit-400K」と名付けたデータセットを作成しました。このコレクションがユニークなのは、シーン全体のスタイル変更から、特定のオブジェクトの追加や削除に至るまで、10種類の異なる編集タスクを網羅している点です。極めて重要なことに、このライブラリの各例には、適切な種類の視覚的リファレンスが組み合わされています。スタイルの変更には単一の画像、空間的な変化には一対の画像、あるいは複雑な動きには一対のビデオです。この膨大なライブラリにより、コンピュータはテキストだけでは決して到達できない精度で、視覚的な手がかりを解釈する方法を学ぶことができました。

この新しいシステムの核となるのは、受け取った視覚的な手がかりの種類に基づいて、コンピュータがその理解を適応させる手法です。コンピュータが単一の画像を見たとき、それは質感や色に集中することを学びます。一対の画像を見たとき、それは物体がどのようにある位置から別の位置へと移動するかを理解することを学びます。そして一対のビデオを見たとき、それは時間と動きの流れに従うことを学びます。研究者たちは、これらの視覚的な例から特定の教訓を抽出し、それらを記述された指示と組み合わせるプロセスを設計しました。これにより、コンピュータがテキストを盲目的に従うのではなく、視覚的な例を使用して変化を現実に定着させる(アンカーする)ことが保証されます。例えば、ユーザーが水筒を輝く銀河に変えるよう求めた場合、テキストはアイデアを提供しますが、輝く銀河の視覚的な例があることで、コンピュータはその正確な見た目を知ることができ、一般的すぎるものや歪んだ結果になるのを防ぐことができます。

このアプローチの結果は驚くべきものです。既存の手法と比較してテストを行った際、この新システムは、ユーザーの意図により忠実で、一貫して高品質なビデオを一貫して生成しました。他のシステムが物体の位置を維持することや正しいスタイルを保つことに苦戦したタスクにおいても、この新しい手法は成功しました。それは、新しい物体をシーンにシームレスに融合させたり、前景を歪めることなく背景を変更したり、自然で一貫性のある複雑な芸術的スタイルを適用したりすることができました。このシステムは、コンピュータに何をすべきか「伝える」のではなく、何をするのかを「見せる」ことで、編集の質が劇的に向上することを証明しました。この研究は、視覚的な例が人工知能を導くための強力かつ必要なツールであることを示し、ビデオ編集の新たな基準を確立しました。研究者たちは、自分たちのデータセットとシステムを他者が利用できるように公開しており、将来のより精密でクリエイティブなビデオ編集ツールの扉を開いています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →