← 最新の論文
💻 computer science

CoT-Edit: Let CoT Guide Instruction Video Editing

CoT-Editは、Chain-of-Thought(思考の連鎖)によって強化されたマルチモーダル大規模言語モデルを活用して、精密な空間的事前知識と属性豊かな指示を生成することで、複雑なシーンにおけるオブジェクトの局在化、物理的一貫性、および時間的一貫性を向上させ、テキスト駆動型のビデオ編集を可能にする計画誘導型編集フレームワークを導入する。

原著者: Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにホームビデオの編集を教えようとしている場面を想像してみてください。あなたは複雑なソフトウェアの習得に何時間も費やしたくはありません。ただ、「犬をスーパーヒーローのように空を飛ぶようにして」と言うだけで、それが実現してほしいのです。これは、コンピュータがあなたの自然言語によるコマンドを理解し、ビデオ内のピクセルをその指示に合わせて変更しようとする分野である、「指示ベースのビデオ編集(instruction-based video editing)」の夢です。しかし、ここに落とし穴があります。コンピュータは「常識」に関して非常に苦手としているのです。もしあなたがロボットに「UFOが円を描いて飛んでいる様子を追加して」と伝えたとしたら、ロボットは重力を無視して空に単にUFOの画像を貼り付けたり、あるいはシーン内に2匹の犬がいる場合に、間違った方の犬を猫に変えてしまったりするかもしれません。それはまるで、シェフに「スパイスを少し加えて」というレシピを与え、どのスパイスをどれくらい使うのかを伝えないようなものです。結果はしばしば、めちゃくちゃなものになります。これを解決するために、研究者たちは、曖昧な人間の言葉と、ビデオにおける精密で物理的な動作との間の溝を埋めようとしています。ボールが投げられたら物理法則に従うように、そしてもしあなたが特定の物体を指差したら、コンピュータが正確にどの物体を指しているのかを理解できるようにするためです。

ここで、ビデオ編集における極めて優秀なステップ・バイ・ステップのプロジェクトマネージャーのように機能する新しい手法、「CoT-Edit」が登場します。CoT-Editは、単に指示を叫んでコンピュータが正しく理解することを期待するのではなく、AIに「行動する前に考えさせる」ことを強制します。著者らは、「Plan–Guide–Edit(計画・誘導・編集)」と呼ばれる3段階のフレームワークを提案しています。まず、Planner(プランナー)(非常にスマートなAIの脳)が、ビデオとあなたのテキストコマンドを確認します。それは単に推測するのではなく、「Chain-of-Thought(思考の連鎖、CoT)」と呼ばれる手法を用いて、タスクを細分化します。それは、シーンを分析するために構造化された推論ステップを実行します。「犬は何をしているのか? 犬はどこにいるのか? もしUFOを追加するなら、リアルに見えるためにはどこを飛ぶべきか?」といった具合です。その後、オブジェクトをマークするための正規化されたバウンディングボックス(境界枠)の一連のシーケンスを生成し、「UFOは曲線を描く経路を辿らなければならない」といった物理的なルールを含む、より詳細で「豊かにされた(enriched)」指示を書き出します。

次に、**Guide(ガイド)**がこれらのバウンディングボックスを受け取り、それらを実際のマスクへと変換します。これは、コンピュータに「どこで作業すべきか」を正確に伝えるデジタルステンシルや切り抜き図形のようなものです。コンピュータには今や、単なる漠然としたアイデアではなく明確な地図(ボックス)があるため、どの犬を変えるべきか、あるいは新しい物体がどこに着地すべきかを推測する必要がなくなります。最後に、Editor(エディター)(アーティスト)が、これらのステンシルと詳細な指示を使用して、新しいコンテンツをビデオの中に描き込みます。これは、画家に対して「鳥を描いて」と伝えるのと、「鳥の具体的な輪郭と、色のリスト、そして『鳥は枝の上に座っていなければならず、宙に浮いていてはいけない』というルールを与える」ことの違いのようなものです。

この「まず考える」アプローチは、従来の手法よりも大幅に効果的であることが論文で示されています。テストにおいて、CoT-Editは、多くの似たものがある場合(例えば、茶色の犬ではなく黄色の犬を選ぶなど)に正しいオブジェクトを選択することや、新しい物体を物理的に現実的な方法で動かすこと(例えば、ボールが正しく跳ねるなど)において、はるかに優れた性能を発揮しました。研究者たちは、2段階でシステムを訓練しました。まず、公開データセットを組み合わせて、マスク作成者とエディターを個別に教え込みました。次に、約10万組の高品質なビデオ編集ペアを用いて、それらを一緒に訓練しました。テストを行った際、CoT-Editは、動きの滑らかさやユーザーの指示への忠実さを含むほぼすべてのカテゴリーにおいて、他のトップレベルの手法を凌駕しました。著者らは、「何を」の前に「どこで」と「どのように」を明示的に計画することで、視覚的に印象的なだけでなく、人間の目から見て論理的に納得のいくビデオ編集が可能になると示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →