← 最新の論文
💻 computer science

Aurora: Unified Video Editing with a Tool-Using Agent

本論文は、生きたユーザーの要求を構造化された編集計画に変換するためにツール拡張型視覚言語モデルを採用し、テキストおよび視覚的な不特定性を解消することで統合型ビデオ拡散トランスフォーマーの性能を向上させるエージェント型ビデオ編集フレームワーク「Aurora」を提示する。

原著者: Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ホームビデオを編集したいが、頭の中には漠然としたイメージしかない状況を想像してください。ビデオ編集者に「背景にいる男性をスーパーヒーローのようにしてください」と伝えますが、どのスーパーヒーローなのかは言わず、その男性がどこに立っているかも正確には指摘しません。

現在のAIビデオ編集の世界では、これが問題となります。ほとんどの高度なAIモデルは、驚くほど才能があるが非常に直感的なシェフのようです。どんな料理も作れますが、完璧なレシピと正確な材料、そして精密な計量を提供した場合に限ります。「辛くしてください」とだけ言うと、コショウの代わりに塩を加えたり、「辛さ」がどのようなものか分からないため料理を断ったりするかもしれません。

Auroraは、シェフの前にスマートなアシスタントを追加することで、この問題を解決する新しいシステムです。

問題:「欠落した材料」のギャップ

現在のビデオ編集AIモデルは強力です。物体を置き換えたり、人物を削除したり、背景を変更したりできます。しかし、厳格なルールがあります。作業を開始する前に、すべてが準備整っている必要があるのです。

  • シャツを「バーバリーのチェック柄のスカーフ」に置き換えたい場合、AIはその特定のスカーフの画像が必要です。
  • 人物を削除したい場合、AIはその人物が正確にどこにいるかを示すマップ(マスク)が必要です。
  • 「もっと速くして」と言われた場合、AIは「それ」が何を指すのかを知る必要があります。

実際の人間は通常、こうした詳細を提供しません。私たちは漠然とした指示を与えます。論文ではこれを**「不十分な仕様(underspecification)」**と呼んでいます。AIは作業する準備ができていますが、ユーザーが作業を開始するために必要なツールを与えていないのです。

解決策:「Aurora」チーム

著者たちは、二人組のチームのように機能するAuroraを作成しました。

  1. エージェント(スマートなアシスタント): これは大規模なAIモデル(VLM)であり、プロジェクトマネージャーとして機能します。「女性のシャツをバーバリーのスカーフのようにしてください」といった漠然としたリクエストを聞き、「待てよ、そのスカーフの画像はないし、彼女のシャツが正確にどこにあるかも知る必要がある」と気づきます。

    • 買い物に出かける: ウェブからバーバリーのスカーフの画像を検索するツールを使用します。
    • マップを描く: 動画内の女性のシャツの正確な輪郭を見つけるツールを使用します。
    • レシピを書き換える: casual なリクエストを、ビデオ編集者が完全に理解できる超詳細な技術的な指示に変換します。
  2. ビデオモデル(シェフ): これが実際のビデオ編集エンジン(「拡散トランスフォーマー」)です。これは直接ユーザーとは話しません。エージェントから完璧にパッケージ化された指示のみを受けます。ソース動画、新しいスカーフの画像、そしてシャツの輪郭を受け取り、魔法のような編集を行います。

実生活での動作

論文には、この仕組みの実例が示されています。

  • シナリオA: 「女性のシャツをバーバリーのスカーフに置き換えて」と言います。
    • Auroraなしの場合: AIは一般的なスカーフを推測するか、失敗する可能性があります。
    • Auroraありの場合: エージェントは実際のバーバリーのスカーフの画像を検索し、動画内のシャツを見つけ、ビデオモデルに伝えます。「これが動画、これが正確なスカーフの画像、これが正確なシャツの場所です。行ってください」と。
  • シナリオB: 「歩行者を削除して」と言います。
    • Auroraなしの場合: AIは間違った人物を削除したり、汚い穴を残したりする可能性があります。
    • Auroraありの場合: エージェントはどの人物が歩行者かを特定し、その人物の周りに正確な輪郭を描き、ビデオモデルに何を消し、背景に何を入れるべきかを正確に指示します。

結果:新しいベンチマーク

研究者たちはAgentEdit-Benchと呼ばれる新しいテストを構築しました。このテストは、曖昧な指示でAIを惑わせるように設計されています。

  • 標準的なAIモデルをこれらの曖昧なリクエストでテストしたところ、スコアは低く(約67〜70%)、
  • Auroraエージェントを追加すると、スコアは大幅に跳ね上がりました(87.9%まで)。

論文はまた、この「スマートなアシスタント」が特定のビデオモデルだけでなく、他のビデオ編集モデルに対しても有効であることを示しました。エージェントはそれらもより良いパフォーマンスを発揮させるのを助けました。これは、どんなシェフにも万能な翻訳者を与えるようなものです。誰が料理しようとも、材料が最初に正しく準備されていれば、料理の味は良くなります。

まとめ

Auroraは単に動画を編集するだけでなく、編集を始める前にあなたの意図を理解します。欠落した画像を集め、欠落したマップを描き、明確な指示を書くツールを使用するエージェントとして機能することで、人間の曖昧さと機械の精度の間のギャップを埋め、最終的な動画があなたのビジョンと完全に一致することを保証します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →