← 最新の論文
💻 computer science

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing

本論文では、単純な外観の変化を超えた指示に基づくビデオ編集能力を進展させるため、複雑なマルチタスクおよび構造的操作をカバーする200万組の指示に整合したビデオ編集ペアからなる大規模データセットであるGoku、ならびにGoku-EditモデルおよびGoku-Benchベンチマークを紹介する。

原著者: Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

魔法のビデオエディターを想像してみてください。それは、「犬を走るスピードを速くして、空を紫色に変えて」といった文章を入力するだけで、映画のあらゆる部分を変更できるものです。長い間、こうした魔法のツールは、まるで「不器用な弟子」のようでした。シャツの色を変えたり、迷い込んだ物体を取り除いたりすることはできても、「キャラクターを部屋の端まで移動させる」ことや「カメラの角度を変える」ことを頼むと、混乱したり、動きが止まったり、あるいはめちゃくちゃな映像を作ってしまったりしたのです。

この論文は、これらの魔法のエディターを真の達人に育てるために設計された、大規模な新プロジェクト「Goku」を紹介しています。彼らが何を行ったのか、分かりやすく解説します。

1. 問題点:「一本足打法」のデータセット

これまでのAIビデオエディターの学習データは、例えば「車の色を変える」といった一つのトピックに関する本だけが詰まった図書館のようなものでした。もし、車を運転する方法(被写体の移動)や、景色を変える方法(カメラの動き)を学びたいと思っても、その図書館には本がありませんでした。AIモデルは、単純な「塗り絵」のようなタスクしかできない状態で停滞していたのです。

2. 解決策:「Goku」ライブラリ

研究者たちは、200万組のビデオペアを含む巨大なデータセット、Gokuを構築しました。これは、AIのための巨大でハイテクな「トレーニングジム」を建設することに似ています。

  • 中身は何? これまでのライブラリとは異なり、ここには複雑な課題が含まれています。カメラがパン(横移動)するビデオ、人物が部屋の片側から反対側へ移動するビデオ、そして複数の変化が同時に起こるもの(例:「シャツを着せ替えて、さらに帽子を被せる」)などが含まれています。
  • どのように作ったのか? 彼らは単にこれらのビデオを撮影したのではなく、これらを生成するための「ロボット工場」を構築しました。高度なAIを使用して、複雑なリクエストを小さく管理しやすいステップへと分解しました。例えば、「犬を走らせる」ように指示する場合、まず単一の画像の中で犬を走らせる方法を教え、次にその画像がビデオの中でスムーズに動くように教える、という手順を踏みました。
  • 品質管理: 生成されたビデオがゴミにならないよう、「3重チェック」のセキュリティシステムを導入しました。すべてのビデオは、指示に従っているか、動きがリアルか、映像に乱れがないかを、超スマートなAI(Gemini)によって3回ずつ厳格にチェックされました。最高の200万件を残すために、約88%の試行は破棄されました。

3. 新しいツール:Goku-Edit

この新しいライブラリを用いて、彼らはGoku-Editという新しいビデオエディターを構築しました。

  • 脳: このエディターは、単にテキストを読むだけでなく、「マルチモーダル大規模言語モデル(MLLM)」を使用しています。これは、エディターに単なるキーワード一致ではなく、物語や指示を実際に「理解」できる脳を与えたようなものです。
  • 二刀流のアプローチ: 最大の革新は、このエディターが連携して動く2つの「手」を持っていることです。
    • 手A(設計者): この手は、変更を行うべき場所を示す大まかな地図(マスク)を描きます。構造と動きに焦点を当てます。
    • 手B(画家): この手は、細部、色、質感に焦点を当てます。
    • なぜ重要か: 「どこを」と「何を」を分離することで、エディターは混乱しなくなります。これにより、犬の毛色を青く塗ってしまうことなく、正確に犬を移動させることができるのです。
  • 「Spatial CFG」: これは、一種のセーフティネット(安全網)を表す専門用語です。エディターが変更を加える際、意図せず他の部分に影響を与えてビデオ全体を台無しにしないように制御します。これにより、変更箇所をタイトかつ精密に保ちます。

4. テスト:Goku-Bench

新しいエディターが最高であることを証明するために、彼らはGoku-Benchと呼ばれる新しいテストを作成しました。

  • 単純なテストではなく、AIに「猫がジャンプする間にカメラを左に動かす」といった、1,000個の困難な課題を与えました。
  • 結果を評価するために、7つの新しい指標を用いました。これには「物理法則が成立しているか?」「カメラの動きはスムーズか?」といった項目が含まれます。
  • 結果: Goku-Editは、指示への追従能力において他のオープンソースモデルをすべて上回り、最大8%の向上を見せました。特に、他のモデルが失敗するような、物の移動や複雑な多段階のリクエストを処理することに長けていました。

まとめ

要約すると、この論文は次のように述べています。「私たちは、AIに単純な色の入れ替えだけでなく、複雑なビデオ編集を教えるための、大規模で高品質なトレーニングライブラリ(Goku)を構築しました。構造と詳細を別々に扱う二部構成のシステムを用いた新しいエディター(Goku-Edit)を開発し、より困難な新しいテスト(Goku-Bench)において、それが他のどのモデルよりも優れていることを証明しました。」

彼らは、この技術が病院や特定の臨床用途に即座に利用可能であるとは主張しておらず、あくまでビデオ編集をよりスマートに、より柔軟に、そして複雑なクリエイティブのリクエストに高い能力で対応できるようにすることに焦点を当てています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →