← 最新の論文
💻 computer science

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

本論文は、軽量なアダプターと画像・動画の共同学習戦略を採用し、10種類以上の多様な視覚的生成および操作タスクを実行可能な単一の基盤モデルを訓練することで、タスク固有の学習に伴う高コストを克服しつつ、複数のソースからのデータを活用して競争力のある性能を実現する統一フレームワーク「Many-for-Many」を導入するものである。

原著者: Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

公開日 2026-02-06
📖 1 分で読めます☕ さくっと読める

原著者: Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、アートを作成するための膨大な指示書のライブラリを持っていると想像してください。ある指示は「猫を描け」と言い、別の指示は「この猫の写真から動画を作れ」と言い、また別の指示は「この動画のぼやけた部分を修正せよ」や「白黒映画に色を付けよ」と言っています。

通常、これらすべてを行うには、あらゆる仕事に対して異なる専門家が必要です。「テキストから動画を作る」シェフ、「画像から動画を作る」シェフ、そして「動画編集」のシェフといった具合です。これらのシェフをゼロから訓練することは非常にコストがかかり、大量の高品質な材料(データ)を必要とします。

ここに「Many-for-Many (MfM)」が登場します。

この論文の著者たちは、これらすべての仕事を一度にこなせる「スーパーシェフ」を構築しました。10人の異なるスペシャリストを雇う代わりに、彼らは1つの単一のモデルを訓練し、ゼロからの動画生成から既存の動画の編集に至るまで、10種類以上の異なる種類の視覚的タスクを扱えるようにしました。

その手法を、簡単な比喩を用いて説明します。

1. ユニバーサル・アダプター(「スイスアーミーナイフ」のハンドル)

異なるタスクには、異なる「入力」が必要です。

  • テキストから動画へ: 文章を与えます。
  • 画像から動画へ: 写真を与えます。
  • 動画編集: 「マスク」(変更すべき部分を示すステンシル)と共に動画を与えます。

通常、これらの入力は、同じ穴にはまらない異なる形のパズルピースのようなものです。MfMチームは、軽量なアダプターを設計しました。これは、ユニバーサルなハンドルやスイスアーミーナイフの付属品のようなものだと考えてください。それは、テキスト、画像、動画、マスク、さらにはデプスマップ(地形図のように、シーンの3D空間の設計図となるもの)を取り込み、それらすべてを同じフォーマットへと再形成します。これにより、どのような形式の指示であっても、モデルが理解できるようになります。

2. 「共同学習」戦略(「見習い」メソッド)

動画AIをゼロから訓練することは、通常、人に歩く前にマラソンを走ることを教えようとするようなものです。これには、数百万もの高価な動画の例が必要です。

MfMは、**「画像・動画共同学習(Joint Image-Video Learning)」**と呼ばれる巧妙な訓練トリックを使用しています。

  • フェーズ1: モデルにシンプルな「画像」タスク(テキストから絵を描くなど)を教えることから始めます。これは安価で簡単です。
  • フェーズ2: 徐々に「動画」タスクを導入していきます。
  • 魔法: モデルは画像から「視覚的な基本」を学んだため、動画を作る方法を学ぶために、高価な動画の例をそれほど多く必要としません。これは、野菜を切る方法(画像)を先に学び、その後でシチューを作る方法(動画)に進む見習いのようなものです。

これにより、他のトップモデルが使用する動画データのわずか**10%**だけで、強力な80億パラメータのモデルを訓練することができました。

3. 「3D RoPE」(時間と空間のGPS)

動画を自然に見せるためには、モデルは単に物事が「どこにあるか」(左、右、上、下)だけでなく、「いつ起こるか」(最初のフレーム、最後のフレーム)も理解する必要があります。
チームは、モデルの内部的な「GPS」(3D RoPEと呼ばれます)をアップグレードしました。モデルは単にフラットな画面上のピクセルの位置を知っているだけでなく、3D空間における位置と、時間を経た位置を理解します。これにより、モデルはぎこちなく不自然な動きではなく、スムーズでリアルな動きを作り出すことができます。

4. 結果:一つのモデル、多くの超能力

この「スーパーシェフ」は、20億パラメータの小型版と80億パラメータの大型版の2つのサイズでテストされました。

  • 汎用性: モデルは、以下を含む10種類以上の異なるタスクを実行できます。
    • 生成: テキストから動画へ、または画像から動画への変換。
    • 拡張: 短いクリップを取り込み、より長くする。
    • 編集: 物体の除去(インペインティング)、新しい風景の追加(アウトペインティング)、または色の変更。
    • 強化: ぼやけた動画を鮮明にする(超解像)。
  • パフォーマンス: Wan2.1、Hunyuan、さらにはSoraのような商業的な巨人を含む有名なモデルとの直接対決において、MfMモデルは非常に競争力がありました。多くのデータを使用していないにもかかわらず、一貫性と動きの質において、しば-しば第1位または第2位にランクされました。

まとめ

この論文は、訓練プロセスを統一し、異なる種類のデータを混ぜ合わせるためのスマートな「アダプター」を使用することで、特定の仕事のためだけに訓練された特化型モデルと同等、あるいは(時にはそれ以上に)優れた、単一の効率的なモデルを作成したと主張しています。彼らは、一つの多才なツールを構築すれば、あらゆる種類の経験から学ぶことで、あらゆる仕事に対して個別のツールを必要としないことを証明しました。

この論文が主張して「いない」こと:
この論文は、モデルの技術的な訓練と標準的なベンチマークにおけるパフォーマンスに厳密に焦点を当てています。特定の臨床的な問題を解決したことや、コードとモデルの重みのオープンソースリリースを除いて、具体的な将来の商業製品の詳細を述べているものではありません。これは基礎的な研究ステップであり、完成された消費者向けアプリではありません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →