← 最新の論文
🤖 AI

Video Generation Models are General-Purpose Vision Learners

本論文は、学習済みテキスト・トゥ・ビデオ拡散バックボーン上に構築されたフィードフォワード型知覚モデルであるGenCeptionを提案し、大規模なビデオ生成が、多様なコンピュータビジョン・タスクにおいて、最先端かつデータ効率的で汎用的な視覚的知能を実現するための優れた事前学習パラダイムであることを実証する。

原著者: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

公開日 2026-07-13
📖 1 分で読めます☕ さくっと読める

原著者: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超スマートなロボットシェフを何年もかけて作り上げたところを想像してみてください。そのシェフは、完璧なステーキやふわふわのオムレツ、スパイシーなカレーを作るためのレシピに従うことに関しては驚くほど優秀です。しかし、ここには落とし穴があります。もしあなたが「キッチンの温度を教えて」とか「冷蔵庫に卵がいくつあるか数えて」と頼んだとしても、シェフはただぼんやりとあなたを見つめるだけなのです。彼らは「作る」ことに関しては達人ですが、「自分が作っている世界を理解する」ことはできません。

長い間、コンピュータビジョン(コンピュータに「見る」ことを教える分野)は、まさにそのような状態でした。私たちは、あらゆる仕事に対して個別の専門化されたロボットを作ってきました。奥行きを測るロボット、顔を追跡するロボット、エッジを見つける第3のロボットといった具合です。これらはそれぞれの特定の仕事においては優れていましたが、互いに会話することも、全く作り直すことなく新しい技を習得することもできませんでした。

その後、Google DeepMindと他の大学の研究チームは、ある突飛な問いを投げかけました。「もし、完璧なビデオを『生成』することを試すことで学習する、あのロボットシェフに、汎用的な探偵になってほしいと頼んだらどうなるだろうか?」

彼らの論文「Video Generation Models are General-Purpose Vision Learners(ビデオ生成モデルは汎用的なビジョン学習器である)」は、その答えが「イエス」であると力強く示唆しています。彼らは、GenCeptionと呼ばれる新しいモデルを紹介しています。

魔法のトリック:「作る」から「知る」へ

従来のビジョンモデルの訓練方法を、フラッシュカードを使って学生に教えることに例えてみましょう。木の写真を見せて「木」、車の写真を見せて「車」と言うやり方です。これは機能しますが、遅くて硬直的です。

著者たちがGenCeptionと呼ぶ新しい手法は、その学生に、世界についての100万通りの異なる物語を書かせることで教えるようなものです。カメラに向かって手を振るゴリラの物語を書くためには、学生はゴリラがどのように見えるか、手がどのように動くか、光が毛にどのように当たり、カメラの角度が時間の経過とともにどのように変化するかを理解していなければなりません。物語を成立させるためには、世界の物理法則を内面化する必要があるのです。

この論文は、**テキストからのビデオ生成(text-to-video generation)**というプロセスが、実はビジョンのための究極の訓練場であると主張しています。モデルにテキストプロンプト(例:「手を振って近づいてくるゴリラ」)から高品質なビデオを作成するように訓練することで、モデルは図らずも膨大な量の「世界の知識」――3D空間の仕組み、物体の動き、光の挙動など――を学習することになります。

大きな転換:「すべてを支配する一つのモデル」へ

研究者たちは、大規模なビデオ生成モデル(ノイズを取り除いて静止画から鮮明な画像へと徐々に変えていく「拡散モデル」と呼ばれる技術に基づいています)を取り、それを改造しました。

モデルがビデオのフレームごとにゆっくりと「夢を見せる」のではなく(これには非常に時間がかかります)、それを**フィードフォワード(feed-forward)**モデルへと調整したのです。これを次のように考えてみてください。モデルが答えを推測するために50ステップかけてゆっくりと進むのではなく、入力を見て一撃で答えを吐き出すように訓練したのです。

そして、彼らはこの単一のモデルに、テキストプロンプトを変えるだけで「あらゆること」ができるように教えました。

  • プロンプト:「Depth(奥行き)」 → モデルは深度マップ(物体がどれくらい遠いか)を出力する。
  • プロンプト:「Surface Normal(表面法線)」 → モデルは表面がどの方向を向いているかを出力する。
  • プロンプト:「Segmentation(セグメンテーション)」 → モデルは物体を輪郭付けする。
  • プロンプト:「3D Keypoints(3Dキーポイント)」 → モデルは人間の体の関節を見つける。

それは、ポケットの中にナイフ、ドライバー、ハサミを別々に持ち歩くのではなく、必要な道具が要求に応じて自動的に現れるスイスアーミーナイフのようなものです。

結果:スペシャリストを打ち負かす

チームは、シーンの奥行きを測定することから、スキーをしている人のポーズを追跡することまで、膨大なタスクリストを用いてGenCeptionをテストしました。結果は驚くべきものでした。

  • エキスパートを凌駕する: 多くの場合、この単一の「ジェネラリスト(汎用)」モデルは、そのタスクのために特別に構築された専門モデルと同等、あるいはそれ以上の性能を発揮しました。例えば、深度のエキスパートであるDepthAnything3や、セグメンテーションのエキスパートであるSAM3といったモデルに匹敵、あるいはそれらを上回りました。
  • データの魔術師: 最も衝撃的な部分の一つは、モデルが必要としたデータの少なさです。著者らは、GenCeptionがD4RTVGGT-Ωのようなトップクラスのモデルに匹敵する性能を、7分の1から500分の1というはるかに少ない訓練データで達成できたことを発見しました。まるで、ビデオ生成の訓練からゲームのルールをあまりにも完璧に学んだため、一つ一つのプレーを暗記する必要がなかったかのようです。
  • ジェネラリストであること: このモデルは、ほぼ完全に合成データ(人間を描いたコンピュータ生成ビデオ)で訓練されました。それにもかかわらず、見たこともない動物やロボット、あるいは人々が行っている現実世界のビデオを見せたとき、それでも機能しました。モデルは、見たことがないビデオの中でも、猫のひげを追跡したり、毛髪をセグメント化したりすることができました。これは、モデルが特定の写真を暗記したのではなく、「毛」や「髪」という「概念」を学習したことを示唆しています。

この論文が「言っていないこと」

この論文が何を主張していないかを理解しておくことも重要です。著者らは、これがまだ世界のあらゆる問題を解決する魔法の杖ではないことを明確に述べています。

  • 彼らは、あらゆるビジョンのタスクに対して新しいカスタムアーキテクチャを構築する必要があるという考えに、明確に反対しています。彼らは、従来の「専門化されたモデル」という手法が、この統一されたアプローチよりも非効率であることを示しています。
  • また、モデルは素晴らしいものの、完璧ではないことも指摘しています。すべてのタスクを一つの訓練セッションに統合しようとした際、モデルは3Dヒューマン・キーポイント推定(体の関節の追跡)において少し混乱が生じました。このタスク単独のために訓練した場合と比較して、性能がわずかに低下したのです。これは、「ジェネラリスト」のアプローチは強力ではあるものの、性質の異なるタスクを混ぜ合わせる際には、まだ解決すべき課題があることを示唆しています。
  • さらに、合成データで訓練された後に現実世界のビデオを扱える能力は、意図的にプログラムされたものではなく、訓練方法による創発的行動(emergent behavior)、つまり「嬉しい誤算」であることも明確にしています。

結論

この論文は、コンピュータビジョンの未来は、より専門化されたロボットを構築することではなく、世界を鮮明に「想像」させることで、世界を完璧に理解する一つのスーパーロボットを教えることにあるかもしれない、と示唆しています。

ビデオ生成を事前訓練のツールとして活用することで、GenCeptonは、世界を「創造」しようとすることで、その物理的な世界を「見る、測る、理解する」ことができるようになることを示しました。これは、「問題ごとに解決策を設計する」ことから、「あらゆる問題を解決できるスマートな基盤を作る」ことへの転換です。

著者らは、ビデオ生成のような生成モデルをベースとして使用するこの道こそが、大規模言語モデル(LLM)がテキストに革命を起こしたのと同様に、真に汎用的なビジョン・インテリジェンスを構築するための鍵となる可能性があると示唆しています。これは有望な一歩ですが、論文でも述べられている通り、このジェネラリストの脳をあらゆるタスクに対して完璧にする方法を解明するプロセスは、まだ初期段階にあります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →