← 最新の論文
💻 computer science

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

本論文は、ノイズの多い動画・テキスト対データに依存しない、エンコーダー・予測器・デコーダー(EPD)フレームワークと、拡散デコーダーを用いた2段階の事前学習手法を採用し、物体運動や物理的手がかりなどの潜在的な世界知識を効果的に学習する汎用動画基盤モデル「InternVideo-Next」を提案し、複数のベンチマークで最先端の性能を達成したことを報告しています。

原著者: Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

公開日 2026-03-31
📖 1 分で読めます☕ さくっと読める

原著者: Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

動画の「本当の理解」を目指す新 AI:InternVideo-Next の解説

この論文は、**「動画を見て、単に『何が起こっているか』を認識するだけでなく、物理法則や空間の仕組みまで理解できる AI」**を作るための新しい方法を紹介しています。

これまでの AI は、動画のテキスト(キャプション)を大量に読ませて学習させられてきましたが、それには限界がありました。そこで、著者たちは**「動画そのものから世界を学ぶ」**という新しいアプローチを提案しました。

わかりやすくするために、いくつかの比喩を使って説明します。


1. 従来の AI の問題点:「不十分なメモ」と「表面的な記憶」

これまでの動画 AI は、大きく分けて 2 つのやり方でした。

  • テキスト学習派(動画+説明):

    • 比喩: 料理のレシピ(テキスト)だけを見て、料理の味を覚える人。
    • 問題点: レシピには「火加減」や「食材の重さ」などの細かいニュアンスが書かれていないことが多いです。そのため、AI は「猫が走っている」という言葉は覚えますが、「猫がどうやってジャンプしたか(物理的な動き)」や「背景の建物の立体感(3D 構造)」までは理解できません。また、ネット上の説明は誤りやノイズが多いので、偏った知識しか身につかないこともあります。
  • 自己学習派(動画だけ):

    • 比喩: 説明なしで、ただ動画を見続けて「次は何が映るかな?」と予想する人。
    • 問題点: 過去の経験則(「赤い球が動いたら次は青い球が来る」など)だけで適当に予想してしまい、本当の「なぜそうなるのか」という深い理屈(物理法則や因果関係)を学べないことがあります。これを論文では**「近道学習(ショートカット)」**と呼んでいます。

2. 新手法「InternVideo-Next」の仕組み:3 段階のトレーニング

この新しい AI は、**「エンコーダー(見る人)」「予測者(考える人)」「デコーダー(描く人)」**という 3 人の役割に分けた、2 段階のトレーニングを行います。

ステージ 1:「完璧なスケッチ」を描く練習

まず、AI に動画の一部を隠して、**「隠れた部分を、ただの画素(ピクセル)として、かつ意味のある絵として正確に復元する」**練習をさせます。

  • 従来の方法: 隠れた部分を「ただの点の集まり」として復元しようとして、意味が崩れてしまったり、逆に「意味だけ」を考えて細部がぼやけてしまったりしていました。
  • この論文の工夫:
    • 拡散モデル(Diffusion)を使う: 霧が晴れていくように、ぼんやりした絵を徐々に鮮明にしていく技術を使います。これにより、「意味(何の絵か)」と「細部(ピクセルの質感)」の両方を同時に学べます。
    • 画像の知識を取り入れる: 動画の説明(テキスト)は不足していますが、静止画の説明は豊富です。そこで、**「画像の専門家(SigLIP)」**という先生を呼んで、「これは猫だ」という意味のヒントを AI に与えます。これにより、ノイズの少ない「正しい意味」を学ばせながら、動画特有の「動き」を学ばせます。

ステージ 2:「世界の法則」を学ぶ練習

ステージ 1 で「意味と細部のバランスが取れた脳(潜在空間)」が完成したら、ステージ 2 では**「隠れた部分を、もう一度『意味』だけで予測する」**練習をします。

  • 比喩: ステージ 1 で「絵の具の混ぜ方」を完璧に覚えた状態で、ステージ 2 では「絵の具を使わずに、頭の中で『次はどうなるか』を想像する」練習です。
  • 重要なポイント: ここでは、先生(教師モデル)が**「凍結(固定)」**されます。つまり、ステージ 1 で完璧に学んだ「意味と細部のバランス」を壊さず、その上で「物体が動く物理法則」や「因果関係」だけを深く学ばせます。これにより、近道学習(表面的な予想)を防ぎ、本当の「世界理解」が可能になります。

3. 何がすごいのか?(成果)

この方法で学習した AI は、驚くべき成果を上げました。

  • テキストなしで世界一: 動画とテキストのペアを使わずに学習したにもかかわらず、テキストを大量に使った従来の AI よりも、アクション認識や細かい動きの理解で勝りました。
  • 物理法則の理解: 「物体がどこにあるか(3D 構造)」や「奥行き(深度)」を、特別な訓練なしに推測できるようになりました。
    • 例: 動画を見て「この手前には壁がある」とか「このボールは地面に当たって跳ねる」といった物理的な理解ができました。
  • 多様な用途: 動画検索や、動画を使ったチャットボット(「この動画で何が起こっている?」と質問に答えるなど)の基盤としても優秀です。

まとめ

この論文は、**「AI に動画を見せるだけで、人間のように『物理的な世界』を理解させる」**ための新しい道筋を示しました。

これまでの AI が「言葉の教科書」で勉強していたのに対し、InternVideo-Next は**「実体験(動画そのもの)を通じて、意味と感覚を同時に磨く」**という、より自然で強力な学習方法を開発したのです。これにより、将来のロボットや AI が、私たちが住む複雑な世界をより深く理解し、サポートできるようになることが期待されます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →