← 最新の論文
🤖 AI

STORM: End-to-End Referring Multi-Object Tracking in Videos

本論文は、既存の手法の課題を克服し、画像グラウンディングと追跡を統合したエンドツーエンドの MLLM「STORM」と、高精度な新規データセット「STORM-Bench」を提案し、複雑な実世界シナリオにおける参照多物体追跡の性能を飛躍的に向上させたことを示しています。

原著者: Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo

公開日 2026-04-14
📖 1 分で読めます☕ さくっと読める

原著者: Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「STORM(ストーム)」という新しい AI 技術について書かれています。これを一言で言うと、「動画の中で、言葉で指示された『誰』や『何』を見つけ、その動きをずっと追いかけることができる、とても賢い AI」**です。

難しい専門用語を使わず、日常の例え話を使って説明しますね。

1. 従来の AI との 차이(どんな問題があったのか?)

昔の「物体追跡 AI」は、まるで**「分業制の工場で働く作業員」**のようでした。

  • 作業員 A(検知担当): 「あ、人がいる!犬がいる!」と箱(枠)をつけています。
  • 作業員 B(追跡担当): 「あ、箱がついたものを追いかけて!」と指示されます。
  • 作業員 C(言語担当): 「赤い服を着た人」や「左側の犬」という言葉を理解しますが、箱や追跡には直接関与しません。

この方式だと、言葉と映像がバラバラで、複雑な指示(例:「左側の犬と、その隣にいる子供」)を同時に処理するのが難しく、ミスが多発していました。また、大量の「言葉付きの動画データ」が必要で、それを集めるのが大変でした。

2. STORM のすごいところ(解決策)

STORM は、この「分業制」を**「一人の天才シェフ」**のようなスタイルに変えました。

  • オールインワンの天才シェフ:
    STORM は、映像を見る目、言葉を理解する脳、そして動きを追う手が、すべて一つの頭(AI モデル)の中に統合されています。
    「動画を見て、『サングラスをかけた人と、その人が持っているノートパソコン』を全部見つけて、動きを追ってね!」と頼むと、シェフは「わかった!まずサングラスの男を見つけ、次にノートパソコンを見つけ、二人がどう動くかを同時に考えて、箱をつけて追いかけるよ!」と、最初から最後まで一人で完結させます。

  • 外部の道具を使わない:
    昔は「検知用の道具」や「追跡用の道具」を別に用意する必要がありましたが、STORM はそれらが不要です。言葉と映像を直接結びつけて、一貫した判断を下します。

3. 学習方法の工夫(「Task-Composition Learning」)

AI に新しいことを教えるには、通常、膨大な量の「言葉付きの追跡動画データ」が必要です。しかし、そんなデータは存在しません(集めるのが大変すぎるからです)。

そこで STORM は、**「料理の練習」**のような工夫をしています。

  1. まずは基礎から(画像認識):
    まず、静止画で「これは猫だ」「これは赤い車だ」という**「写真と言葉の一致」**を大量のデータで学びます。
  2. 次に動きを学ぶ(単一追跡):
    次に、「この猫を動画の中で追いかける」という**「一つのものを追う」**練習をします。
  3. 最後に本番(複数追跡):
    基礎と単一追跡のスキルを身につけた状態で、ようやく「複数のものを言葉で指定して追いかける」という本番の練習を少しだけ行います。

これにより、**「本番用のデータが少なくても、基礎学力が高ければ、難しい課題もクリアできる」**という仕組みになっています。これを「タスク合成学習(TCL)」と呼んでいます。

4. 作った新しい教科書(STORM-Bench)

既存のデータセットは、言葉が曖昧だったり、対象が少なかったりして、AI の勉強には不十分でした。
そこで、研究チームは**「STORM-Bench」**という新しい教科書(データセット)を作りました。

  • 下から上へ作る方法:
    既存のデータは「動画を見て言葉を作る」方法でしたが、STORM-Bench は**「まず物体を見つけ、その物体に合った『完璧な説明』を AI に作らせて、それを人間がチェックする」**という逆のアプローチを取りました。
  • 結果:
    「左の犬と右の子供」「青い服の男と彼の持っているバッグ」など、複雑で曖昧さのない指示が大量に含まれた、高品質な教科書が完成しました。

5. 結論

STORM は、**「言葉で指示された複数の物体を、動画の中で正確に見つけ、その動きを追い続ける」という、これまで難しかったタスクを、「一つの AI がすべてを完結させる」**形で実現しました。

  • 従来: 分業で、言葉と映像がズレる。
  • STORM: 一人の天才が、言葉と映像を同時に理解し、完璧に追跡する。

これにより、自動運転車や監視カメラ、動画編集など、現実世界の複雑なシーンでも、人間が言葉で指示するだけで、AI が正確に「誰」や「何」を認識・追跡できるようになる未来が近づきました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →