← 最新の論文
💻 computer science

Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing

本論文は、疎なキーフレームにおけるマルチモーダルな意味理解と、後続フレームにおける高密度なマスク予測のための効率的な特徴空間条件付けを分離することで、モバイル向けモデルよりも最大14倍低いレイテンシを実現する、リアルタイム・オープンボキャブラリー・ビデオ・インスタンス・セグメンテーションのためのデュアルストリーム・ファスト・スロー・フレームワークであるSegFSを提案する。

原著者: Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

公開日 2026-07-02
📖 1 分で読めます☕ さくっと読める

原著者: Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

スマートフォンのカメラで、賑やかな街の風景を撮影している場面を想像してみてください。そして、あなたのスマホが、動いている車、犬、人間に対して、たとえ「紫色のスクーター」のように見たことがないものを探すように頼んだとしても、瞬時に完璧な輪郭を描き出すとしたらどうでしょう。これは**「オープンボキャブラリー・ビデオ・インスタンス・セグメンテーション(Open-Vocabulary Video Instance Segmentation)」**と呼ばれる技術です。

問題は、これを高い精度で行うにはスーパーコンピュータが必要になることです。このような「重い脳」をスマートフォンで動かそうとすると、ビデオがラグを起こしたり、カクついたり、フリーズしたりしてしまいます。

この論文では、「SegFS(Segmenting, Fast and Slow)」という新しいシステムを紹介しています。これは、「速い(Fast)と遅い(Slow)」というチームアプローチを用いてこの問題を解決します。その仕組みを、簡単な例えを用いて説明します。

1. 問題点:「重い脳」によるボトルネック

現在のハイテクなビデオシステムは、スープを出す前に、マスターシェフがすべての材料を味見するようなものです。

  • シェフ(スロー・パス): これは、重厚で精度の高いAIの部分です。ビデオを観察し、あなたのテキストプロンプト(例:「犬を探して」)を読み取り、その犬が正確にどのような姿で、どこにいるのかを注意深く判断します。
  • ボトルネック: このシェフは信じられないほど動作が遅いです。もし、1秒間に30回(毎フレーム)味見をするよう頼んだら、スマホはオーバーヒートし、ビデオは止まってしまいます。

2. 解決策:「速い(Fast)と遅い(Slow)」チーム

マスターシェフにすべてのフレームを味見させる代わりに、SegFSは仕事を2つの役割に分割します。

スロー・パス:マスターシェフ(キーフレーム)

  • 役割: この重量級のAIは、数秒に一度(「キーフレーム」として)だけビデオを見ます。
  • 仕事: 難しい作業を担当します。物体を特定し、テキストプロンプトを読み取り、見つけたすべての物体に対して詳細な「IDカード(埋め込み/embedding)」を作成します。「よし、この瞬間、ここに犬がいて、ここに猫がいる」と判断するのです。
  • 例え: これは、シーンの高品質な写真を撮り、そこにいる全員についての詳細な記述を書くようなものです。

ファスト・パス:素早いスケッチ描き(中間フレーム)

  • 役割: この軽量なAIは、キーフレームの間にある「すべてのフレーム」を観察します。
  • 仕事: 再度「思考」したりテキストを「読み取ったり」することはありません。代わりに、マスターシェフが作成した「IDカード」を受け取り、それをガイドとして使用します。生のビデオのピクセルを見て、「シェフのメモに基づくと、あの犬は今どこにいるのか?」と問いかけます。
  • トリック: ファスト・パスは非常に賢いです。画像の基本的な「骨組み(形状やエッジ)」はすでにビデオデータの中に存在していることを知っています。そのため、シェフの指示に基づいて、ただその輪郭を「塗る」だけでよいのです。
  • 例え: マスターシェフが犬の場所を示す地図を描くと想像してください。スケッチ描きは、その地図に基づいて、次の数秒間の犬の動きを素早くトレースするだけです。スケッチ描きは非常に速いため、マスターシェフがスープを味わうスピードよりも14倍速く描くことができます。

3. 彼らはどのように連携するか

論文では、特別な「注入(インジェクション)」プロセスについて説明しています。

  • マスターシェフ(スロー・パス)が犬を見つけると、単に写真を送るだけではありません。犬の**「デジタル指紋」**を送ります。
  • スケッチ描き(ファスト・パス)はこの指紋を受け取り、それを生のビデオデータの中に直接「注入」します。
  • これにより、スケッチ描きは「ああ、左に動いているこのぼやけた形は、シェフが特定したあの犬なのだ」と即座に理解できます。ゼロから犬を再特定する必要はなく、単に指紋を追跡するだけでよいのです。

4. 結果:品質を損なうことなくスピードを実現

論文では、非常に強力なスマートフォンであるSamsung Galaxy S25 Ultraを用いてテストを行いました。

  • スピード: この新システムは、従来のモバイル向けモデルよりも14倍高速です。標準的な滑らかなビデオである**30フレーム/秒(30fps)**でビデオを処理できます。
  • 精度: これほど高速でありながら、精度は低速で重いモデルとほぼ同等です。「スケッチ描き」は「マスターシェフ」の詳細なメモに従っているため、間違いをほとんど犯しません。
  • 効率性: 重い「味見(複雑な計算)」はめったに行わず、「スケッチ(軽い計算)」を絶えず行うことで、バッテリーと計算資源を大幅に節約しています。

まとめ

SegFSを、指揮者とオーケストラと考えてみてください。

  • **指揮者(スロー・パス)**は、数秒に一度、指揮台に立ち、楽譜を確認して、オーケストラに何を演奏すべきかを正確に伝えます。
  • **オーケストラ(ファスト・パス)**は、指揮者の直前の指示に従いつつ、その瞬間のテンポに合わせて即座に調整しながら、音楽を絶え間なく演奏します。

「考えること(スロー)」と「実行すること(ファスト)」を切り離すことで、このシステムはスーパーコンピュータを必要とすることなく、スマートフォン上でのリアルタイムなビデオ理解を実現しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →