SAM 2++: Tracking Anything at Any Granularity
本論文は、単一モデル内でマスク、ボックス、ポイントといった多様なターゲット粒度を処理するためにプロンプトエンコーディング、出力デコーディング、メモリ表現を統合した統一された動画追跡フレームワークである SAM 2++ を導入し、これに伴い各種追跡タスクにおいて最先端の性能を達成するための最初の大規模なマルチ粒度データセットを構築した。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢いロボットアシスタントがいて、その仕事は動画を監視し、特定のものを追跡することだと想像してください。この新しい論文が登場する前、ロボットに動く車を追跡させたい場合、それを教えるには一つの方法しかありませんでした。人の顔を追跡させたい場合は、全く異なる方法を教える必要がありました。ボール上の小さな点を追跡させたい場合は、第三の、完全に別の教師が必要でした。
SAM 2++ の背後にいる研究者たちは、シンプルな問いを投げかけました:「なぜ同じ仕事に対して、三つの異なる教師が必要なのでしょうか?」彼らは、車を全体として追跡する(ボックス)、人の体を追跡する(マスク)、あるいは単一の点を追跡する(ポイント)場合でも、ロボットが行っている精神的な作業は全く同じであることを発見しました。「一瞬前にこのものがどう見えたかを覚えておき、今それを再び見つけ出すこと。」
以下に、すべてを行う「汎用トラッカー」がどのように構築されたかを、シンプルに説明します。
1. 問題:専門化されすぎたツールが多すぎる
古いやり方を想像してみてください。それは、ネジ回しを使うためにハサミの代わりにハンドル全体を交換しなければならない、まるでスイスアーミーナイフのようなものです。既存の動画トラッカーは、たった一つの仕事のために作られていました。
- ボックストラッカーは、物体の周りに長方形を描くことしか知りませんでした。
- マスクトラッカーは、物体の正確な形状を塗りつぶすことしか知りませんでした。
- ポイントトラッカーは、単一の点を追跡することしか知りませんでした。
これは、ロボットが三つの異なる「脳」を運ぶことを意味しており、非効率であり、あらゆる種類の動画から同時に学習することを困難にしました。
2. 解決策:一つの脳、三つの言語
チームは、SAM 2++ を作成しました。これは多言語話者(多くの言語を話す人)のようなロボットです。一つの主要な脳を持っていますが、三つの異なる「言語」の指示を理解することができます。
- 「ボックス」言語:「ここは車の周りにある長方形です。」
- 「マスク」言語:「ここは人の正確な輪郭です。」
- 「ポイント」言語:「ここはボール上の小さな点です。」
翻訳機(タスク固有のプロンプト):
あなたがロボットにボックス、マスク、またはポイントを与えるとき、特別な翻訳機が即座にその指示を、ロボットの脳が理解する普遍的な「思考」に変換します。このようにして、ロボットはあなたがボックスを与えたのか、それとも点を与えたのかを気にしません。ただ、「わかった、このものを追跡する必要がある」と知っているだけです。
汎用出力(統合デコーダ):
ロボットが物体を見つけると、単にボックスや点を出力するわけではありません。まず、物体の完璧な「影」(マスク)を描きます。その後、あなたがボックスを求めた場合、その影を測定してボックスを描きます。あなたが点を求めた場合、影の中心を見つけます。これにより、プロセスはシンプルで一貫性が保たれます。
3. メモリ:「賢いノートブック」
動画追跡で最も難しい部分は、物体が木の後ろに隠れたり、速く動いたりしたときに、その物体がどう見えたかを覚えておくことです。ロボットは過去のフレームを保存するために「メモリーノートブック」を使用します。
研究者たちは、ボックス、マスク、ポイントに対して厳密に同じノートブックのページを使用するようにロボットを強制すると、ロボットが混乱することに気づきました。ボックスにはラフなスケッチが必要であり、マスクには詳細な描画が必要であり、点には正確な座標が必要です。
修正(タスク適応型メモリ):
一つの硬直したノートブックの代わりに、彼らはロボットに賢く柔軟なノートブックを与えました。
- ボックスを追跡するときは、「ラフなスケッチ」スタイルで書き込みます。
- マスクを追跡するときは、「詳細なアート」スタイルで書き込みます。
- 点を追跡するときは、「正確な数学」スタイルで書き込みます。
これにより、ロボットは一つの主要な脳を維持しつつ、仕事に応じて書き込みスタイルを切り替えることができ、混乱を防ぎ、物事を記憶する能力を大幅に向上させます。
4. 訓練場:「TAG」データセット
このロボットを教えるために、彼らは古い教科書を使うことはできませんでした。なぜなら、それらには一つの種類の演習しか含まれていなかったからです。彼らは、TAG(Tracking-Any-Granularity:任意の粒度の追跡) と呼ばれる、新しい巨大な図書館を構築しました。
- 構築方法:彼らは巧妙な「ヒューマン・イン・ザ・ループ」システムを使用しました。人間が数フレーム(クリップの開始と終了など)にラベルを付け、ロボットが残りを入力しました。その後、人間がロボットの作業をチェックし、間違いを修正しました。
- 特別性:この図書館のすべての動画には、同じ物体に対して三つのラベル(ボックス、マスク、点)が含まれています。これにより、ロボットは三つのスキルを同時に学習することができ、追跡の真のマスターとなりました。
結果
彼らがこの新しいロボットをテストしたとき、それは三つの仕事すべてで「まあまあ」できるだけでなく、長年にわたりたった一つの仕事のために訓練されてきた専門のロボットたちを打ち負かしました。
- ボックスの追跡は、ボックスの専門家よりも優れていました。
- マスクの追跡は、マスクの専門家よりも優れていました。
- 点の追跡は、点の専門家よりも優れていました。
要約すると:SAM 2++ は、すべての仕事に対して異なるツールが必要ではないことを証明しています。適切な設計があれば、一つの賢く柔軟なシステムが、適切な「言語」で話すだけで、どこで、どの程度の詳細さで、何を追跡しても処理できるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。