← 最新の論文
💻 computer science

X2SAM: Any Segmentation in Images and Videos

X2SAM は、LLM とマスクメモリモジュールを結合することで画像からの任意セグメンテーション機能を動画へと拡張し、多様なセグメンテーションタスクにおいて会話指示と視覚的プロンプトの両方から高品質で時間的に一貫したマスク生成を可能にする統合型マルチモーダル大規模言語モデルである。

原著者: Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

公開日 2026-05-05
📖 1 分で読めます☕ さくっと読める

原著者: Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

超賢いアシスタントが、写真や動画を見て、何が起きているかを正確に教えてくれると想像してみてください。長らく、これらのアシスタントは「全体像」(例:「公園で遊んでいる犬」)を説明するのは得意でしたが、「特定の細部」(例:「犬の左前足に丸を描いて」)を指摘するのは苦手でした。

一方、物体の周りに正確な円(マスク)を描くことには驚くほど優れた専門ツールもありますが、それらは「ここをクリック」や「枠を描け」といった単純な命令しか理解できないロボットのようなものです。「赤いボールを追いかけている犬を見つけて、その周りに描いて」といった複雑な文を理解することはできません。

X2SAM は、このギャップを埋める新しい「超コネクタ」です。会話型 AI の頭脳と、精密な描画ツールの手を組み合わせ、静止画動画の両方で機能します。

以下に、日常の比喩を用いた仕組みの解説を示します。

1. 写真と動画のための「万能翻訳機」

X2SAM を、「人間の言語」と「ピクセル言語」の両方を話す万能翻訳機だと考えてください。

  • 従来の方法: 動画内の特定の物体を見つけたい場合、動画を理解するツールと輪郭を描くツールを別々に使う必要がありました。それらは互いにうまく連携できませんでした。
  • X2SAM の方法: 自然に話しかけるだけで済みます。「白い壁の近くを往復している人を見せて」と言ったり、画面の特定の場所を指差して「このエリアにあるものを見つけて」と言ったりできます。X2SAM は指示を理解し、単一の写真であれ 10 秒の動画クリップであれ、瞬時に輪郭を描いてくれます。

2. 動く画像のための「記憶バンク」

これが、X2SAM を動画において特別なものにする秘密のソースです。

  • 問題点: 標準的な AI に動画内の人物を追跡させると、各フレーム(瞬間ごとの画像)をまるで新品であるかのように見てしまうことがよくあります。人物が木の後ろを通ったり、カメラが揺れたりすると、見失ってしまう可能性があります。
  • X2SAM の解決策: X2SAM にはマスクメモリモジュールがあります。これを「付箋」システムだと想像してください。動画が再生されるにつれて、X2SAM は前のフレームで物体がどこにあったかをメモし、そのメモをポケットに入れておきます。次のフレームを見る際、メモを確認して、「あ、この人はさっきここにおったな、だから多分まだここにいるはずだ」と判断します。これにより、物体が移動したり隠れたり、形が変わったりしても、物体の輪郭を滑らかで一貫性のあるものに保つことができます。

3. 課題の「スイスアーミーナイフ」

この論文では、X2SAM が各作業ごとに異なるツールを必要とするのではなく、単一のシステムで多様なタスクを処理できると主張しています。以下のようなことができます:

  • 汎用セグメンテーション: 「この画像にあるすべてのものの輪郭を描いて」。
  • 参照セグメンテーション: 「帽子をかぶっている猫を描いて」。
  • 推論セグメンテーション: 「コップに水を注ぐのに使える物体を見つけて」。これは単に「ピッチャー」という言葉を探すだけでなく、それを「ピッチャー」だと考えて見つける必要があります。
  • 視覚的グラウンディングセグメンテーション: 画面の特定の場所を指差すと、指差している物体を描きます。
  • 会話: 画像や動画について話し合いながら、同時にマスクを描くことができます。

4. 学習方法(トレーニング)

これほどまでに優れるために、研究者たちは一つのことだけを順番に教えたわけではありません。統合共同トレーニング戦略を用いました。

  • 比喩: 生徒を教えることを想像してください。月曜日に数学を教え、火曜日に歴史を教えるのではなく、歴史の事実を使って数学の問題を解く方法と、その逆を、同時に教えるようなものです。
  • X2SAM は、膨大な量の画像と動画を同時にトレーニングしました。これにより、写真の中の「犬」を見つけるルールと、動画の中の「犬」を見つけるルールは似ているが、1 秒前に犬がどこにいたかを記憶するという追加の要素があることを学ぶことができました。

5. 新しい「テスト」(V-VGD)

著者らは、Video Visual Grounded (V-VGD) セグメンテーションと呼ばれる新しいテストも作成しました。

  • 比喩: 以前は、テストは主に「犬を見つけられますか?」と問うていました。X2SAM の新しいテストは、「この動画の画面の特定の場所を指差しています。私が指差している物体を見つけ、動きに合わせて追跡できますか?」と問います。これは、AI が視覚的な手がかりと動く物体との間のつながりを本当に理解しているかをテストするものです。X2SAM はこのテストで見事に合格し、以前のモデルを凌駕しました。

まとめ

X2SAM は、人間に、すべてのピクセルを見通す目、複雑な文と論理を理解する脳、そして一瞬前に何があったかを記憶する記憶力を与えたようなものです。これにより、写真と動画の両方において、特定のものを発見し輪郭を描くために、コンピュータと自然な会話を行うことが可能になります。すべてを一度に行うことができます。

それが行わないこと(論文に基づき):
この論文は、画像や動画内の物体をセグメント(輪郭)化する技術的能力に完全に焦点を当てています。医療診断、自動運転車、セキュリティ監視への利用を主張するものではありませんが、それらはそのような技術の将来の潜在的な用途です。これは、指示に基づいて視覚コンテンツを理解し、輪郭を描くための厳密なツールです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →