← 最新の論文
💻 computer science

CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking

本論文は、多様な視覚的条件下におけるクロスドメイン・リファリング・マルチオブジェクトトラッキング(CD-RMOT)を評価するための統一的なベンチマークであるCD-RMOT-Benchを導入し、言語誘導型トラッキングにおけるドメインシフトによって引き起こされる性能低下に対処するためのクエリ中心適応(QCA)フレームワークを提案する。

原著者: Xiangqun Zhang, Likai Wang, Zekun Qian, Ruize Han, Wei Feng

公開日 2026-07-29
📖 1 分で読めます☕ さくっと読める

原著者: Xiangqun Zhang, Likai Wang, Zekun Qian, Ruize Han, Wei Feng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに究極のツアーガイドになるよう教えていると想像してください。単に「車」や「人」を見つけるのではなく、「左に曲がっている青いバスを追ってください」といったあなたの言葉による指示に基づいて、「あの特定の、去っていく赤い車」や「一緒に歩いている友人グループ」を見つけ出したいのです。これが**Referring Multi-Object Tracking (RMOT)**の世界です。これは、もっと専門的な言い方をすれば、「ビデオを注視し、私の文章を聞き、私が話している特定の対象物に目を釘付けにしておく」ということを意味します。

長い間、科学者たちは完璧で晴れやかな条件下で、これらのロボットガイドを訓練してきました。彼らは、街の鮮明なビデオを見せ、指示に従う方法を教えてきました。しかし、ここに落とし穴があります。現実の世界は混沌としているのです。時には土砂降りの雨が降り、時には霧が立ち込め、時にはカメラが変な角度に傾いていることもあります。ここで大きな疑問が生じます。もしロボットガイドを晴れた日に訓練した場合、天候が悪くなったり視界が変わったりしたときに、ターゲットを見失って混乱してしまうのでしょうか?この論文は、まさにその問題に切り込み、私たちの言語ガイド付きトラッカーが、ゼロから再学習することなく、風景の急激な変化に対処できるかどうかを問いかけています。

この論文の著者であるZhang Xiangqun氏とそのチームは、推測するのをやめて、テストを開始することに決めました。彼らは、完璧な条件下でのトラッキングには優れたツールがある一方で、視覚的な世界が劇的に変化したときに、それらのツールがどれほどうまく機能するかについては、実はよく分かっていないということに気づいたのです。これを解決するために、彼らはCD-RMOT-Benchという新しい遊び場を作りました。このベンチマークは、大規模で制御されたシミュレーション・ラボのようなものです。彼らは、指示が付随した実世界のビデオを取り上げ、それらの「デジタルツイン」、つまり、天候を雨や霧に変えたり、カメラの角度を左右にシフトさせたりした、同じシーンの正確なコピーを作成しました。また、ロボットがクリーンなデジタル世界から乱れた現実の世界へとジャンプした際にどのように対処するかを確認するために、悪天候の中で撮影された実際のビデオも混ぜ合わせました。

彼らが発見したことは、少し衝撃的なものでした。ロボットは依然として物体を「見る」ことはできていたものの(例えば、雨の中でも車を見つけるなど)、指示が与えられた際に、どの車を追えばよいのかを完全に忘れてしまっていたのです。それは、ロボットが車を見つけられなかったということではなく、雨が降り始めた途端に、「右側の赤い車」という説明に一致する車がどれであるかについて、ロボットが混乱してしまったということでした。この研究は、最大の失敗は物体を特定することにあるのではなく、視覚的条件が変化した際に、発せられた言葉と動いているターゲットとの間の結びつきを維持することにあるということを示しています。

これを解決するために、チームはQCA(Query-Centric Adaptation)と呼ばれる新しい手法を提案しました。ロボットが「赤い車を追え」と書かれた精神的な「付箋」を持っていると想像してみてください。天候が変わると、その付箋は滑り始めたり、ぼやけ始めたりします。QCAは、その付箋を常に再固定する新しいシステムのようなもので、たとえ雨がすべてを違ったように見せたとしても、ロボットの内部的な焦点が正しいターゲットにしっかりと貼り付いたままになるようにします。彼らの実験では、この手法がロボットが軌道を外れないようにするのに大きく貢献し、天候や視点の変化によって失われたパフォーマンスの多くを回復させたことが示されました。

要するに、この論文は、ロボットに言語による指示を与えるだけでは不十分であることを証明しています。ロボットは、思考の筋道を失うことなく、世界の突然の変化に対処できるほどタフである必要があるのです。彼らはこの弱点を測定するための新しいテストを構築し、ロボットガイドが晴れた街を走行しているときでも、霧の嵐の中をナビゲートしているときでも、より信頼性の高いものにするための強力な出発点を提供しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →