← 最新の論文
💻 computer science

DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework

DEGround は、共有オブジェクトクエリとトランスフォーマーヘッドを通じて検出とグラウンディングを統合し、複数のベンチマークで最先端の性能を達成するために専門的なプラグインモジュールを備えた、単一ステージの均質なエゴセントリック 3D 視覚グラウンディングフレームワークを導入する。

原著者: Yani Zhang, Dongming Wu, Hao Shi, Yingfei Liu, Tiancai Wang, Xingping Dong

公開日 2026-04-29
📖 1 分で読めます☕ さくっと読める

原著者: Yani Zhang, Dongming Wu, Hao Shi, Yingfei Liu, Tiancai Wang, Xingping Dong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがカメラと深度センサー(3D スキャナのようないもの)を持って、散らかった部屋を歩くロボットだと想像してください。誰かが「ドアの前にある赤いクッションを見つけて」という音声指示を出します。あなたの仕事は、あなたが目にする 3D 世界を見て、その特定のクッションの周りにデジタルの枠を引くことです。このタスクは「自己中心型 3D 視覚グラウンディング」と呼ばれます。

この論文は、この問題を解決するための新しいシステム「DEGround」を紹介しています。その仕組みを簡単に説明します。

問題:「2 段階式」の混乱

この論文以前、ほとんどのロボットは物体を見つけるために、不器用な 2 段階のプロセスを使用していました。

  1. ステップ 1(探偵): まず、ロボットは探偵のように振る舞い、見えているすべての物体(椅子、テーブル、クッションなど)をスキャンして、それらの周りに枠を描く必要がありました。
  2. ステップ 2(翻訳者): 次に、その枠のリストを受け取り、どの枠が文と一致するかを推測する必要がありました。

比喩: あなたが図書館で特定の本を見つけようとしている状況を想像してください。古い方法は、まず図書館にある「すべての本」のタイトル、著者、場所を巨大なリストに書き出すことでした。その後、そのリストを読み返し、欲しい本を見つけるのです。これは遅く、反復的で、ロボットはステップ 2 を始めるとステップ 1 で学んだことをよく忘れていました。

解決策:DEGround(「オールインワン」の脳)

著者たちは、両方の仕事を一度にこなす単一の効率的な脳のように機能する DEGround を作成しました。

1. 「共有クエリ」(共通言語)
互いに話さない 2 つの異なるシステムを持つ代わりに、DEGround は物体を表すために単一の「クエリ」セット(これらをデジタル付箋だと考えてください)を使用します。

  • 仕組み: ロボットはこれらの付箋を自分が目にする物体の上に置きます。これらの付箋は、「これはクッションである」(検出)と「これが人間が求めているクッションである」(グラウンディング)を「同時に」言うために使用されます。
  • 利点: ロボットは両方のタスクに同じ付箋を使用するため、物体の探し方を再学習する必要がありません。その「ノウハウ」を瞬時に転送できるため、はるかに高速で正確になります。

2. 「領域活性化」モジュール(ハイライトペン)
時には、部屋に 2 つの同じクッションがあることがあります。1 つはドアの近く(あなたが欲しいもの)、もう 1 つは窓の近く(邪魔なもの)です。

  • 比喩: ロボットが魔法のハイライトペンを所持していると想像してください。「ドアの前」という言葉を聞くと、そのハイライトペンは自動的にドアの近くの領域を鮮やかな赤色で光らせ、部屋の他の部分を薄暗くします。
  • 結果: これにより、ロボットは間違ったクッションを無視し、説明に一致する領域にのみ集中できるようになります。

3. 「クエリ別変調」モジュール(文脈スイッチ)
このモジュールは、ロボットが最初から文の「意図」を理解するのを助けます。

  • 比喩: ロボットが部屋を見る前にも、文に基づいて付箋を「プリミング(準備)」します。文が「クッション」に関するものであれば、付箋は柔らかくつぶれやすい形状に対して特に敏感になります。文が「ランプ」に関するものであれば、それらは光と金属に対して敏感になります。
  • 結果: ロボットは推測するのではなく、何を探すかをすでに知った状態で探索を開始します。

結果:なぜ重要なのか

著者たちは、このシステムを「EmbodiedScan」と呼ばれる大規模なベンチマークでテストしました。これは、数千の物体を備えた 3D 部屋の巨大で困難なテストのようなものです。

  • 速度と精度: DEGround は単に勝ったのではなく、競合他社を圧倒しました。前回の最良の方法と比較して、ロボットの精度を**7.52%**向上させました。
  • 効率性: 小さなテストでは、古い方法はまともなスコアに達するのに 12 ラウンドのトレーニングを要しました。DEGround はわずか3 ラウンドではるかに高いスコアに達しました。これは、他の人が 1 ヶ月かけて習得する科目を、1 週間で習得する学生のようなものです。
  • 堅牢性: ロボットの視点を示す画像では、DEGround は周囲に多くの混乱を招く類似の物体があっても、正しい物体を正しく識別しました。一方、古い方法は混乱しました。

まとめ

DEGround は、ロボットが 3D 空間を理解するための新しい、整理された方法です。遅い 2 段階のプロセスを使用する代わりに、単一の共有システムを使用して、物体を見つけると同時に言語を理解します。これは「ハイライト」と「文脈的プリミング」を使用して、邪魔なものを無視し、人間が求めているものを正確に見つけることで、現実世界を移動し、相互作用する必要があるロボットにとって、新しい最先端技術となっています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →