← नवीनतम पेपर
💻 computer science

DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework

DEGround एक होमोजेनियस, सिंगल-स्टेज फ्रेमवर्क पेश करता है जो साझा ऑब्जेक्ट क्वेरीज और ट्रांसफॉर्मर हेड्स के माध्यम से डिटेक्शन और ग्राउंडिंग को एकीकृत करके ईगो-सेंट्रिक 3D विजुअल ग्राउंडिंग को सुगम बनाता है, जिसे कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए विशेष प्लग-इन मॉड्यूल द्वारा संवर्धित किया गया है।

मूल लेखक: Yani Zhang, Dongming Wu, Hao Shi, Yingfei Liu, Tiancai Wang, Xingping Dong

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yani Zhang, Dongming Wu, Hao Shi, Yingfei Liu, Tiancai Wang, Xingping Dong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट हैं जो एक बिखरे हुए कमरे में चल रहे हैं, आपके हाथ में एक कैमरा और एक डेप्थ सेंसर (जैसे कि 3D स्कैनर) है। कोई व्यक्ति आपको एक मौखिक निर्देश देता है: "उस लाल तकिए को ढूँढो जो दरवाजे के सामने रखा है।" आपका काम उस विशिष्ट तकिए के चारों ओर एक डिजिटल बॉक्स बनाना है जिसे आप 3D दुनिया में देख रहे हैं। इस कार्य को एगो-सेंट्रिक 3D विजुअल ग्राउंडिंग (Ego-centric 3D Visual Grounding) कहा जाता है।

यह पेपर एक नया सिस्टम पेश करता है जिसे DEGround कहा जाता है ताकि इस समस्या को हल किया जा सके। यह कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:

समस्या: "दो-चरणों" का झंझट

इस पेपर से पहले, अधिकांश रोबोट वस्तुओं को खोजने के लिए एक भ्रामक, दो-चरणीय प्रक्रिया का उपयोग करते थे:

  1. चरण 1 (जासूस): पहले, रोबट को एक जासूस की तरह काम करना पड़ता था, पूरे कमरे को स्कैन करके उन सभी वस्तुओं (कुर्सियाँ, मेज, तकिए) को खोजना पड़ता था जिन्हें वह देख सकता है और उनके चारों ओर बॉक्स बनाना पड़ता था।
  2. चरण 2 (अनुवादक): फिर, उसे उन बॉक्सों की सूची लेनी पड़ती थी और यह समझने की कोशिश करनी पड़ती थी कि कौन सा बॉक्स वाक्य से मेल खाता है।

उपमा: कल्पना कीजिए कि आप एक पुस्तकालय में एक विशिष्ट पुस्तक खोजने की कोशिश कर रहे हैं। पुराना तरीका यह था कि पहले आप पुस्तकालय की हर एक पुस्तक का शीर्षक, लेखक और स्थान एक विशाल सूची में लिखते। फिर, आप उस सूची को फिर से पढ़ते ताकि उस एक पुस्तक को खोज सकें जिसे आप चाहते थे। यह धीमा, दोहराव वाला था और रोबोट अक्सर चरण एक में सीखी गई बातों को चरण दो शुरू करते समय भूल जाता था।

समाधान: DEGround (एक "ऑल-इन-वन" मस्तिष्क)

लेखकों ने DEGround बनाया है, जो दोनों काम एक साथ करने वाले एक एकल, कुशल मस्तिष्क की तरह कार्य करता है।

1. "साझा क्वेरी" (The Shared Query - एक सामान्य भाषा)
दो अलग-अलग प्रणालियों के होने के बजाय जो आपस में बात नहीं करतीं, DEGround वस्तुओं का प्रतिनिधित्व करने के लिए "क्वेरीज़" (सोचिए ये डिजिटल स्टिकी नोट्स हैं) के एक एकल सेट का उपयोग करता है।

  • यह कैसे काम करता है: रोबोट उन वस्तुओं पर ये स्टिकी नोट्स लगाता है जिन्हें वह देखता है। इन नोट्स का उपयोग एक साथ यह कहने के लिए किया जाता है कि "यह एक तकिया है" (डिटेक्शन) और "यह वही तकिया है जिसके बारे में इंसान ने पूछा है" (ग्राउंडिंग)।
  • लाभ: क्योंकि रोबोट दोनों कार्यों के लिए एक ही नोट्स का उपयोग करता है, इसलिए उसे वस्तुओं को खोजने के लिए दोबारा सीखने की आवश्यकता नहीं होती है। यह अपने "ज्ञान" को तुरंत स्थानांतरित करता है, जिससे यह बहुत तेज़ और अधिक सटीक हो जाता है।

2. "रीजनल एक्टिवेशन" मॉड्यूल (The Regional Activation Module - हाइलाइटर)
कभी-कभी कमरे में दो एक जैसी दिखने वाली तकिए हो सकती हैं। एक दरवाजे के पास है (जो आपको चाहिए), और एक खिड़की के पास (जो भ्रमित करने वाला है)।

  • उपमा: कल्पना कीजिए कि रोबोट के पास एक जादुई हाइलाइटर है। जब वह "दरवाजे के सामने" सुनता है, तो हाइलाइटर स्वचालित रूप से दरवाजे के पास के क्षेत्र पर चमकीला लाल रंग बिखेर देता है और बाकी कमरे को धुंधला कर देता है।
  • परिणाम: यह रोबोट को गलत तकिए को अनदेखा करने और केवल उस क्षेत्र पर ध्यान केंद्रित करने में मदद करता है जो विवरण से मेल खाता है।

3. "क्वेरी-वाइज मॉड्यूलेशन" मॉड्यूल (The Query-wise Modulation Module - संदर्भ स्विच)
यह मॉड्यूल रोबोट को वाक्य के इरादे को शुरुआत से ही समझने में मदद करता है।

  • उपमा: कमरे को देखने से पहले ही, रोबोट अपने स्टिकी नोट्स को वाक्य के आधार पर "प्राइम" (तैयार) करता है। यदि वाक्य "तकिए" के बारे में है, तो उसके नोट्स नरम, स्पंजी आकृतियों के प्रति अतिरिक्त संवेदनशील हो जाते हैं। यदि वाक्य "लैंप" के बारे में है, तो वे प्रकाश और धातु के प्रति संवेदनशील हो जाते हैं।
  • परिणाम: रोबोट खोज शुरू करने से पहले ही जानता है कि उसे क्या ढूंढना है, बजाय इसके कि वह केवल अनुमान लगाए।

परिणाम: यह क्यों मायने रखता है

लेखकों ने इस प्रणाली का परीक्षण EmbodiedScan नामक एक विशाल बेंचमार्क पर किया, जो 3D कमरों और हजारों वस्तुओं वाला एक बहुत बड़ा, कठिन परीक्षण है।

  • गति और सटीकता: DEGround ने न केवल जीत हासिल की; बल्कि इसने प्रतियोगिता को पछाड़ दिया। इसने पिछले सबसे अच्छे तरीके की तुलना में रोबोट की सटीकता में 7.52% का सुधार किया।
  • दक्षता: एक छोटे परीक्षण में, पुराने तरीके को एक अच्छा स्कोर प्राप्त करने के लिए 12 राउंड के प्रशिक्षण की आवश्यकता थी। DEGround ने केवल 3 राउंड में बहुत अधिक स्कोर प्राप्त कर लिया। यह एक ऐसे छात्र की तरह है जो उस विषय को एक सप्ताह में सीख लेता है जिसे सीखने में दूसरों को एक महीना लगता है।
  • मजबूती (Robustness): चित्रों में, जहाँ रोबोट का दृश्य दिखाया गया था, DEGround ने सही वस्तु की पहचान तब भी सही ढंग से की जब पास में कई भ्रमित करने वाली, एक जैसी दिखने वाली वस्तुएं मौजूद थीं, जबकि पुराने तरीके भ्रमित हो गए थे।

सारांश

DEGround 3D स्थानों को समझने का एक नया, सुव्यवस्थित तरीका है। दो-चरणीय प्रक्रिया का उपयोग करने के बजाय, यह वस्तुओं को खोजने और भाषा को एक साथ समझने के लिए एक एकल, साझा प्रणाली का उपयोग करता है। यह विकर्षणों को अनदेखा करने और ठीक वही खोजने के लिए जो इंसान पूछ रहा है, "हाइलाइटिंग" और "संदर्भिक प्राइमिंग" का उपयोग करता है, जो इसे उन रोबोटों के लिए नया स्टेट-ऑफ-द-आर्ट बनाता है जिन्हें वास्तविक दुनिया में नेविगेट करने और बातचीत करने की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →