← नवीनतम पेपर
💻 computer science

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

TDVR एक प्रशिक्षण-मुक्त (training-free), ज़ीरो-शॉट 3D विज़ुअल ग्राउंडिंग फ्रेमवर्क है जो अस्पष्ट प्रश्नों और अपर्याप्त दृष्टिकोणों को संभालने में मौजूदा विधियों से काफी बेहतर प्रदर्शन करते हुए, LLM-संचालित टेक्स्ट विसंकेतन (disambiguation) और चेन-ऑफ-थॉट रीजनिंग का लाभ उठाकर इष्टतम दृष्टिकोणों का अनुमान लगाने और समान वस्तुओं के बीच अंतर करने के लिए ScanRefer डेटासेट पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

प्रकाशित 2026-08-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट हैं जो एक बिखरे हुए कमरे में किसी विशिष्ट वस्तु को खोजने की कोशिश कर रहे हैं, लेकिन आप कमरे को केवल एक कोण से देख सकते हैं, और कोई वॉकी-टॉकी के माध्यम से आपको निर्देश चिल्लाकर दे रहा है। यह 3D विजुअल ग्राउंडिंग (3D Visual Grounding) की दुनिया है, जहाँ कंप्यूटर शब्दों को वास्तविक 3D वस्तुओं से जोड़ने का प्रयास करते हैं। यह "आई स्पाई" (I Spy) के एक उच्च-दांव वाले खेल की तरह है, लेकिन एक सपाट तस्वीर के बजाय, आप लाखों छोटे बिंदुओं (जिन्हें पॉइंट क्लाउड कहा जाता है) से बने एक पूर्ण, त्रि-आयामी स्थान में नेविगेट कर रहे हैं। पेचीदा हिस्सा यह है कि भाषा अव्यवस्थित होती है। यदि कोई कहता है, "बाईं ओर की कुर्सी ढूँढो," तो यह निर्देश तब तक बेकार है जब तक कि आपको यह पता न हो कि वे वास्तव में कहाँ खड़े हैं। यदि वे मुड़ जाते हैं, तो "बाईं" ओर की कुर्सी "दाईं" ओर की कुर्सी बन जाती है। इसके अलावा, यदि कमरा एक जैसी दिखने वाली कई कुर्सियों से भरा है, तो यह पता लगाना कि उनका मतलब किस कुर्सी से है, एक दुःस्वप्न बन जाता है। इस समस्या को हल करना उन रोबोटों के लिए अत्यंत महत्वपूर्ण है जिन्हें हमारे घरों में हमारी मदद करने या हमारी कारें चलाने की आवश्यकता होती है, क्योंकि उन्हें न केवल यह समझने की आवश्यकता है कि चीजें क्या हैं, बल्कि हमारे सापेक्ष वे कहाँ हैं।

यहाँ TDVR आता है, एक नया "ट्रेनिंग-फ्री" फ्रेमवर्क (जिसका अर्थ है कि इसे सीखने के लिए लाखों उदाहरणों की आवश्यकता नहीं है) जो इन 3D पहेलियों के लिए एक सुपर-स्मार्ट जासूस की तरह कार्य करता है। शोधकर्ताओं ने पाया कि पिछले तरीके अक्सर इसलिए भटक जाते थे क्योंकि वे वक्ता के दृष्टिकोण को ध्यान में नहीं रखते थे या समान दिखने वाली वस्तुओं से भ्रमित हो जाते थे। TDVR इसे पहले एक अनुवादक के रूप में हल करता है। यह एक अस्पष्ट, भ्रमित करने वाले वाक्य को लेता है और उसे एक सुपर-स्पष्ट, संरचित विवरण में फिर से लिख देता है, जिसमें रंगों, बनावट और एक-दूसरे के सापेक्ष वस्तुओं के सटीक स्थान के बारे में विवरण जोड़ा जाता है। इसे एक धुंधले, फुसफुसाते हुए सुराग को एक हाई-डेफिनिशन मानचित्र में बदलने के रूप में समझें।

एक बार जब सुराग स्पष्ट हो जाता है, तो TDVR "क्या होगा अगर?" का खेल खेलता है। यह अपने मन में पूरे 3D कमरे को घुमाता है, विभिन्न कोणों का परीक्षण करता है ताकि यह देखा जा सके कि कौन सा दृष्टिकोण विवरण को दृश्य के साथ पूरी तरह से मेल खाता है। यह एक जासूस की तरह ग्लोब को घुमाकर उस सटीक स्थान को खोजने जैसा है जहाँ संदिग्ध का अपराध स्थल का विवरण मानचित्र के साथ मेल खाता है। यदि पाँच एक जैसी लाल कुर्सियाँ हैं, तो TDVR केवल अनुमान नहीं लगाता; यह यह पता लगाने के लिए एक विशेष "सिमिलैरिटी डिकपलिंग" (similarity decoupling) ट्रिक का उपयोग करता है कि कौन सी विशिष्ट कुर्सी "टेबल के बाईं ओर" के विवरण पर सबसे अच्छी तरह फिट बैठती है, भले ही वे सभी एक जैसी दिखती हों।

परिणाम प्रभावशाली हैं। स्कैनरेफर (ScanRefer) नामक एक मानक परीक्षण पर, TDVR ने मौजूदा सर्वोत्तम तरीकों को एक बड़े अंतर से पीछे छोड़ दिया, सटीकता में 15.25% और 14.46% तक सुधार किया, यह इस पर निर्भर करता है कि परीक्षण कितना सख्त था। इसने कुछ ऐसे सिस्टमों को भी मात दी जो भारी मात्रा में डेटा पर प्रशिक्षित थे, यह साबित करते हुए कि स्मार्ट तर्क कभी-कभी ब्रूट-फोर्स लर्निंग (brute-force learning) को हरा सकता है। लेखक दिखाते हैं कि टेक्स्ट डिसएम्बिग्यूएशन (शब्दों को स्पष्ट करना) को व्यू पॉइंट रीजनिंग (दृष्टिकोण तर्क) के साथ जोड़कर, रोबोट अंततः एक भीड़भाड़ वाली, भ्रमित करने वाली दुनिया में बिना किसी इंसान के हाथ थामे सही वस्तु को खोज सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →