← नवीनतम पेपर
💬 NLP

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

PruneGround एक प्लग-एंड-प्ले फ्रेमवर्क है जो 3D विजुअल ग्राउंडिंग के लिए, अप्रासंगिक स्थानिक क्षेत्रों को छाँटने के लिए एक फ्रोजन विजन लैंग्वेज मॉडल का उपयोग करके, मल्टी-व्यू रीजनिंग के माध्यम से विवरणों को पुनर्गठित करके, और कम किए गए खोज स्थान के भीतर सटीक स्थानीयकरण के लिए एक स्थानिक LLM का लाभ उठाकर सटीकता और दक्षता में सुधार करता है।

मूल लेखक: Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin

प्रकाशित 2026-07-01
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बिखरे हुए, भीड़भाड़ वाले लिविंग रूम में कदम रखते हैं और कोई आपसे पूछता है, "दरवाजे के पास वाली लाल कुर्सी ढूंढो।"

यदि आप इस समस्या को हल करने के लिए एक पारंपरिक कंप्यूटर प्रोग्राम होते, तो आप कमरे की हर एक वस्तु को एक साथ देखने की कोशिश करते। आप हर कुर्सी, हर मेज, हर लैंप और हर बुकशेल्फ़ की जांच करते, और प्रत्येक की तुलना आपके वाक्य से करते। एक अव्यवस्थित कमरे में, यह प्रक्रिया धीमी, भ्रमित करने वाली और अक्सर गलतियों का कारण बनती है क्योंकि वहां बहुत सारी "लाल कुर्सियाँ" या "दरवाजे" हो सकते हैं जिन्हें छांटना पड़ता है।

PruneGround एक नया तरीका है जो मानव मस्तिष्क की तरह काम करता है। सब कुछ देखने के बजाय, यह शोर-शराबे को अनदेखा करने और केवल उसी क्षेत्र पर ध्यान केंद्रित करने के लिए एक "स्मार्ट फिल्टर" का उपयोग करता है जो महत्वपूर्ण है।

यह कैसे काम करता है, इसे तीन सरल चरणों में नीचे दिया गया है:

1. "स्पॉटलाइट" (लैंग्वेज-गाइडेड स्पेशियल प्रूनिंग)

3D कमरे को एक विशाल, अंधेरे मंच की तरह समझें। जब आप कंप्यूटर को "लाल कुर्सी" जैसा वाक्य देते हैं, तो सिस्टम पूरे मंच को स्कैन नहीं करता है। इसके बजाय, यह एक फ्रोज़न विजन-लैंग्वेज मॉडल (एक सुपर-स्मार्ट AI जो देखता भी है और पढ़ता भी है) को स्पॉटलाइट की तरह उपयोग करता है।

यह AI अलग-अलग कोणों से कमरे को देखता है (जैसे कि एक सुरक्षा कैमरा) और पूछता है, "'लाल कुर्सी' और 'दरवाजा' शब्दों के आधार पर, सबसे संभावित स्थान कहाँ है?" यह केवल उसी क्षेत्र के चारों ओर एक बॉक्स बनाता है और बाकी सब कुछ को प्रून (छंटाई/काट) देता है। अचानक, कंप्यूटर अब 1,000 वस्तुओं को नहीं देख रहा है; वह केवल उस स्पॉटलाइट के अंदर की 10 वस्तुओं को देख रहा है। यह काम को बहुत तेज़ और कम भ्रमित करने वाला बना देता है।

2. "अनुवादक" (मल्टी-व्यू-कंडीशन्ड डिस्क्रिप्शन रीफॉर्मुलेशन)

कभी-कभी, मानवीय भाषा अस्पष्ट होती है। आप कह सकते हैं, "दरवाजे के पास वाली कुर्सी," लेकिन एक 3D कमरे में, दरवाजा देखना मुश्किल हो सकता है क्योंकि वह किसी दीवार से ढका हुआ है या दीवार जैसा दिखता है। कंप्यूटर भ्रमित हो सकता है।

PruneGround में दूसरा चरण है जहाँ यह एक सहायक अनुवादक की तरह काम करता है। यह स्पॉटलाइट वाले क्षेत्र को फिर से किनारे से देखता है। यदि मूल वाक्य में कोई सुराग गायब है (जैसे "कुर्सी नीले सोफे के पास भी है"), तो AI चित्र में मौजूद नीले सोफे को नोटिस करता है और उसमें विवरण जोड़ देता है

यह आपके बिखरे हुए वाक्य को एक स्पष्ट, संरचित निर्देश में फिर से लिखता है: "लाल कुर्सी ढूंढो। यह दरवाजे के पास है और नीले सोफे के बगल में भी है।" यह कंप्यूटर को सही वस्तु खोजने के लिए अधिक सुराग देता है, भले ही मूल वाक्य अधूरा क्यों न हो।

3. "डिटेक्टिव" (LLM-ग्राउंडर)

अब जब कंप्यूटर के पास एक छोटा, साफ क्षेत्र और एक सुपर-क्लियर निर्देश है, तो यह एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग करता है जिसे 3D आकृतियों को समझने के लिए प्रशिक्षित किया गया है।

इस LLM को एक ऐसे जासूस के रूप में सोचें जिसने लाखों कमरे देखे हैं। यह परिष्कृत सुरागों और छोटे क्षेत्र को लेता है, शब्दों को आकृतियों के साथ मिलाता है, और सीधे सही वस्तु की ओर इशारा करता है। क्योंकि यह केवल प्रासंगिक क्षेत्र को देख रहा है और इसके पास बेहतर सुराग हैं, इसलिए यह कमरे में अन्य कुर्सियों या मेजों से विचलित नहीं होता है।

यह एक बड़ी बात क्यों है?

पेपर का दावा है कि इन तीन चीजों को करके—शोर को हटाना, सुरागों को स्पष्ट करना, और एक स्मार्ट जासूस का उपयोग करना—PruneGround अपने काम में सर्वश्रेष्ठ है।

  • यह तीन प्रमुख परीक्षणों (ScanRefer, Nr3D, और Sr3D) पर सभी पिछले तरीकों को पछाड़ देता है।
  • यह विशेष रूप से उन अस्त-व्यस्त कमरों में बहुत अच्छा काम करता है जहाँ कई समान वस्तुएं (जैसे दस लाल कुर्सियां) होती हैं, क्योंकि यह जानता है कि आपके कहने का सटीक मतलब क्या है, क्योंकि यह उसके आस-पास के विशिष्ट परिवेश को देखता है।

संक्षेप में, PruneGround एक साथ पूरे पहेली को हल करने की कोशिश नहीं करता है। यह पहेली के सही कोने को ढूंढता है, निर्देशों को साफ करता है, और फिर उस छोटे से हिस्से को पूरी तरह से हल करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →