← नवीनतम पेपर
💻 computer science

Unlocking Dense Metric Depth Estimation in VLMs

यह शोध पत्र DepthVLM को प्रस्तुत करता है, जो एक ढांचा (framework) है जो एक हल्के डेप्थ हेड और एकीकृत प्रशिक्षण के माध्यम से एक एकल विजन-लैंग्वेज मॉडल को एक नेटिव, कुशल डेंस मेट्रिक डेप्थ प्रेडिक्टर में बदल देता है, जो मल्टीमॉडल क्षमताओं को बनाए रखते हुए 3D ज्यामिति रिकवरी और स्थानिक तर्क (spatial reasoning) दोनों में मौजूदा मॉडलों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Hanxun Yu, Xuan Qu, Yuxin Wang, Jianke Zhu, Lei ke

प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanxun Yu, Xuan Qu, Yuxin Wang, Jianke Zhu, Lei ke

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक (एक विजन-लैंग्वेज मॉडल, या VLM) है जो किसी तस्वीर को देखकर उसके बारे में कहानी बताने या "कार का रंग क्या है?" या "क्या कुत्ता खुश है?" जैसे सवालों के जवाब देने में माहिर है।

हालाँकि, इस रोबोट की एक कमी है, वह गहराई (depth) को नहीं समझ पाता। वह एक सपाट तस्वीर देखता है, न कि एक 3D दुनिया। वह आपको सटीक रूप से यह नहीं बता सकता कि एक कुर्सी कितनी मीटर दूर है, या एक पेड़ इमारत के सामने है या नहीं।

यह शोध पत्र एक नया सिस्टम पेश करता है जिसे DepthVLM कहा जाता है, जो रोबोट की बातचीत करने और छवियों को समझने की क्षमता को बिगाड़े बिना इस कमी को दूर करता है। यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "केवल टेक्स्ट वाला" रोबोट

अधिकांश वर्तमान स्मार्ट रोबोट ऐसे प्रशिक्षित होते हैं जैसे वे छात्र हों जो केवल किताबें पढ़कर सीखते हैं। वे एक छवि देखते हैं, लेकिन वे केवल टेक्स्ट में "बोलते" हैं।

  • समस्या: यदि आप उनसे पूछते हैं, "वह कप कितनी दूर है?", तो उन्हें अनुमान लगाना पड़ता है और एक वाक्य लिखना पड़ता है। वे वास्तव में छवि के हर एक पिक्सेल के लिए दूरी की गणना नहीं करते हैं।
  • पुराना समाधान: पिछले प्रयासों ने एक अलग "डेप्थ कैलकुलेटर" को रोबोट के साथ जोड़ने की कोशिश की। लेकिन यह एक अलग, अनाड़ी इंटर्न को गणित करने के लिए काम पर रखने जैसा था। मुख्य रोबोट छवि को इंटर्न को भेजता था, जो गलतियाँ करता था, और फिर उत्तर वापस भेजता था। गलतियाँ बढ़ती जाती थीं, और यह बहुत धीमा था।

2. समाधान: रोबोट को "गहराई का अहसास" देना

लेखकों, हान्सुन यू (Hanxun Yu) और उनकी टीम ने एक सरल प्रश्न पूछा: क्या हम रोबोट को सीधे गहराई देखना सिखा सकते हैं, उसी मस्तिष्क का उपयोग करके जिसका उपयोग वह बात करने के लिए करता है?

उन्होंने रोबोट के मौजूदा मस्तिष्क में एक छोटा, हल्का "डेप्थ हेड" (एक विशेष उपकरण) जोड़कर DepthVLM बनाया।

  • उपमा: कल्पना कीजिए कि रोबोट का मस्तिष्क एक मास्टर शेफ है जो पहले से ही खाना बनाने (छवियों को समझने) और बात करने (टेक्स्ट जेनरेट करने) में माहिर है। एक अलग सहायक शेफ को सामग्री मापने के लिए रखने के बजाय, उन्होंने बस उस मास्टर शेफ को एक नया, हाई-टेक मापने वाला टेप दे दिया। अब, शेफ सब्जियां काट भी सकता है और उन्हें एक ही समय में माप भी सकता है, बिना धीमे हुए।

3. यह कैसे काम करता है: दो-चरणीय प्रशिक्षण

आप एक मास्टर शेफ को सिर्फ एक नया टूल देकर यह उम्मीद नहीं कर सकते कि वह तुरंत उसका सही उपयोग करेगा। यह पेपर एक दो-चरणीय प्रशिक्षण रणनीति (two-stage training strategy) का उपयोग करता है:

  • चरण 1 (अभ्यास/ड्रिल): उन्होंने शेफ के मस्तिष्क को फ्रीज (freeze) कर दिया (ताकि वे खाना बनाना न भूलें) और केवल नए मापने वाले टेप को प्रशिक्षित किया। इसने रोबोट को यह सिखाया कि अपनी मौजूदा जानकारी को खराब किए बिना दूरियों का अनुमान कैसे लगाया जाए।
  • चरण 2 (अभ्यास): उन्होंने मस्तिष्क को अनफ्रीज (unfreeze) कर दिया और रोबोट को बात करते वक्त मापने वाले टेप का उपयोग करने का अभ्यास करने दिया। इससे रोबोट को "गहराई देखने" और "दृश्य को समझने" को सहजता से मिलाने में मदद मिली।

4. जादुई ट्रिक: एक ही बार में, तुरंत परिणाम

पिछले तरीके अविश्वसनीय रूप से धीमे थे।

  • पुराना तरीका (DepthLM): पूरे कमरे की दूरी मापने के लिए, पुराने रोबोट को पूछना पड़ता था, "पिक्सेल 1 कितनी दूर है?" फिर "पिक्सेल 2 कितनी दूर है?" और यह सिलसिला पिक्सेल 100,000 तक चलता रहता था। इसमें घंटों लग जाते थे (कुछ परीक्षणों में 13 घंटे!)।
  • नया तरीका (DepthVLM): नया रोबलेट पूरी तस्वीर को एक बार देखता है और तुरंत आधे सेकंड से भी कम समय (0.42 सेकंड) में कमरे का एक पूर्ण, विस्तृत 3D मैप निकाल देता है। यह समुद्र तट पर रेत के हर कण को एक-एक करके गिनने से लेकर पूरे समुद्र तट की एक सिंगल फोटो लेने जैसा है।

5. परिणाम: विशेषज्ञों से बेहतर

टीम ने विभिन्न प्रकार के दृश्यों (इनडोर कमरे, बाहरी सड़कें, ड्राइविंग दृश्य) पर DepthVLM का परीक्षण किया।

  • चैटबॉट्स को पछाड़ना: इसने दूरियों का अनुमान लगाने में अन्य स्मार्ट रोबोट्स (जैसे GPT-5.5) को बुरी तरह हरा दिया। जहाँ अन्य रोबोट बेतरतीब ढंग से अनुमान लगा रहे थे, वहीं DepthVLM सटीक था।
  • विशेषज्ञों को पछाड़ना: आश्चर्यजनक रूप से, यह "ऑल-इन-वन" रोबोट केवल गहराई मापने के लिए बनाए गए रोबोट्स (विशेषज्ञ विजन मॉडल) की तुलना में भी गहराई मापने में बेहतर था।
  • व्यक्तित्व बनाए रखना: महत्वपूर्ण रूप से, इस गहराई के अहसास को जोड़ने से रोबोट अन्य कार्यों में "मूर्ख" नहीं हुआ। वह पहले की तरह ही कविताएँ लिख सकता था, सवालों के जवाब दे सकता था और जटिल दृश्यों को समझ सकता था।

6. यह क्यों मायने रखता है (पेपर के अनुसार)

पेपर का दावा है कि यह एक यूनिफाइड फाउंडेशन मॉडल (Unified Foundation Model) की ओर एक कदम है।

  • उपमा: एक स्विस आर्मी नाइफ (Swiss Army Knife) की कल्पना करें। पहले, आपके पास काटने के लिए एक अलग टूल, पेंच कसने के लिए एक अलग टूल और मापने के लिए एक अलग टूल था। वे सभी अलग-अलग थे। DepthVLM एक ऐसा एकल टूल है जो एक साथ तीनों काम पूरी तरह से कर सकता है।
  • लाभ: यह रोबोट्स को न केवल 3D दुनिया को "देखने" बल्कि उसके बारे में "तर्क (reasoning)" करने की अनुमति देता है। उदाहरण के लिए, यह एक फोटो देख सकता है और कह सकता है, "कूड़ेदान सिंक से अधिक करीब है," या "वॉशिंग मशीन लगभग 1 मीटर ऊँची है," और वह भी एक ही बार में।

सारांश:
यह पेपर एक तरीका प्रस्तुत करता है जिससे एक मानक "चैटिंग रोबोट" को उसके मस्तिष्क में एक छोटा, कुशल डेप्थ सेंसर जोड़कर एक "3D-जागरूक रोबोट" में बदला जा सकता है। यह बिना किसी दूसरे रोबोट की मदद लिए और बिना बात करना भूले, दुनिया को 3D में तुरंत मापना सीखता है। यह पहले आए किसी भी मॉडल की तुलना में तेज़, अधिक सटीक और अधिक बहुमुखी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →