← नवीनतम पेपर
💻 computer science

Grounded 3D-Aware Spatial Vision-Language Modeling

यह शोध पत्र GR3D को प्रस्तुत करता है, जो एक एकीकृत स्थानिक विजन-लैंग्वेज मॉडल है जो जटिल स्थानिक तर्क को ग्राउंडेड धारणा (grounded perception) और 3D अनुमान (3D inference) में विभाजित करने के लिए स्पष्ट 2D ग्राउंडिंग, अंतर्निहित 2D ग्राउंडिंग और मोनोक्यूलर 3D ग्राउंडिंग को एकीकृत करता है, जिससे सामान्य स्थानिक समझ क्षमताओं को महत्वपूर्ण रूप से बढ़ाया जा सकता है।

मूल लेखक: An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बिखरी हुई रसोई की तस्वीर देख रहे हैं। आप कंप्यूटर से पूछना चाहते हैं, "बाईं ओर वाली बोतल दाईं ओर वाली बोतल से कितनी दूर है?" या "दूर दिख रही इमारतों में से कौन सी इमारत अधिक ऊँची है?"

वर्तमान के अधिकांश AI मॉडल एक ऐसे व्यक्ति की तरह हैं जिसने रसोई के बारे में लाखों किताबें तो पढ़ी हैं, लेकिन वास्तव में कभी कोई रसोई देखी नहीं है। वे अपने प्रशिक्षण डेटा में मौजूद पैटर्न के आधार पर उत्तर का अनुमान लगा सकते हैं, लेकिन वे अक्सर दूरियों को गलत बताते हैं या ऐसी वस्तुओं की कल्पना कर लेते हैं जो वहां मौजूद ही नहीं हैं। उन्हें आपके द्वारा टाइप किए गए शब्दों को स्क्रीन पर मौजूद विशिष्ट पिक्सेल से जोड़ने में कठिनाई होती है, और उन्हें केवल एक सपाट तस्वीर देखकर यह समझने में मुश्किल होती है कि चीजें कितनी गहरी या कितनी दूर हैं।

यहाँ GR3D (ग्राउंडेड 3D-अवेयर स्पेशियल विजन-लैंग्वेज मॉडलिंग) आता है। GR3D को एक नए प्रकार के AI जासूस के रूप में सोचें जो केवल अनुमान नहीं लगाता; बल्कि वह भौतिक रूप से चीजों की ओर इशारा करता है, उन्हें मापता है, और फिर पहेली को सुलझाता है।

यह कैसे काम करता है, इसे तीन सरल सुपरपावर्स में विभाजित किया गया है:

1. "पॉइंट-एंड-क्लिक" जासूस (स्पष्ट 2D ग्राउंडिंग)

कल्पना कीजिए कि आप AI से पूछते हैं, "लाल कुर्सी कहाँ है?"
पुराने मॉडल शायद सिर्फ कहेंगे, "यह कमरे में है।"
GR3D अलग है। यह वास्तव में स्क्रीन पर लाल कुर्सी के चारों ओर एक बॉक्स बनाता है और कहता है, "मुझे यह यहीं मिली।" यह आपके शब्दों को छवि के एक विशिष्ट स्थान में बदल देता है। यह आधार है: कुछ भी मापने से पहले, इसे यह जानना होगा कि आप वास्तव में किस बारे में बात कर रहे हैं।

2. "सोचते हुए बोलने वाला" सहायक (इम्प्लिसिट ग्राउंडिंग)

यही इस शोध पत्र का सबसे बड़ा नवाचार है। कल्पना कीजिए कि आप एक जटिल प्रश्न पूछते हैं: "शेल्फ पर रखी दूसरी बोतल वॉशिंग मशीन पर रखे टेडी बियर से कितनी दूर है?"

एक सामान्य AI इस प्रश्न का उत्तर एक साथ देने की कोशिश करता है, जिससे वह अक्सर भ्रमित हो जाता है। GR3D "स्ट्रीमिंग रीजन इंसर्शन" नामक तकनीक का उपयोग करता है।
इसे एक जासूस की तरह समझें जो आपसे बात करते हुए अपराध को सुलझा रहा है।

  • चरण 1: AI कहता है, "पहले, मुझे वह 'शेल्फ पर रखी दूसरी बोतल' ढूँढने दें।" यह तुरंत बोतल को ढूँढ लेता है, उसके चारों ओर एक मानसिक बॉक्स बनाता है, और उस विशिष्ट बोतल का प्रतिनिधित्व करने वाला एक "टोकन" (एक डिजिटल टैग) अपनी स्वयं की विचार प्रक्रिया में डाल देता है।
  • चरण 2: इसके बाद यह कहता है, "अब, मुझे 'टेडी बियर' ढूँढने दें।" यह भालू को ढूँढता है, उसे टैग करता है, और उसे अपने विचारों में जोड़ देता है।
  • चरण 3: अब जब इसके पास दोनों वस्तुएं "टैग" की हुई हैं और इसके मन में दृश्यमान हैं, तो यह उनके बीच की दूरी की गणना करता है।

यह केवल उत्तर का अनुमान नहीं लगाता; यह कदम-दर-कदम उत्तर बनाता है, और बोलते समय लगातार दृश्य साक्ष्यों की जाँच करता रहता है। यह इसे तथ्य बनाने (हैलुसिनेशन) से रोकता है।

3. "3D विजन" अनुवादक (मोनोक्युलर 3D ग्राउंडिंग)

एक सपाट फोटो को देखना शहर के मानचित्र को देखने जैसा है; आप सड़कें तो देख सकते हैं, लेकिन बिना अतिरिक्त सुरागों के आप यह नहीं बता सकते कि इमारतें कितनी ऊँची हैं या वे कितनी दूर हैं। यह AI के लिए कठिन है क्योंकि दूर स्थित एक छोटा खिलौना कार, पास स्थित एक बड़ी असली कार के समान आकार का दिखाई दे सकता है।

GR3D इसे "रीजन-प्रॉम्प्टेड" दृष्टिकोण का उपयोग करके हल करता है।

  • एक बार जब AI ने 2D में वस्तु की पहचान कर ली हो (जैसे पिछले चरण में बोतल), तो वह उस 2D बॉक्स को 3D दुनिया से पूछने के लिए एक "क्वेरी" के रूप में उपयोग करता है।
  • यह "इंट्रिन्सिक नॉर्मलाइजेशन" नामक एक विशेष तकनीक का उपयोग करता है। कल्पना कीजिए कि AI को कैमरे की "फोकल लेंथ" (लेंस कितना ज़ूम किया गया है) का पता है। यह अपने मन में छवि को गणितीय रूप से "अन-ज़ूम" करने के लिए इसका उपयोग करता है, जिससे यह वस्तु के वास्तविक आकार और दूरी का अनुमान लगा पाता है।
  • इसके बाद यह एक 3D बॉक्स आउटपुट करता है जिसमें निर्देशांक (केंद्र, चौड़ाई, ऊँचाई, गहराई) होते हैं, ठीक वैसे ही जैसे कोई वीडियो गेम इंजन करता है।

यह एक बड़ी बात क्यों है?

शोध पत्र का दावा है कि इन तीन क्षमताओं को जोड़कर, GR3D अन्य मॉडलों की तुलना में स्थान (space) को समझने में बहुत बेहतर हो जाता है।

  • यह अधिक सटीक है: यह 3D ऑब्जेक्ट डिटेक्शन (3D स्पेस में चीजें कहाँ हैं) को मापने वाले परीक्षणों में अन्य मॉडलों से बेहतर प्रदर्शन करता है।
  • यह अधिक विश्वसनीय है: क्योंकि यह उत्तर देने से पहले चीजों की ओर "इशारा" करता है, इसलिए यह वस्तुओं के स्थान के बारे में कम गलतियाँ करता है।
  • यह एक जनरलिस्ट है: यह इनडोर दृश्यों (जैसे रसोई), आउटडोर दृश्यों (जैसे सड़कें), और यहाँ तक कि जटिल मल्टी-व्यू परिदृश्यों (अलग-अलग कोणों से एक दृश्य को देखना) पर भी काम करता है।

निष्कर्ष

GR3D को एक AI को 3D चश्मा और मापने वाला टेप देने जैसा समझें। कमरे के विवरण को केवल पढ़ने के बजाय, यह तस्वीर को देखना, आपके द्वारा बताई गई विशिष्ट वस्तुओं की ओर इशारा करना, उनके वास्तविक आकार और दूरी को मापना, और फिर उन तथ्यों के साथ आपके प्रश्नों का उत्तर देना सीखता है जिन्हें इसने याद नहीं किया बल्कि "देखा" है।

लेखकों ने कई अलग-अलग डेटासेट्स (जैसे Omni3D, जो 3D दृश्यों का एक विशाल संग्रह है) पर इसका परीक्षण किया और पाया कि GR3D लगातार अन्य शीर्ष AI मॉडलों को पछाड़ देता है, जो यह सिद्ध करता है कि "ग्राउंडिंग" (शब्दों को दृश्य वास्तविकता से जोड़ना) ही वह गुप्त सूत्र है जो AI को वास्तव में भौतिक दुनिया को समझने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →