Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding
Qwen-3D एक नवीन ज्यामिति-जागरूक (geometry-aware) लार्ज मल्टीमॉडल मॉडल है जो छवियों और वीडियो में स्थानिक तर्क (spatial reasoning), संदर्भ संबंधी ग्राउंडिंग (referential grounding) और इंस्टेंस सेगमेंटेशन को एकीकृत करने के लिए 3D रोटरी पोजीशनल एम्बेडिंग्स और एक क्वेरी-आधारित सेगमेंटेशन डिकोडर का लाभ उठाता है, जो भाषा और सघन 3D ज्यामितीय भविष्यवाणियों के बीच के अंतर को प्रभावी ढंग से पाटते हुए मौजूदा विशेषज्ञ और प्रोप्रायटरी मॉडलों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को दुनिया को देखना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, ये रोबोट एक कैमरे वाले पर्यटकों की तरह थे: वे एक कमरे की तस्वीर ले सकते थे और आपको बता सकते थे, "यह एक कुर्सी है," या "वहाँ तीन लोग हैं।" यह काम सपाट तस्वीरों या छोटी वीडियो क्लिप्स के लिए बहुत अच्छा काम करता है। लेकिन यदि आप रोबोट को पूरे घर में घूमने के लिए कहें, रसोई से, गलियारे से और बेडरूम से उसी कुर्सी को देखने के लिए कहें, और फिर आपको बता दे कि वह कुर्सी 3D स्पेस में वास्तव में कहाँ है, तो चीजें गड़बड़ा जाती हैं। रोबोट भ्रमित हो जाता है क्योंकि वह हजारों अलग-अलग 2D तस्वीरों को आपस में जोड़ने की कोशिश कर रहा है, जो कि हजारों सपाट पोस्टकार्डों को चिपकाकर एक घर बनाने की कोशिश करने जैसा है। यह धीमा है, इसमें बहुत अधिक मानसिक शक्ति खर्च होती है, और यह अक्सर वास्तविक दुनिया में चीजों के स्थान को लेकर ट्रैक खो देता है।
यही "3D विजन-लैंग्वेज मॉडल्स" की चुनौती है। वैज्ञानिक ऐसा AI बनाना चाहते हैं जो न केवल वस्तुओं को पहचानता हो बल्कि उनके आकार, स्थान और एक 3D वातावरण में अन्य चीजों के साथ उनके संबंध को भी समझता हो, और साथ ही मानवीय निर्देशों को सुनता हो। बड़ा सवाल यह है कि हम एक ऐसा AI कैसे बना सकते हैं जो एक कमरे को हर कोण से देख सके, लेआउट को याद रख सके, और डेटा के समुद्र में खोए बिना सही वस्तु की ओर इशारा कर सके? यदि हम इसे हल कर सकते हैं, तो रोबोट अंततः हमारे घरों में नेविगेट कर सकेंगे, हमारी खोई हुई चाबियाँ खोजने में मदद कर सकेंगे, या यहाँ तक कि जटिल निर्माण कार्यों में सहायता कर सकेंगे, जिससे वे केवल "देखने" से आगे बढ़कर परिवेश को वास्तव में "समझने" की ओर बढ़ सकेंगे।
यहाँ आता है Qwen-3D, एक नए प्रकार का AI जिसे कार्नेगी मेलन यूनिवर्सिटी के शोधकर्ताओं द्वारा विकसित किया गया है, जो इन डिजिटल दुनियाओं के लिए एक मास्टर आर्किटेक्ट की तरह कार्य करता है। हर वीडियो फ्रेम को एक अलग, सपाट तस्वीर के रूप में मानने के बजाय, Qwen-3D कुछ चतुर करता है: यह उन सभी अलग-अलग दृश्यों को लेता है और उन्हें एक एकल, निरंतर 3D मानचित्र में "पिघला" देता है। कल्पना कीजिए कि यदि आप एक मूर्ति के कई कोणों से फोटो ले सकें और तुरंत उन्हें अपने मन में एक ठोस, घूमती हुई मूर्ति में मिला सकें। यह मॉडल विजुअल डेटा के साथ यही करता है। यह एक लंबे, घुमावदार वीडियो स्ट्रीम को एक संक्षिप्त, 3D प्रतिनिधित्व में कंप्रेस करने के लिए गहराई की जानकारी (चीजें कितनी दूर हैं) और कैमरा स्थितियों का उपयोग करता है। यह AI को एक समय में एक फ्रेम देखने में फंसने के बजाय, पूरे दृश्य के बारे में तर्क करने में सक्षम बनाता है।
पेपर का तर्क है कि पिछले प्रयासों ने AI 3D कौशल सिखाने में एक बड़ी बाधा उत्पन्न की थी। पुराने मॉडल 3D स्थानों का वर्णन करने के लिए उन्हें टेक्स्ट के रूप में लिखने (जैसे "कुर्सी 1.2, 0.8, 0.9 निर्देशांकों पर है") या पहले से बनी सूची में से चुनने की कोशिश करते थे। लेखक सुझाव देते हैं कि ये तरीके एक जटिल पेंटिंग का वर्णन केवल इमोजी के सीमित सेट का उपयोग करके करने या यह अनुमान लगाने जैसा है कि कौन सा प्री-प्रिंटेड स्टिकर सबसे उपयुक्त है। यह संवाद करने का एक अजीब और अक्षम तरीका है। Qwen-3D इसे AI के "मस्तिष्क" (इसके भाषा तर्क) को सीधे एक "हाथ" (एक सेगमेंटेशन डिकोडर) से जोड़कर ठीक करता है जो 3D दृश्य के विशिष्ट हिस्सों की ओर इशारा कर सकता है। निर्देशांकों का अनुमान लगाने के बजाय, यह उस वस्तु के सटीक आकार को हाइलाइट करना सीखता है जिसके बारे में उपयोगकर्ता बात कर रहा है, चाहे वह बिस्तर पर रखा तकिया हो या सड़क के दृश्य में ट्रैफिक लाइट।
परिणाम काफी प्रभावशाली हैं। विभिन्न बेंचमार्क पर परीक्षण किए जाने पर, Qwen-3D ने मौजूदा 3D AI मॉडल्स को पीछे छोड़ दिया और यहाँ तक कि 3D स्थानों को समझने में कई बड़े, प्रोप्राइटरी 2D मॉडल्स को भी मात दी। विशेष रूप रूप से, शोधकर्ताओं ने पाया कि Qwen-3D ने पिछले सर्वोत्तम तरीकों की तुलना में 3D विजुअल ग्राउंडिंग (विवरण के आधार पर वस्तुओं को खोजना) में 4% सुधार किया और 3D इंस्टेंस सेगमेंटेशन (दृश्य से व्यक्तिगत वस्तुओं को अलग करना) को 13% बढ़ाया। उल्लेखनीय रूप से, इसने यह सब मानक 2D छवियों और वीडियो को समझने की अपनी क्षमता को खोए बिना किया, जो यह साबित करता है कि आप मॉडल को 2D देखने से भुलाए बिना 3D में देखना सिखा सकते हैं।
हालाँकि, लेखक सावधानीपूर्वक यह नोट करते हैं कि यह अभी भी हर स्थिति के लिए जादुई समाधान नहीं है। मॉडल वर्तमान में यह मान लेता है कि दुनिया ज्यादातर स्थिर है; यह गतिशील वातावरण में संघर्ष करता है जहाँ वस्तुएं तेजी से चलती या बदलती हैं, जैसे कि कारों के तेजी से गुजरने वाली व्यस्त सड़क। यह गहराई और कैमरा स्थितियों का अनुमान लगाने के लिए बाहरी उपकरणों पर भी निर्भर करता है, जिसका अर्थ है कि यदि वे प्रारंभिक माप गलत हैं, तो AI की समझ थोड़ी गलत हो सकती है। जबकि यह भाषा और 3D धारणा के बीच के अंतर को पाटने की दिशा में एक महत्वपूर्ण कदम है, शोधकर्ताओं का सुझाव है कि भविष्य के कार्यों को इन चलते-फिरते लक्ष्यों को संबोधित करने की आवश्यकता होगी और शायद स्वयं ज्यामिति का अनुमान लगाना सीखना होगा। फिलहाल, Qwen-3D एक शक्तिशाली नया उपकरण है जो बताता है कि बेहतर 3D AI के लिए कुंजी केवल बेहतर डेटा नहीं है, बल्कि यह एक स्मार्ट तरीका है कि AI जो देखता है उसे वह कैसे बोलता है, उससे कैसे जोड़ा जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।