← नवीनतम पेपर
💻 computer science

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Qwen-3D एक नवीन ज्यामिति-जागरूक (geometry-aware) लार्ज मल्टीमॉडल मॉडल है जो छवियों और वीडियो में स्थानिक तर्क (spatial reasoning), संदर्भ संबंधी ग्राउंडिंग (referential grounding) और इंस्टेंस सेगमेंटेशन को एकीकृत करने के लिए 3D रोटरी पोजीशनल एम्बेडिंग्स और एक क्वेरी-आधारित सेगमेंटेशन डिकोडर का लाभ उठाता है, जो भाषा और सघन 3D ज्यामितीय भविष्यवाणियों के बीच के अंतर को प्रभावी ढंग से पाटते हुए मौजूदा विशेषज्ञ और प्रोप्रायटरी मॉडलों से बेहतर प्रदर्शन करता है।

मूल लेखक: Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

प्रकाशित 2026-08-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को देखना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, ये रोबोट एक कैमरे वाले पर्यटकों की तरह थे: वे एक कमरे की तस्वीर ले सकते थे और आपको बता सकते थे, "यह एक कुर्सी है," या "वहाँ तीन लोग हैं।" यह काम सपाट तस्वीरों या छोटी वीडियो क्लिप्स के लिए बहुत अच्छा काम करता है। लेकिन यदि आप रोबोट को पूरे घर में घूमने के लिए कहें, रसोई से, गलियारे से और बेडरूम से उसी कुर्सी को देखने के लिए कहें, और फिर आपको बता दे कि वह कुर्सी 3D स्पेस में वास्तव में कहाँ है, तो चीजें गड़बड़ा जाती हैं। रोबोट भ्रमित हो जाता है क्योंकि वह हजारों अलग-अलग 2D तस्वीरों को आपस में जोड़ने की कोशिश कर रहा है, जो कि हजारों सपाट पोस्टकार्डों को चिपकाकर एक घर बनाने की कोशिश करने जैसा है। यह धीमा है, इसमें बहुत अधिक मानसिक शक्ति खर्च होती है, और यह अक्सर वास्तविक दुनिया में चीजों के स्थान को लेकर ट्रैक खो देता है।

यही "3D विजन-लैंग्वेज मॉडल्स" की चुनौती है। वैज्ञानिक ऐसा AI बनाना चाहते हैं जो न केवल वस्तुओं को पहचानता हो बल्कि उनके आकार, स्थान और एक 3D वातावरण में अन्य चीजों के साथ उनके संबंध को भी समझता हो, और साथ ही मानवीय निर्देशों को सुनता हो। बड़ा सवाल यह है कि हम एक ऐसा AI कैसे बना सकते हैं जो एक कमरे को हर कोण से देख सके, लेआउट को याद रख सके, और डेटा के समुद्र में खोए बिना सही वस्तु की ओर इशारा कर सके? यदि हम इसे हल कर सकते हैं, तो रोबोट अंततः हमारे घरों में नेविगेट कर सकेंगे, हमारी खोई हुई चाबियाँ खोजने में मदद कर सकेंगे, या यहाँ तक कि जटिल निर्माण कार्यों में सहायता कर सकेंगे, जिससे वे केवल "देखने" से आगे बढ़कर परिवेश को वास्तव में "समझने" की ओर बढ़ सकेंगे।

यहाँ आता है Qwen-3D, एक नए प्रकार का AI जिसे कार्नेगी मेलन यूनिवर्सिटी के शोधकर्ताओं द्वारा विकसित किया गया है, जो इन डिजिटल दुनियाओं के लिए एक मास्टर आर्किटेक्ट की तरह कार्य करता है। हर वीडियो फ्रेम को एक अलग, सपाट तस्वीर के रूप में मानने के बजाय, Qwen-3D कुछ चतुर करता है: यह उन सभी अलग-अलग दृश्यों को लेता है और उन्हें एक एकल, निरंतर 3D मानचित्र में "पिघला" देता है। कल्पना कीजिए कि यदि आप एक मूर्ति के कई कोणों से फोटो ले सकें और तुरंत उन्हें अपने मन में एक ठोस, घूमती हुई मूर्ति में मिला सकें। यह मॉडल विजुअल डेटा के साथ यही करता है। यह एक लंबे, घुमावदार वीडियो स्ट्रीम को एक संक्षिप्त, 3D प्रतिनिधित्व में कंप्रेस करने के लिए गहराई की जानकारी (चीजें कितनी दूर हैं) और कैमरा स्थितियों का उपयोग करता है। यह AI को एक समय में एक फ्रेम देखने में फंसने के बजाय, पूरे दृश्य के बारे में तर्क करने में सक्षम बनाता है।

पेपर का तर्क है कि पिछले प्रयासों ने AI 3D कौशल सिखाने में एक बड़ी बाधा उत्पन्न की थी। पुराने मॉडल 3D स्थानों का वर्णन करने के लिए उन्हें टेक्स्ट के रूप में लिखने (जैसे "कुर्सी 1.2, 0.8, 0.9 निर्देशांकों पर है") या पहले से बनी सूची में से चुनने की कोशिश करते थे। लेखक सुझाव देते हैं कि ये तरीके एक जटिल पेंटिंग का वर्णन केवल इमोजी के सीमित सेट का उपयोग करके करने या यह अनुमान लगाने जैसा है कि कौन सा प्री-प्रिंटेड स्टिकर सबसे उपयुक्त है। यह संवाद करने का एक अजीब और अक्षम तरीका है। Qwen-3D इसे AI के "मस्तिष्क" (इसके भाषा तर्क) को सीधे एक "हाथ" (एक सेगमेंटेशन डिकोडर) से जोड़कर ठीक करता है जो 3D दृश्य के विशिष्ट हिस्सों की ओर इशारा कर सकता है। निर्देशांकों का अनुमान लगाने के बजाय, यह उस वस्तु के सटीक आकार को हाइलाइट करना सीखता है जिसके बारे में उपयोगकर्ता बात कर रहा है, चाहे वह बिस्तर पर रखा तकिया हो या सड़क के दृश्य में ट्रैफिक लाइट।

परिणाम काफी प्रभावशाली हैं। विभिन्न बेंचमार्क पर परीक्षण किए जाने पर, Qwen-3D ने मौजूदा 3D AI मॉडल्स को पीछे छोड़ दिया और यहाँ तक कि 3D स्थानों को समझने में कई बड़े, प्रोप्राइटरी 2D मॉडल्स को भी मात दी। विशेष रूप रूप से, शोधकर्ताओं ने पाया कि Qwen-3D ने पिछले सर्वोत्तम तरीकों की तुलना में 3D विजुअल ग्राउंडिंग (विवरण के आधार पर वस्तुओं को खोजना) में 4% सुधार किया और 3D इंस्टेंस सेगमेंटेशन (दृश्य से व्यक्तिगत वस्तुओं को अलग करना) को 13% बढ़ाया। उल्लेखनीय रूप से, इसने यह सब मानक 2D छवियों और वीडियो को समझने की अपनी क्षमता को खोए बिना किया, जो यह साबित करता है कि आप मॉडल को 2D देखने से भुलाए बिना 3D में देखना सिखा सकते हैं।

हालाँकि, लेखक सावधानीपूर्वक यह नोट करते हैं कि यह अभी भी हर स्थिति के लिए जादुई समाधान नहीं है। मॉडल वर्तमान में यह मान लेता है कि दुनिया ज्यादातर स्थिर है; यह गतिशील वातावरण में संघर्ष करता है जहाँ वस्तुएं तेजी से चलती या बदलती हैं, जैसे कि कारों के तेजी से गुजरने वाली व्यस्त सड़क। यह गहराई और कैमरा स्थितियों का अनुमान लगाने के लिए बाहरी उपकरणों पर भी निर्भर करता है, जिसका अर्थ है कि यदि वे प्रारंभिक माप गलत हैं, तो AI की समझ थोड़ी गलत हो सकती है। जबकि यह भाषा और 3D धारणा के बीच के अंतर को पाटने की दिशा में एक महत्वपूर्ण कदम है, शोधकर्ताओं का सुझाव है कि भविष्य के कार्यों को इन चलते-फिरते लक्ष्यों को संबोधित करने की आवश्यकता होगी और शायद स्वयं ज्यामिति का अनुमान लगाना सीखना होगा। फिलहाल, Qwen-3D एक शक्तिशाली नया उपकरण है जो बताता है कि बेहतर 3D AI के लिए कुंजी केवल बेहतर डेटा नहीं है, बल्कि यह एक स्मार्ट तरीका है कि AI जो देखता है उसे वह कैसे बोलता है, उससे कैसे जोड़ा जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →