GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model
GaussVLA एक पैरामीटर-कुशल, Mamba-आधारित विजन-लैंग्वेज-एक्शन मॉडल है जो 2D फीचर्स को कॉम्पैक्ट 3D गॉसियन टोकन में बदलने के लिए एक गॉसियन स्पेशियल टोकेनाइज़र और संरचित ज्यामितीय तर्क के लिए एक डेप्थ-अवेयर चेन-ऑफ-थॉट मॉड्यूल पेश करके स्थानिक तर्क (spatial reasoning) को बढ़ाता है, जिससे केवल 200M पैरामीटर्स के साथ LIBERO बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट जो मनुष्यों को देखकर वस्तुओं को नियंत्रित करना सीख सकते हैं, आधुनिक आर्टिफिशियल इंटेलिजेंस का एक केंद्रीय लक्ष्य बन गए हैं। वर्षों से, शोधकर्ता उन मॉडलों पर निर्भर रहे हैं जो कैमरे के दुनिया के दृश्य को रंगीन वर्गों के एक सपाट ग्रिड के रूप में देखते हैं, बिल्कुल एक डिजिटल फोटोग्राफ की तरह। ये मॉडल यह पहचानने में उत्कृष्ट हैं कि कौन सी वस्तुएं मौजूद हैं और भाषाई कमांड को समझने में, लेकिन वे त्रि-आयामी (थ्री-डी) स्थान में उन वस्तुओं के भौतिक आकार और स्थिति को समझने में संघर्ष करते हैं। वे एक कप को पिक्सेल के एक पैटर्न के रूप में देखते हैं, न कि एक ठोस वस्तु के रूप में जो मेज पर एक विशिष्ट ऊंचाई और अभिविन्यास (ओरिएंटेशन) के साथ रखी है। यह सीमा रोबोट के लिए उन कार्यों को करने में कठिनाई पैदा करती है जिनमें सटीक हैंडलिंग की आवश्यकता होती है, जैसे कि किसी नाजुक वस्तु को उठाना या अव्यवस्थित कार्यक्षेत्र में नेविगेट करना, क्योंकि रोबिम के पास ज्यामिति (जियोमेट्री) की वास्तविक समझ नहीं होती है।
इस अंतर को पाटने के लिए, शोधकर्ताओं की एक टीम ने 'गॉसवीएलए' (GaussVLA) नामक एक नई प्रणाली विकसित की है, जिसे रोबोट को भौतिक दुनिया की अधिक सहज समझ देने के लिए डिज़ाइन किया गया है। सपाट छवियों पर निर्भर रहने के बजाय, यह प्रणाली दृश्य डेटा को अंतरिक्ष में तैरते हुए छोटे, त्रि-आयामी आकारों के एक संग्रह में बदल देती है, जिसमें से प्रत्येक के पास यह जानकारी होती है कि कोई वस्तु कहाँ है, वह कितनी बड़ी है, और उस जानकारी के बारे में रोबोट कितना आश्वस्त है। इस ज्यामितिक समझ को गति देने से पहले स्थानिक समस्याओं के माध्यम से "सोचने" के एक नए तरीके के साथ जोड़कर, शोधकर्ताओं ने एक ऐसा रोबोट कंट्रोलर बनाया है जो अत्यधिक सटीक और आश्चर्यजनक रूप से छोटा है। परीक्षणों में, इस प्रणाली ने बहुत बड़े और अधिक जटिल मॉडलों को पीछे छोड़ दिया, जो यह सुझाव देता है कि रोबोट को केवल उसका मस्तिष्क बड़ा बनाने के बजाय उसे स्थान की बेहतर समझ देना अधिक महत्वपूर्ण है।
समस्या का मूल कारण यह है कि वर्तमान में रोबोट कैसे "देखते" हैं। पारंपरिक प्रणालियाँ कैमरा इमेज को फ्लैट पैच की एक लंबी सूची में तोड़ देती हैं, और हर हिस्से को समान रूप से महत्वपूर्ण मानती हैं, चाहे वह दूर की दीवार हो या रोबोट के ठीक सामने रखा कोई उपकरण। हालांकि यह सरल कार्यों के लिए काम करता है, लेकिन यह तब विफल हो जाता है जब रोबोट को दूरियों या सतह के कोण का आकलन करने की आवश्यकता होती है। इसे ठीक करने के अन्य प्रयासों में 'डेप्थ मैप्स' (गहराई के मानचित्र) को शामिल करना शामिल था, जो अनिवार्य रूप से एक संख्या होती है जो रोबोट को बताती है कि प्रत्येक पिक्सेल कितनी दूर है। हालाँकि, इन डेप्थ मैप्स में अक्सर सतह के ओरिएंटेशन या उस दूरी के माप की विश्वसनीयता के बारे में जानकारी की कमी होती है, जिससे वातावरण बदलने पर रोबोट अनुमान लगाने लगता है।
शोधकर्ताओं ने 'गॉसियन स्पेशियल टोकेनाइज़र' (Gaussian Spatial Tokenizer) नामक दृश्य डेटा को संसाधित करने के एक नए तरीके को पेश करके इस समस्या का समाधान किया। कल्पना कीजिए कि एक सपाट छवि को लेकर उसके प्रत्येक पैच को हवा में ऊपर उठाने और उसे एक छोटे, धुंधले 3D क्लाउड (बादल) में बदलने की, जो अंतरिक्ष में तैर रहा है। इन बादलों में से प्रत्येक का एक केंद्र बिंदु, एक आकार और एक आकृति होती है जो उस वस्तु की स्थानीय ज्यामिति का वर्णन करती है जिसका वह प्रतिनिधित्व करता है। महत्वपूर्ण रूप से, सिस्टम प्रत्येक क्लाउड को एक 'कॉन्फिडेंस स्कोर' (विश्वास स्कोर) भी प्रदान करता है, जो रोबोट को बताता है कि वह 3D दुनिया के उस हिस्से के बारे में कितना आश्वस्त है। यह रोबोट को दृश्य के सबसे विश्वसनीय हिस्सों, जैसे कि मेज के किनारे या कप के हैंडल पर ध्यान केंद्रित करने की अनुमति देता है, जबकि अनिश्चित क्षेत्रों को अनदेखा कर देता है। यह रूपांतरण एक सपाट चित्र को एक संरचित, त्रि-आ dimensional मानचित्र में बदल देता है जिसके बारे में रोबोट तर्क कर सकता है।
एक बार जब रोबोट के पास यह 3D मैप होता है, तो उसे अभी भी यह तय करने की आवश्यकता होती है कि क्या करना है। पिछली प्रणालियाँ अक्सर चलने से पहले टेक्स्ट-आधारित विचारों की एक लंबी सूची उत्पन्न करके एक योजना बनाने की कोशिश करती थीं, जो एक धीमी प्रक्रिया है और अक्सर वास्तविक भौतिक क्रिया से कटी हुई होती है। नया सिस्टम 'डेप्थ-अवेयर चेन-ऑफ-थॉट' (Depth-Aware Chain-of-Thought) नामक एक अलग दृष्टिकोण का उपयोग करता है। एक लंबी कहानी लिखने के बजाय, रोबोट अपने 3D मैप को जल्दी से स्कैन करने और कार्य के लिए आवश्यक सबसे महत्वपूर्ण स्थानिक संबंधों को निकालने के लिए प्रश्नों के एक छोटे सेट का उपयोग करता है। यह स्वयं से पूछता है, उदाहरण के लिए, रोबोट के हाथ के सापेक्ष लक्ष्य वस्तु कहाँ है, और उस उत्तर का उपयोग अपनी गति को सीधे निर्देशित करने के लिए करता है। यह विधि केवल एक धीमी, चरण-दर-चरण टेक्स्ट जनरेशन नहीं है, बल्कि एक तेज़, संरचित तर्क प्रक्रिया है जो रोबोट के चलने के निर्णय के साथ तालमेल बिठाकर होती है।
संपूर्ण प्रणाली 'मैम्बा' (Mamba) नामक एक बैकबोन आर्किटेक्चर पर आधारित है, जिसे आज के अधिकांश आर्टिफिशियल इंटेलिजेंस में उपयोग किए जाने वाले मानक मॉडलों की तुलना में बहुत तेज़ी से और अधिक कुशलता से जानकारी को संसाधित करने के लिए डिज़ाइन किया गया है। यह दक्षता महत्वपूर्ण है क्योंकि यह रोबोट को एक विशाल कंप्यूटर की आवश्यकता के बिना रीयल-टाइम में निर्णय लेने की अनुमति देती है। शोधकर्ताओं ने वस्तुओं को हिलाने, ब्लॉक को स्टैक करने और जटिल निर्देशों का पालन करने सहित विभिन्न सिम्युलेटेड कार्यों पर अपने सिस्टम का परीक्षण किया। इन परीक्षणों में, इस नई प्रणाली ने एक मानक बेंचमार्क पर 93.5 प्रतिशत की सफलता दर हासिल की, जिसने काफी बड़े मॉडलों को पीछे छोड़ दिया। स्थानिक तर्क (स्पेशियल रीजनिंग) के परीक्षण के लिए डिज़ाइन किए गए विशिष्ट कार्यों के सेट पर, इसने 100 प्रतिशत का पूर्ण स्कोर प्राप्त किया।
इन परिणामों को जो बात विशेष रूप से उल्लेखनीय बनाती है, वह है इस सिस्टम का आकार। जबकि कई प्रतिस्पर्धी मॉडल कार्य करने के लिए अरबों पैरामीटर्स की आवश्यकता रखते हैं, यह नया सिस्टम केवल 200 मिलियन पैरामीटर्स के साथ काम करता है। इसका अर्थ है कि यह वर्तमान में उपयोग किए जा जाने वाले कुछ सबसे बड़े मॉडलों की तुलना में लगभग 97 प्रतिशत छोटा है, फिर भी यह भौतिक स्थान को समझने वाले कार्यों पर बेहतर प्रदर्शन करता है। शोधकर्ताओं ने एक भौतिक प्रयोगशाला में एक वास्तविक रोबोट आर्म पर भी सिस्टम का परीक्षण किया। वास्तविक दुनिया की चुनौतियों, जैसे कैमरा शोर और वस्तुओं के थोड़े अलग प्लेसमेंट का सामना करने के बावजूद, सिस्टम ने सफलता का उच्च स्तर बनाए रखा, जिससे यह सिद्ध हुआ कि सिमुलेशन में सीखा गया 3D ज्यामितीय ज्ञान वास्तविक दुनिया में स्थानांतरित हो सकता है।
अध्ययन ने यह भी पता लगाया कि क्या होता है जब सिस्टम को अलग-अलग लाइटिंग या वस्तुओं के रंगों जैसे अप्रत्याशित परिवर्तनों के साथ चुनौती दी जाती है। हालांकि सिस्टम ने मजबूत मजबूती (रोबस्टनेस) दिखाई, शोधकर्ताओं ने नोट किया कि जब वातावरण में भारी बदलाव होता है तो यह अभी भी कठिनाइयों का सामना करता है, जो यह दर्शाता है कि रोबोट को हर संभावित वास्तविक दुनिया के परिदृश्य के अनुकूल बनाने के लिए अभी भी काम किया जाना बाकी है। हालाँकि, परिणाम स्पष्ट रूप से प्रदर्शित करते हैं कि बेहतर रोबोट मैनिपुलेशन की कुंजी केवल अधिक डेटा या एक बड़े मॉडल में नहीं है, बल्कि रोबोट को उस स्थान की एक संरचित, त्रि-आयामी समझ देने में है जिसमें वह मौजूद है। सपाट छवियों को 3D बादलों में बदलकर और उन्हें नेविगेट करने के लिए केंद्रित तर्क का उपयोग करके, शोधकर्ताओं ने उन रोबोटों की ओर एक स्पष्ट मार्ग दिखाया है जो अधिक कौशल और विश्वसनीयता के साथ भौतिक दुनिया को संभाल सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।