Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models
Mind-VLA एक निर्देश-जागरूक स्थानिक प्रतिनिधित्व संरेखण विधि है जो विजन-लैंग्वेज-एक्शन मॉडलों को विशेष रूप से भाषा निर्देशों द्वारा पहचाने गए लक्षित वस्तुओं की 3D ज्यामिति के साथ लेटेंट रिप्रजेंटेशन को संरेखित करके उन्नत करती है, जिससे सूक्ष्म हेरफेर और बाधित लक्ष्य कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से दोहराव के उस्ताद रहे हैं, जो बिना किसी त्रुटि के एक ही सटीक गति को हजारों बार करने में सक्षम हैं। फिर भी, जब उन्हें एक बिखरे हुए कमरे में नेविगेट करने या समान वस्तुओं के ढेर में से किसी विशिष्ट वस्तु को उठाने के लिए कहा जाता है, तो वे अक्सर लड़खड़ा जाते हैं। चुनौती केवल दुनिया को देखने में नहीं है, बल्कि उस विशिष्ट वस्तु के त्रि-आयामी (3D) आकार और स्थिति को समझने में है जिसे छूने के लिए किसी इंसान ने उनसे कहा है। आधुनिक रोबोट तेजी से विजन-लैंग्वेज-एक्शन (Vision-Language-Action) मॉडल द्वारा निर्देशित हो रहे हैं, जो ऐसी प्रणालियाँ हैं जो एक दृश्य दृश्य (visual scene) और एक बोले गए आदेश को लेती हैं, और फिर एक भौतिक गति का निर्णय लेती हैं। हालांकि ये प्रणालियाँ सामान्य कार्यों में उल्लेखनीय रूप से अच्छी हो गई हैं, लेकिन वे अक्सर तब संघर्ष करती हैं जब लक्षित वस्तु आंशिक रूप से छिपी होती है या जब रोबोट को दो लगभग एक जैसी वस्तुओं के बीच अंतर करना होता है। मूल कठिनाई यह है कि ये मॉडल पूरे दृश्य को सूचना के एक एकल, समान ब्लॉक के रूप में मानने की प्रवृत्ति रखते हैं, बजाय इसके कि वे उस विशिष्ट वस्तु पर अपना ज्यामितीय बोध केंद्रित करें जिसका मानव ने उल्लेख किया है।
माइंड-वीएलए (Mind-VLA) नामक एक नया दृष्टिकोण इस सीमा को संबोधित करता है, जो रोबोट को कमांड में नामित विशिष्ट वस्तु पर ध्यान देने के लिए सिखाता है। पूरे कमरे के 3D ज्यामिति को मैप करने के बजाय, यह प्रणाली भाषा निर्देश में वर्णित लक्षित वस्तु को अलग करने और केवल उसी वस्तु का एक विस्तृत मानसिक मॉडल बनाने के लिए सीखती है। यह विधि रोबोट को यह समझने की अनुमति देती है कि आलू का आकार और स्थिति क्या है, भले ही वह एक समान दिखने वाले सेब के बगल में रखा हो, या कपड़े से आंशिक रूप से ढके हुए केले को पकड़ सके। पूरे दृश्य से ध्यान हटाकर विशिष्ट लक्ष्य पर केंद्रित करने से, रोबोट को कहाँ पहुँचना है और वस्तु को कैसे पकड़ना है, इसका अधिक सटीक बोध होता है, जिससे जटिल, वास्तविक दुनिया की स्थितियों में अधिक विश्वसनीय प्रदर्शन मिलता है।
इस कार्य के पीछे के शोधकर्ताओं ने पहचाना कि वर्तमान 3D-सचेत रोबोटों को प्रशिक्षित करने के तरीके में एक मौलिक दोष है। मौजूदा विधियाँ अक्सर रोबोट की आंतरिक समझ को पूरे दृश्य की ज्यामिति के साथ संरेखित करती हैं, चाहे मानव कुछ भी कह रहा हो। यदि कोई व्यक्ति कहता है, "आलू उठाओ," तो रोबोट के प्रशिक्षण डेटा में उसे आलू के साथ-साथ मेज, पृष्ठभूमि की दीवार और काउंटर पर रखे अन्य फलों की 3D संरचना को भी एनकोड करने के लिए मजबूर किया जा सकता है। यह एक धुंधले संकेत (muddy signal) का निर्माण करता है जहाँ सबसे महत्वपूर्ण जानकारी—स्वयं आलू का आकार—आस-पास के वातावरण के शोर में खो जाती है। यह समस्या तब महत्वपूर्ण हो जाती है जब लक्षित वस्तु आंशिक रूप से ढकी हुई (occluded) होती है, या दृष्टि से छिपी होती है, क्योंकि रोबोट को उस विशिष्ट वस्तु की 3D संरचना को संरक्षित करने के लिए स्पष्ट रूप से प्रशिक्षित नहीं किया गया है जिसकी उसे हेरफेर करने की आवश्यकता है।
इसे हल करने के लिए, टीम ने एक प्रशिक्षण प्रक्रिया विकसित की जो एक स्पॉटलाइट की तरह कार्य करती है, जो केवल रुचि की वस्तु को प्रकाशित करती है। जब रोबोट को एक कमांड प्राप्त होता है, तो सिस्टम पहले भाषा को पार्स (parse) करके लक्षित वस्तु और उसके इच्छित इंटरेक्शन के क्रम की पहचान करता है। इसके बाद यह उस विशिष्ट वस्तु के सेट या मानक (canonical) दृश्यों का निर्माण करता है, जो प्रभावी रूप से अकेले उस वस्तु का एक स्वच्छ, 3D ब्लूप्रिंट बनाता है। प्रशिक्षण चरण के दौरान, रोबोट को इन अलग किए गए दृश्यों को दिखाया जाता है और इसे दृश्य के बाकी हिस्से को अनदेखा करते हुए, लक्ष्य की ज्यामिति के साथ अपनी आंतरिक समझ को संरेखित करने के लिए कहा जाता है। इस प्रक्रिया में दो मुख्य चरण शामिल हैं: वस्तु की दृश्य उपस्थिति से उसके छिपे हुए 3D ढांचे की भविष्यवाणी करना और रोबोट के मध्यवर्ती प्रसंस्करण स्तरों (intermediate processing layers) को उस विशिष्ट वस्तु की विस्तृत ज्यामितिक विशेषताओं के साथ संरेखित करना। महत्वपूर्ण रूप से, यह अतिरिक्त प्रशिक्षण पर्यवेक्षण (training supervision) केवल तभी उपयोग किया जाता है जब रोबोट सीख रहा होता है; एक बार प्रशिक्षण पूरा हो जाने के बाद, रोबोट बिल्कुल वैसे ही काम करता है जैसे वह पहले करता था, बिना किसी अतिरिक्त 3D सेंसर या जटिल प्रसंस्करण के।
इस दृष्टिकोण के परिणामों का परीक्षण सिम्युलेटेड वातावरण और वास्तविक भौतिक रोबोट दोनों में किया गया। रोबोटिक मैनिपुलेशन का परीक्षण करने के लिए डिज़ाइन किए गए मानक बेंचमार्क की एक श्रृंखला में, इस नई विधि ने 94.4 प्रतिशत की सफलता दर हासिल की, जिसने समान अंतर्निहित आर्किटेक्चर का उपयोग करने वाले पिछले मॉडलों को पछाड़ दिया। सुधार विशेष रूप से सूक्ष्म भेदभाव (fine-grained discrimination) वाले कार्यों में देखा गया, जहाँ रोबोट को समान वस्तुओं के बीच चयन करना था। CALVIN बेंचमार्क में, जो एक रोबोट की लगातार पांच अलग-अलग कार्यों को पूरा करने की क्षमता का परीक्षण करता है, इस प्रणाली ने औसतन 4.47 कार्य पूरे किए, जो पिछले सर्वश्रेष्ठ मॉडल की तुलना में एक मामूली लेकिन सार्थक सुधार है। ये संख्याएँ बताती हैं कि पूरे दृश्य के बजाय विशिष्ट लक्ष्य पर ध्यान केंद्रित करके, रोबोट अधिक सटीक हो जाता है और भ्रमित होने की संभावना कम हो जाती है।
हालाँकि, इस पद्धति का असली परीक्षण तब आया जब शोधकर्ताओं ने रोबोट को एक वास्तविक दुनिया के परिदृश्य में रखा जहाँ लक्षित वस्तु आंशिक रूप से छिपी हुई थी। उन्होंने एक ड्यूल-आर्म रोबोट स्थापित किया और उसे आलू और केले जैसी चीजें उठाने और रखने के लिए कहा, जिसमें कभी-कभी लक्ष्य का लगभग 25 प्रतिशत हिस्सा एक अवरोधक (occluder) से ढका हुआ था। इन चुनौतीपूर्ण स्थितियों में, नया सिस्टम 54 प्रतिशत समय सफल रहा। यह एक नियंत्रण संस्करण (control version) की तुलना में एक महत्वपूर्ण छलांग थी, जिसमें उसी रोबोट का उपयोग किया गया था जो पारंपरिक, दृश्य-व्यापी दृष्टिकोण का उपयोग करता था, जो केवल 28 प्रतिशत बार सफल हुआ। 26 प्रतिशत अंकों का यह अंतर निर्देश-जागरूक स्थानिक समझ (instruction-aware spatial understanding) के मूल्य को रेखांकित करता है; जब लक्ष्य आंशिक रूप से बाधित होता है, तो वह रोबोट जो जानता है कि वास्तव में क्या देखना है, अभी भी उसके आकार और स्थिति का अनुमान लगा सकता है, जबकि पूरे दृश्य को देखने वाला रोबोट अक्सर लक्ष्य के लापता हिस्सों को पुनर्गठित करने में विफल रहता है।
संख्याओं से परे, अध्ययन ने खुलासा किया कि रोबोट वास्तव में विशिष्ट वस्तु की ज्यामिति का प्रतिनिधित्व करना सीख रहा था। जब शोधकर्ताओं ने मॉडल के आंतरिक स्तरों का विश्लेषण किया, तो उन्होंने पाया कि सिस्टम ने पिछले मॉडलों की तुलना में लक्ष्य के आकार के बारे में बहुत अधिक विस्तृत जानकारी एनकोड की थी। इसके अलावा, रोबोट भाषा निर्देश के आधार पर सही वस्तु को विश्वसनीय रूप से पुनः प्राप्त कर सका, जिससे सिद्ध हुआ कि उसका आंतरिक मानचित्र सीधे सुनी गई बातों से जुड़ा हुआ था। यह सुझाव देता है कि रोबोट केवल पैटर्न को याद नहीं कर रहा है, बल्कि वह 3D स्थान के साथ भाषा के संबंध की एक लचीली समझ विकसित कर रहा है। मशीन को उसके महत्वपूर्ण वस्तु पर अपनी ज्यामितीय एकाग्रता केंद्रित करना सिखाकर, शोधकर्ताओं ने उन रोबोटों को बनाने की दिशा में एक कदम बढ़ाया है जो मानवीय वातावरण की अव्यवस्थित, बिखरी हुई और अक्सर छिपी हुई वास्तविकताओं को अधिक आत्मविश्वास और कौशल के साथ संभाल सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।