StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models
StellaVLA एक विजन-लैंग्वेज-एक्शन मॉडल्स के लिए टेस्ट-टाइम अडैप्टेशन फ्रेमवर्क है जो आउट-ऑफ-डिस्ट्रीब्यूशन परिदृश्यों और एम्बॉडीमेंट्स में सामान्यीकरण को बढ़ाने के लिए इन-कॉन्टेक्स्ट गाइडेंस के रूप में शून्य-लागत, स्ट्रक्चर्ड प्रदर्शनों (जैसे कि टास्क प्लान और वर्बलाइज्ड 3D मोशन) का लाभ उठाता है, जो बिना किसी इन्फरेंस लेटेंसी के प्रमुख बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। आप उसे अपना हाथ चलाने का वीडियो दिखा सकते हैं, और रोबोट आपके हाथ की गतिविधियों की हुबहू नकल करने की कोशिश कर सकता है। लेकिन क्या होगा यदि रोबोट किसी अलग रसोई में हो, ब्रेड दाईं के बजाय बाईं ओर रखी हो, या रोबोट का हाथ अलग तरह का हो? अचानक, रोबोट भ्रमित हो जाता है और ब्रेड गिरा देता है। यह रोबोटिक्स की दुनिया में एक बड़ी समस्या है, विशेष रूप से एक प्रकार के स्मार्ट सिस्टम के लिए जिसे विज़न-लैंग्वेज-एक्शन (VLA) मॉडल कहा जाता है। ये एक सुपर-स्मार्ट रोबोट की तरह हैं जो एक तस्वीर देख सकते हैं, "कप उठाओ" जैसा कमांड पढ़ सकते हैं, और फिर अपने हाथ को हिलाकर "कार्य" कर सकते हैं। समस्या यह है कि वे अक्सर उन छात्रों की तरह होते हैं जिन्होंने एक विशिष्ट परीक्षा को रट लिया है लेकिन थोड़े अलग सवाल आने पर असफल हो जाते हैं। वे संघर्ष करते हैं जब दृश्य बदल जाता है, कोई नई वस्तु दिखाई देती है, या कैमरा एंगल बदल जाता है। इसे ठीक करने के लिए, वैज्ञानिकों को आमतौर पर हजारों नए वीडियो एकत्र करने पड़ते हैं और रोबोट को फिर से प्रशिक्षित करना पड़ता है, जिसमें बहुत समय लगता है।
लेकिन क्या होगा यदि रोबोट केवल किसी दूसरे व्यक्ति द्वारा कार्य करने के एक एकल उदाहरण को देखकर तुरंत समझ जाए कि वह ऐसा क्यों कर रहा था, न कि केवल यह कि वह क्या कर रहा था? यही वह बड़ा सवाल है जिसे यह शोध पत्र संबोधित करता है। केवल हाथ की गति के कच्चे वीडियो दिखाने के बजाय, शोधकर्ता चाहते हैं कि रोबлот को एक "संदर्भ मार्गदर्शिका" (रेफरेंस गाइड) दी जाए जो उन गतिविधियों के पीछे के तर्क को समझा सके। वे चाहते हैं कि रोबोट योजना (जैसे "पहले हैंडल पकड़ें") सीखे, न कि केवल पिक्सेल (जैसे "हाथ को समन्वय X, Y, Z पर ले जाएं")। यदि वे ऐसा कर सकते हैं, तो रोबोट बिना किसी पूर्ण रीबूट के नए, अजीब स्थितियों को संभाल सकता है।
यहाँ स्टेलावीएलए (StellaVLA) आता है, जो StellarEdge AI टेक्निकल टीम का एक नया फ्रेमवर्क है जो ठीक इसी समस्या को हल करने का प्रयास करता है। स्टेलावीएलए को एक ऐसे रोबोट के रूप में सोचें जो केवल एक फिल्म नहीं देखता; बल्कि वह फिल्म देखते समय निर्देशक की कमेंट्री भी पढ़ता है।
यह कैसे काम करता है: टीम ने एक ऐसा सिस्टम बनाया है जो रोबोट या इंसान द्वारा किए गए कार्य के एक अव्यवस्थित, कच्चे वीडियो को स्वचालित रूप से एक संरचित प्रदर्शन (स्ट्रक्चर्ड डेमोंस्ट्रेशन) में बदल देता है। कल्पना कीजिए कि किसी लंबे, भ्रमित करने वाले वीडियो को जिसमें कोई व्यक्ति लेगो कैसल बना रहा है, उसे एक स्पष्ट, चरण-दर-चरण निर्देश पुस्तिका में बदलना। सिस्टम कार्य को "उप-लक्ष्यों" (जैसे "लाल ईंट खोजें") में तोड़ देता है और गतिविधियों को सरल भाषा में वर्णित करता है (जैसे "हाथ को ऊपर और दाईं ओर ले जाएं")। यह बिना किसी इंसान के नोट्स लिखे, स्वचालित रूप से होता है, जिसमें एक शक्तिशाली एआई वीडियो को "पढ़ने" और उसकी कहानी लिखने का काम करता है।
एक बार जब ये "कहानी-आधारित" उदाहरण तैयार हो जाते हैं, तो उन्हें एक लाइब्रेरी में स्टोर किया जाता है। जब रोबोट के सामने कोई नया कार्य आता है, तो वह केवल अनुमान नहीं लगाता। वह इस लाइब्रेरी की खोज करता है, सबसे सटीक मेल खाने वाली कहानी ढूंढता है, और उसे एक मार्गदर्शक के रूप में उपयोग करता है। लेकिन यहाँ चालाकी भरी बात यह है: रोबोट को एक विशेष तरीके से प्रशिक्षित किया गया है। अपने "स्कूली शिक्षा" के दौरान, उसे दो चीजें एक साथ करनी होती हैं: उसे अपने हाथ को कैसे हिलाना है (एक्शन) यह सीखना होता है और उसे गतिविधियों को शब्दों में कैसे समझाना है (रीजनिंग) यह भी सीखना होता है। यह एक ऐसे छात्र की तरह है जिसे पूरे अंक पाने के लिए गणित का सवाल भी हल करना है और उसके चरणों को लिखना भी है। यह रोबोट को केवल गति की नकल करने के बजाय कार्य के तर्क को समझने के लिए मजबूर करता है।
हालाँकि, यह शोध पत्र वास्तविक दुनिया में इसके काम करने के तरीके के बारे में एक बहुत ही महत्वपूर्ण अंतर बताता है। जबकि रोबोट प्रशिक्षण के दौरान खुद से बात करके सीखता है, जब वह वास्तव में काम करने जाता है (इन्फरेंस), तो वह बोलना बंद कर देता है। उसके मस्तिष्क का "व्याख्या करने वाला" हिस्सा बंद कर दिया जाता है, और केवल "हिलाने वाला" हिस्सा सक्रिय रहता है। क्यों? क्योंकि बोलने में समय लगता है, और रोबोटों को तेजी से काम करने की आवश्यकता होती है। वास्तविक कार्य के दौरान बातचीत को बंद करके, रोबोट अत्यंत तेज और प्रतिक्रियाशील बना रहता है, लेकिन वह उस गहरे ज्ञान का लाभ उठाता है जो उसने पढ़ाई के दौरान सीखा था।
इस दृष्टिकोण के परिणाम काफी आशाजनक हैं, कम से कम उन परीक्षणों में जो शोधकर्ताओं ने चलाए। LIBERO नामक सिमुलेशन की एक श्रृंखला में, रोबोट ने 98.8% की सफलता दर हासिल की, जो बहुत अधिक है। जब उन्होंने VLA-Arena नामक एक कठिन लीडरबोर्ड पर परीक्षण किया, जिसमें नई वस्तुएं या भ्रमित करने वाले बैकग्राउंड जैसी कठिन स्थितियां शामिल हैं, तो स्टेलावीएलए ने कुल मिलाकर 0.63 स्कोर किया। इसने अन्य मजबूत मॉडलों को पछाड़ दिया, जिन्होंने लगभग 0.44 और 0.22 स्कोर किया था। यहाँ तक कि जब रोबोट को अजीब रोशनी, अलग कैमरा एंगल, या ऐसी वस्तुओं (जैसे कि जब गाजर का रंग अलग हो तो उसे कटोरे में डालना) के साथ निपटना पड़ा जिन्हें उसने पहले कभी नहीं देखा था, तब भी इसने LIBERO-Plus नामक मजबूती परीक्षण में 85.1% स्कोर के साथ अपने प्रतिस्पर्धियों से बेहतर प्रदर्शन किया।
शोधकर्ताओं ने वास्तविक दुनिया में एक वास्तविक रोबोटिक आर्म पर भी इसका परीक्षण किया। उन्होंने पाया कि रोबोट मानव, अन्य रोबोट, या यहाँ तक कि वर्चुअल रियलिटी (XR) सिमुलेशन के प्रदर्शनों का उपयोग अपने मार्गदर्शक के रूप में कर सकता है। इससे कोई फर्क नहीं पड़ता कि "शिक्षक" कैसा दिखता था; जब तक कार्य की "कहानी" स्पष्ट थी, रोबोट उसका पालन कर सकता था। उदाहरण के लिए, जब उसे एक ऐसे दराज में ब्लॉक रखने के लिए कहा गया जिसे उसने पहले कभी नहीं देखा था, तो वह केवल विफल नहीं हुआ; बल्कि उसने प्रगति की, और 4 में से औसतन 1.9 का स्कोर प्राप्त किया, जिससे पता चलता है कि वह योजना का पालन करने की कोशिश कर रहा था भले ही वह काम को पूरी तरह से समाप्त न कर सका हो।
हालाँकि, शोध पत्र इस बात को लेकर सावधान है कि यह हर समस्या के लिए कोई जादुई समाधान नहीं है। रोबोट अभी भी बहुत लंबे, जटिल कार्यों के साथ संघर्ष करता है जहाँ योजना को बीच में बदलने की आवश्यकता होती है (जैसे कि यदि कोई व्यक्ति काम करते समय ब्लॉकों को हटा दे)। इन "लॉन्ग होराइजन" परीक्षणों में, सफलता दर काफी कम हो गई, जिससे पता चलता है कि हालांकि रोबोट एक पूर्व-लिखित कहानी का पालन करने में बहुत अच्छा है, लेकिन वह मौके पर एक पूरी नई कहानी बनाने (इम्प्रोवाइज करने) के लिए तैयार नहीं है। इसके अलावा, पत्र नोट करता है कि हालांकि रोबet विभिन्न प्रकार के प्रदर्शनों (मानव बनाम रोबोट) का उपयोग करते समय बहुत सुसंगत है, वास्तविक दुनिया के परीक्षणों ने दिखाया कि इसे पूरी तरह से काम करने के लिए सही मार्गदर्शन की आवश्यकता होती है।
संक्षेप में, स्टेलावीएलए सुझाव देता है कि यदि आप चाहते हैं कि एक रोबोट स्मार्ट और अनुकूलन योग्य हो, तो आपको उसे केवल यह नहीं दिखाना चाहिए कि क्या करना है; आपको उसे यह भी बताना चाहिए कि वह ऐसा क्यों कर रहा है। कच्चे वीडियो को संरचित, तार्किक कहानियों में बदलकर और रोबोट को उस तर्क को समझने के लिए प्रशिक्षित करके, यह सिस्टम नई और कठिन स्थितियों को संभालने में बहुत बेहतर हो जाता है। यह उन रोबोटों की ओर एक कदम है जो केवल हमारी गतिविधियों की नकल नहीं करते, बल्कि हमारे इरादों को भी समझते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।