Wall-OSS-0.5 Technical Report
यह शोध पत्र Wall-OSS-0.5 को प्रस्तुत करता है, जो एक ओपन-सोर्स 4B विजन-लैंग्वेज-एक्शन मॉडल है जो यह प्रदर्शित करता है कि VLA प्रीट्रेनिंग स्वयं विविध एम्बॉडिमेंट्स (embodiments) के बीच सीधे निष्पादन योग्य ज़ीरो-शॉट रोबोट व्यवहार उत्पन्न करती है और साथ ही डाउनस्ट्रीम फाइन-ट्यूनिंग प्रदर्शन को बढ़ाती है तथा ग्राउंडेड विजन-लैंग्वेज क्षमताओं को सुरक्षित रखती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ Wall-OSS-0.5 तकनीकी रिपोर्ट का हिंदी अनुवाद दिया गया है:
मुख्य विचार: "एक बार प्री-ट्रेन करें, कहीं भी कार्य करें"
कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाना चाहते हैं। आमतौर पर, आपको उसे बुनियादी बातें (जैसे कि कप क्या होता है) सिखानी पड़ती हैं और फिर महीनों तक उसे विशिष्ट कौशल (जैसे कि उस विशेष कप को कैसे उठाया जाए) सिखाने में बिताने पड़ते हैं।
Wall-OSS-0.5 के पीछे की टीम ने एक साहसिक प्रश्न पूछा: क्या होगा अगर हम एक रोबोट को सामान्य ज्ञान और गति के लिए इतनी अच्छी तरह से प्रशिक्षित कर सकें कि वह बिना किसी अतिरिक्त प्रशिक्षण के, सीधे डिब्बे से बाहर निकलकर वास्तविक कार्य कर सके?
उन्होंने एक रोबोटिक मस्तिष्क बनाया जिसे Wall-OSS-0.5 कहा जाता है। यह एक "विज़न-लैंग्वेज-एक्शन" (VLA) मॉडल है। इसे एक ऐसे रोबोट के रूप में समझें जो एक ही समय में देख (Vision) सकता है, निर्देशों को समझ (Language) सकता है और अपने हाथों को चला (Action) सकता है।
उन्होंने किस समस्या का समाधान किया: "पाठ्यपुस्तक बनाम अभ्यास" का अंतर
अतीत में, रोबोट के मस्तिष्क उन छात्रों की तरह थे जिन्होंने पुस्तकालय की हर पाठ्यपुस्तक तो पढ़ ली लेकिन कभी रसोई में कदम नहीं रखा। वे सिद्धांत को पूरी तरह से जानते थे लेकिन वास्तव में खाना बनाने के लिए कहा जाने पर ठिठक जाते थे।
अधिकांश पिछले रोबोट मॉडल केवल विशिष्ट कार्य के लिए 'फाइन-ट्यूनिंग' (पुनः प्रशिक्षित) करने के बाद परीक्षण किए जाते थे। इससे एक रहस्य बना रहा: क्या प्रारंभिक प्रशिक्षण ने वास्तव में रोबोट को हिलना-डुलना सिखाया था, या इसने केवल रोबोट को एक अच्छी शुरुआत दी थी?
Wall-OSS-0.5 यह सिद्ध करता है कि प्रारंभिक प्रशिक्षण वास्तव में रोबोट को हिलना-डुलना सिखाता है। किसी भी विशिष्ट "फिनिशिंग स्कूल" प्रशिक्षण से पहले भी, रोबोट एक सरल निर्देश पढ़कर फलों को छांटने, रिंग्स को एक के ऊपर एक रखने और यहाँ तक कि रस्सी को कसने (एक बहुत ही कठिन, लचीला कार्य) जैसे जटिल कार्य करने में सक्षम था।
उन्होंने यह कैसे किया: "तीन पैरों वाला स्टूल"
इसे सफल बनाने के लिए, उन्होंने केवल रोबोट को डेटा नहीं दिया; उन्होंने ग्रेडिएंट-ब्रिज्ड को-ट्रेनिंग (Gradient-Bridged Co-Training) नामक एक विशेष प्रशिक्षण विधि का उपयोग किया। कल्पना कीजिए कि रोबोट के मस्तिष्क को तीन अलग-अलग कोचों द्वारा प्रशिक्षित किया जा रहा है जो मिलकर काम कर रहे हैं:
- "एक्शन कोच" (डिस्क्रीट टोकन्स): यह कोच रोबोट को वाक्य में एक शब्द की तरह अगली चाल का अनुमान लगाना सिखाता है। यह मस्तिष्क को गति का "व्याकरण" सिखाने में माहिर है। यह एक पुल के रूप में कार्य करता है, जो मुख्य मस्तिष्क को शरीर को नियंत्रित करना सीखने के लिए मजबूत संकेत भेजता है।
- "समझने वाला कोच" (मल्टीमॉडल डेटा): यह कोच यह सुनिश्चित करता है कि रोबोट पढ़ना, देखना और दुनिया को समझना न भूले। यह रोबोट को वास्तविकता से जोड़े रखता है ताकि उसे पता हो कि "कप" कैसा दिखता है और "इसे सिंक में रखें" का क्या अर्थ है।
- "स्मूथ ऑपरेटर कोच" (फ्लो मैचिंग): यह कोच रोबोट को झटकेदार, रोबोटिक कदमों के बजाय, एक डांसर की तरह सुचारू और निरंतर रूप से हिलना सिखाता है। वास्तविक दुनिया में काम करते समय रोबोट वास्तव में इसी का उपयोग करता है।
जादुई ट्रिक: आमतौर पर, ये कोच आपस में लड़ते हैं। "एक्शन कोच" मस्तिष्क को हिलना सिखाना चाहता है, लेकिन "स्मूथ ऑपरेटर" एक अलग भाषा का उपयोग करता है। Wall-OSS-0.5 ने उनके बीच एक पुल (Bridge) बनाया। "एक्शन कोच" उस भाषा में बोलता है जिसे मस्तिष्क सबसे अच्छी तरह समझता है, जबकि "स्मूथ ऑपरेटर" यह सुनिश्चित करता है कि अंतिम गतिविधियाँ सहज और सटीक हों।
परिणाम: एक रोबोट जो वास्तव में काम कर सकता है
उन्होंने इस रोबोट का परीक्षण एक वास्तविक भौतिक रोबोटिक आर्म पर 17 विभिन्न कार्यों के साथ किया।
- जीरो-शॉट (बिना किसी अतिरिक्त प्रशिक्षण के): इन कार्यों के लिए किसी विशिष्ट प्रशिक्षण के बिना, रोबोट ने उनमें से कई को सफलतापूर्वक पूरा किया।
- ब्लॉक सॉर्टिंग (ब्लॉक छांटना): 100% सफलता।
- फ्रूट सॉर्टिंग (फल छांटना): 96% सफलता।
- रोप टाइटनिंग (रस्सी कसना): 82% सफलता (यह बहुत बड़ी बात है क्योंकि रस्सियाँ लचीली होती हैं और उन्हें नियंत्रित करना कठिन होता!)।
- फाइन-ट्यूनिंग के बाद: जब उन्होंने रोबोट को 15 कार्यों के लिए थोड़ा विशिष्ट प्रशिक्षण दिया, तो वह और भी बेहतर हो गया, जिसने पिछले सर्वश्रेष्ठ रोबोट मॉडलों को एक बड़े अंतर से पीछे छोड़ दिया (17.5% बेहतर)।
यह क्यों महत्वपूर्ण है (सरल शब्दों में)
इससे पहले, लोग सोचते थे कि रोबोट को प्री-ट्रेन करना एक छात्र के अच्छे GPA देने जैसा है—यह उन्हें अंतिम परीक्षा पास करने में मदद करता है, लेकिन उन्हें अभी भी विशिष्ट टेस्ट के लिए पढ़ाई करने की आवश्यकता होती है।
Wall-OSS-0.5 दिखाता है कि प्री-ट्रेनिंग स्वयं ही परीक्षा है। रोबोट ने अपने बड़े प्रशिक्षण चरण के दौरान सामान्य "मांसपेशियों की स्मृति" (Muscle Memory) और "सामान्य समझ" (Common Sense) सीख ली। यह एक बच्चे की तरह है जो सभी प्रकार के खिलौनों के साथ खेलने और वयस्कों को हिलते-डुलते देखने के बाद, एक नए कमरे में जा सकता है और बिना यह बताए कि दरवाजा कैसे खोलना है या खिलौना कैसे उठाना है, दरवाजा खोलने या खिलौना उठाने का तरीका खुद ही समझ सकता है।
तकनीकी "सीक्रेट सॉस"
- मस्तिष्क: यह एक 3-बिलियन पैरामीटर वाले "मस्तिष्क" (एक लार्ज लैंग्वेज मॉडल) पर आधारित है जिसे रोबोटिक गतिविधियों को संभालने के लिए अपग्रेड किया गया है।
- डेटा: उन्होंने 20 से अधिक विभिन्न प्रकार के रोबोटों से दस लाख से अधिक रोबोटिक गतिविधियों और छवियों एवं टेक्स्ट के एक विशाल पुस्तकालय पर इसे प्रशिक्षित किया।
- गति: उन्होंने रोबोट को इतना तेज़ सोचने के योग्य बनाया कि वह वास्तविक समय में (प्रति सेकंड 15 बार) एक वास्तविक हाथ को नियंत्रित कर सके, जो चीजों को गिरने से बचाने के लिए अत्यंत महत्वपूर्ण है।
सारांश
Wall-OSS-0.5 एक बड़ी उपलब्धि है क्योंकि यह सिद्ध करता है कि यदि आप सही "ब्रिज" तकनीकों का उपयोग करके पर्याप्त विविध डेटा पर एक रोबोट के मस्तिष्क को प्रशिक्षित करते हैं, तो रोबोट केवल एक स्मार्ट दर्शक नहीं बनता; बल्कि वह तुरंत एक सक्षम कर्ता (Doer) बन जाता है। यह मेज की अव्यवस्था को देख सकता है, "सफाई करो" के निर्देश को समझ सकता है, और मेज पर मौजूद प्रत्येक वस्तु के लिए मैनुअल की आवश्यकता के बिना वस्तुओं को छांटना शुरू कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।