← नवीनतम पेपर
💻 computer science

Wall-OSS-0.5 Technical Report

यह शोध पत्र Wall-OSS-0.5 को प्रस्तुत करता है, जो एक ओपन-सोर्स 4B विजन-लैंग्वेज-एक्शन मॉडल है जो यह प्रदर्शित करता है कि VLA प्रीट्रेनिंग स्वयं विविध एम्बॉडिमेंट्स (embodiments) के बीच सीधे निष्पादन योग्य ज़ीरो-शॉट रोबोट व्यवहार उत्पन्न करती है और साथ ही डाउनस्ट्रीम फाइन-ट्यूनिंग प्रदर्शन को बढ़ाती है तथा ग्राउंडेड विजन-लैंग्वेज क्षमताओं को सुरक्षित रखती है।

मूल लेखक: Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vince
प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vincent Chen, Harrison Huang, James Wang, Dance Kuzi, Andy Zhai, Hang Su, Roy Gan, Lucy Liang, Hao Wang, Qian Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ Wall-OSS-0.5 तकनीकी रिपोर्ट का हिंदी अनुवाद दिया गया है:

मुख्य विचार: "एक बार प्री-ट्रेन करें, कहीं भी कार्य करें"

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाना चाहते हैं। आमतौर पर, आपको उसे बुनियादी बातें (जैसे कि कप क्या होता है) सिखानी पड़ती हैं और फिर महीनों तक उसे विशिष्ट कौशल (जैसे कि उस विशेष कप को कैसे उठाया जाए) सिखाने में बिताने पड़ते हैं।

Wall-OSS-0.5 के पीछे की टीम ने एक साहसिक प्रश्न पूछा: क्या होगा अगर हम एक रोबोट को सामान्य ज्ञान और गति के लिए इतनी अच्छी तरह से प्रशिक्षित कर सकें कि वह बिना किसी अतिरिक्त प्रशिक्षण के, सीधे डिब्बे से बाहर निकलकर वास्तविक कार्य कर सके?

उन्होंने एक रोबोटिक मस्तिष्क बनाया जिसे Wall-OSS-0.5 कहा जाता है। यह एक "विज़न-लैंग्वेज-एक्शन" (VLA) मॉडल है। इसे एक ऐसे रोबोट के रूप में समझें जो एक ही समय में देख (Vision) सकता है, निर्देशों को समझ (Language) सकता है और अपने हाथों को चला (Action) सकता है।

उन्होंने किस समस्या का समाधान किया: "पाठ्यपुस्तक बनाम अभ्यास" का अंतर

अतीत में, रोबोट के मस्तिष्क उन छात्रों की तरह थे जिन्होंने पुस्तकालय की हर पाठ्यपुस्तक तो पढ़ ली लेकिन कभी रसोई में कदम नहीं रखा। वे सिद्धांत को पूरी तरह से जानते थे लेकिन वास्तव में खाना बनाने के लिए कहा जाने पर ठिठक जाते थे।

अधिकांश पिछले रोबोट मॉडल केवल विशिष्ट कार्य के लिए 'फाइन-ट्यूनिंग' (पुनः प्रशिक्षित) करने के बाद परीक्षण किए जाते थे। इससे एक रहस्य बना रहा: क्या प्रारंभिक प्रशिक्षण ने वास्तव में रोबोट को हिलना-डुलना सिखाया था, या इसने केवल रोबोट को एक अच्छी शुरुआत दी थी?

Wall-OSS-0.5 यह सिद्ध करता है कि प्रारंभिक प्रशिक्षण वास्तव में रोबोट को हिलना-डुलना सिखाता है। किसी भी विशिष्ट "फिनिशिंग स्कूल" प्रशिक्षण से पहले भी, रोबोट एक सरल निर्देश पढ़कर फलों को छांटने, रिंग्स को एक के ऊपर एक रखने और यहाँ तक कि रस्सी को कसने (एक बहुत ही कठिन, लचीला कार्य) जैसे जटिल कार्य करने में सक्षम था।

उन्होंने यह कैसे किया: "तीन पैरों वाला स्टूल"

इसे सफल बनाने के लिए, उन्होंने केवल रोबोट को डेटा नहीं दिया; उन्होंने ग्रेडिएंट-ब्रिज्ड को-ट्रेनिंग (Gradient-Bridged Co-Training) नामक एक विशेष प्रशिक्षण विधि का उपयोग किया। कल्पना कीजिए कि रोबोट के मस्तिष्क को तीन अलग-अलग कोचों द्वारा प्रशिक्षित किया जा रहा है जो मिलकर काम कर रहे हैं:

  1. "एक्शन कोच" (डिस्क्रीट टोकन्स): यह कोच रोबोट को वाक्य में एक शब्द की तरह अगली चाल का अनुमान लगाना सिखाता है। यह मस्तिष्क को गति का "व्याकरण" सिखाने में माहिर है। यह एक पुल के रूप में कार्य करता है, जो मुख्य मस्तिष्क को शरीर को नियंत्रित करना सीखने के लिए मजबूत संकेत भेजता है।
  2. "समझने वाला कोच" (मल्टीमॉडल डेटा): यह कोच यह सुनिश्चित करता है कि रोबोट पढ़ना, देखना और दुनिया को समझना न भूले। यह रोबोट को वास्तविकता से जोड़े रखता है ताकि उसे पता हो कि "कप" कैसा दिखता है और "इसे सिंक में रखें" का क्या अर्थ है।
  3. "स्मूथ ऑपरेटर कोच" (फ्लो मैचिंग): यह कोच रोबोट को झटकेदार, रोबोटिक कदमों के बजाय, एक डांसर की तरह सुचारू और निरंतर रूप से हिलना सिखाता है। वास्तविक दुनिया में काम करते समय रोबोट वास्तव में इसी का उपयोग करता है।

जादुई ट्रिक: आमतौर पर, ये कोच आपस में लड़ते हैं। "एक्शन कोच" मस्तिष्क को हिलना सिखाना चाहता है, लेकिन "स्मूथ ऑपरेटर" एक अलग भाषा का उपयोग करता है। Wall-OSS-0.5 ने उनके बीच एक पुल (Bridge) बनाया। "एक्शन कोच" उस भाषा में बोलता है जिसे मस्तिष्क सबसे अच्छी तरह समझता है, जबकि "स्मूथ ऑपरेटर" यह सुनिश्चित करता है कि अंतिम गतिविधियाँ सहज और सटीक हों।

परिणाम: एक रोबोट जो वास्तव में काम कर सकता है

उन्होंने इस रोबोट का परीक्षण एक वास्तविक भौतिक रोबोटिक आर्म पर 17 विभिन्न कार्यों के साथ किया।

  • जीरो-शॉट (बिना किसी अतिरिक्त प्रशिक्षण के): इन कार्यों के लिए किसी विशिष्ट प्रशिक्षण के बिना, रोबोट ने उनमें से कई को सफलतापूर्वक पूरा किया।
    • ब्लॉक सॉर्टिंग (ब्लॉक छांटना): 100% सफलता।
    • फ्रूट सॉर्टिंग (फल छांटना): 96% सफलता।
    • रोप टाइटनिंग (रस्सी कसना): 82% सफलता (यह बहुत बड़ी बात है क्योंकि रस्सियाँ लचीली होती हैं और उन्हें नियंत्रित करना कठिन होता!)।
  • फाइन-ट्यूनिंग के बाद: जब उन्होंने रोबोट को 15 कार्यों के लिए थोड़ा विशिष्ट प्रशिक्षण दिया, तो वह और भी बेहतर हो गया, जिसने पिछले सर्वश्रेष्ठ रोबोट मॉडलों को एक बड़े अंतर से पीछे छोड़ दिया (17.5% बेहतर)।

यह क्यों महत्वपूर्ण है (सरल शब्दों में)

इससे पहले, लोग सोचते थे कि रोबोट को प्री-ट्रेन करना एक छात्र के अच्छे GPA देने जैसा है—यह उन्हें अंतिम परीक्षा पास करने में मदद करता है, लेकिन उन्हें अभी भी विशिष्ट टेस्ट के लिए पढ़ाई करने की आवश्यकता होती है।

Wall-OSS-0.5 दिखाता है कि प्री-ट्रेनिंग स्वयं ही परीक्षा है। रोबोट ने अपने बड़े प्रशिक्षण चरण के दौरान सामान्य "मांसपेशियों की स्मृति" (Muscle Memory) और "सामान्य समझ" (Common Sense) सीख ली। यह एक बच्चे की तरह है जो सभी प्रकार के खिलौनों के साथ खेलने और वयस्कों को हिलते-डुलते देखने के बाद, एक नए कमरे में जा सकता है और बिना यह बताए कि दरवाजा कैसे खोलना है या खिलौना कैसे उठाना है, दरवाजा खोलने या खिलौना उठाने का तरीका खुद ही समझ सकता है।

तकनीकी "सीक्रेट सॉस"

  • मस्तिष्क: यह एक 3-बिलियन पैरामीटर वाले "मस्तिष्क" (एक लार्ज लैंग्वेज मॉडल) पर आधारित है जिसे रोबोटिक गतिविधियों को संभालने के लिए अपग्रेड किया गया है।
  • डेटा: उन्होंने 20 से अधिक विभिन्न प्रकार के रोबोटों से दस लाख से अधिक रोबोटिक गतिविधियों और छवियों एवं टेक्स्ट के एक विशाल पुस्तकालय पर इसे प्रशिक्षित किया।
  • गति: उन्होंने रोबोट को इतना तेज़ सोचने के योग्य बनाया कि वह वास्तविक समय में (प्रति सेकंड 15 बार) एक वास्तविक हाथ को नियंत्रित कर सके, जो चीजों को गिरने से बचाने के लिए अत्यंत महत्वपूर्ण है।

सारांश

Wall-OSS-0.5 एक बड़ी उपलब्धि है क्योंकि यह सिद्ध करता है कि यदि आप सही "ब्रिज" तकनीकों का उपयोग करके पर्याप्त विविध डेटा पर एक रोबोट के मस्तिष्क को प्रशिक्षित करते हैं, तो रोबोट केवल एक स्मार्ट दर्शक नहीं बनता; बल्कि वह तुरंत एक सक्षम कर्ता (Doer) बन जाता है। यह मेज की अव्यवस्था को देख सकता है, "सफाई करो" के निर्देश को समझ सकता है, और मेज पर मौजूद प्रत्येक वस्तु के लिए मैनुअल की आवश्यकता के बिना वस्तुओं को छांटना शुरू कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →