A Pragmatic VLA Foundation Model
यह शोध पत्र LingBot-VLA को प्रस्तुत करता है, जो कि 20,000 घंटों के वास्तविक दुनिया के ड्यूल-आर्म रोबोट डेटा पर प्रशिक्षित एक व्यावहारिक विजन-लैंग्वेज-एक्शन फाउंडेशन मॉडल है, जो कई प्लेटफॉर्म्स पर बेहतर सामान्यीकरण (generalization) प्रदर्शित करता है और एक अत्यधिक कुशल प्रशिक्षण कोडबेस प्रदान करता है, जिसके सभी संसाधन रोबोट लर्निंग के क्षेत्र को आगे बढ़ाने के लिए जारी किए गए हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाना चाहते हैं, जैसे सैंडविच बनाना या बिखरी हुई डेस्क को व्यवस्थित करना। अतीत में, रोबोट को सिखाना एक बच्चे को एक एकल ट्रिक सिखाने जैसा था: आपको उसे बिल्कुल सटीक रूप से दिखाना पड़ता था कि एक विशिष्ट कप को कैसे उठाना है, और यदि आपने उस कप को दो इंच बाईं ओर खिसका दिया, तो रोबोट भ्रमित हो जाता था।
यह शोध पत्र LingBot-VLA पेश करता है, जो एक नया "मस्तिष्क" है जिसे एक सच्चे 'जनरलिस्ट' (generalist) के रूप में डिज़ाइन किया गया है। इसे एक ऐसे रोबोट के रूप में न सोचें जो केवल एक ट्रिक जानता है, बल्कि एक ऐसे रोबोट के रूप में सोचें जिसके पास जीवन के अनुभवों का एक विशाल पुस्तकालय है जो उसे नई परिस्थितियों में नए कार्यों को हल करने की अनुमति देता है।
यहाँ इसका विवरण दिया गया है कि उन्होंने क्या किया, सरल उपमाओं का उपयोग करते हुए:
1. विशाल पुस्तकालय (डेटा)
इस रोबोट को स्मार्ट बनाने के लिए, शोधकर्ताओं ने इसे केवल कुछ वीडियो नहीं दिखाए। उन्होंने वास्तविक दुनिया के रोबोट फुटेज का एक विशाल पुस्तकालय बनाया जिसमें 20,000 घंटे का डेटा शामिल है।
- उपमा: कल्पना कीजिए कि आप खाना बनाना सीख रहे हैं। अधिकांश लोग कुछ यूट्यूब वीडियो देखते हैं। LingBot-VLA ने खाना पकाने के 20,000 घंटों को देखा, इसमें शेफ को सब्जियां काटते, पैनकेक पलटते और यहाँ तक कि टोस्ट जलाते हुए भी देखा, और यह सब अलग-अलग कोणों से और विभिन्न रसोई के उपकरणों का उपयोग करके देखा।
- विविधता: उन्होंने केवल एक प्रकार के रोबोट का उपयोग नहीं किया। उन्होंने 9 अलग-अलग रोबोट "शरीरों" (कुछ के दो हाथ हैं, कुछ इंसानों जैसे दिखते हैं, कुछ पहियों पर हैं) से डेटा एकत्र किया। यह खाना बनाना सीखने जैसा है, न कि केवल एक मानक चूल्हे के साथ, बल्कि एक कैंपफायर, माइक्रोवेव और एक हाई-टेक ओवन के साथ भी। यह रोबोट को सिखाता है कि लक्ष्य (खाना बनाना) महत्वपूर्ण है, न कि उपयोग किया जाने वाला विशिष्ट उपकरण।
2. "मस्तिष्क" आर्किटेक्चर (यह कैसे काम करता है)
यह मॉडल विशेषज्ञों की एक टीम के रूप में काम करने जैसा है:
- समझने वाला विशेषज्ञ (The Understanding Expert): यह हिस्सा निर्देशों को पढ़ता है (जैसे "सैंडविच बनाओ") और कैमरा फीड को देखता है। यह रोबोट की आँखों और कानों की तरह है।
- क्रिया विशेषज्ञ (The Action Expert): यह हिस्सा तय करता है कि रोबोट के हाथों को ठीक से कैसे हिलाना है।
- गोंद (The Glue): वे एक विशेष प्रणाली (जिसे "Mixture-of-Transformers" कहा जाता है) का उपयोग करते हैं जो इन दोनों विशेषज्ञों को लगातार एक-दूसरे से बात करने की अनुमति देती है। यह एक ऑर्केस्ट्रा के कंडक्टर की तरह है जो यह सुनिश्चित करता है कि आँखें और हाथ पूरी तरह से तालमेल में हों।
- गहराई का बोध (Depth Perception): रोबोट को दूरी का अंदाजा लगाने में मदद करने के लिए (जैसे यह जानना कि कप तक पहुँचने के लिए कितनी दूर तक हाथ बढ़ाना है), उन्होंने एक विशेष "डेप्थ" लेयर जोड़ी है। यह रोबोट को 3D चश्मा देने जैसा है ताकि वह केवल एक सपाट तस्वीर न देखे, बल्कि यह भी समझ सके कि चीजें कितनी दूर हैं।
3. "सुपर-फास्ट" ट्रेनिंग किचन (दक्षता)
इन मॉडल्स को प्रशिक्षित करना आमतौर पर बहुत समय लेता है और कंप्यूटर पावर की भारी लागत आती है। शोधकर्ताओं ने एक नया, अत्यधिक अनुकूलित "किचन" (कोडबेस) बनाया है ताकि इस डेटा को पका सके।
- उपमा: यदि अन्य प्रशिक्षण विधियाँ एक छोटे किचन में खाना बनाने वाले एकल शेफ की तरह थीं, तो LingBot टीम ने एक विशाल औद्योगिक किचन बनाया है जिसमें 8 विशाल ओवन पूरी तरह से तालमेल में काम कर रहे हैं।
- परिणाम: वे मौजूदा तरीकों की तुलना में डेटा को 1.5 से 2.8 गुना तेज़ी से प्रोसेस कर सकते हैं। इसका मतलब है कि वे कम समय और कम पैसे में अधिक सीख सकते हैं।
4. बड़ा परीक्षण (परिणाम)
यह साबित करने के लिए कि यह काम करता है, उन्होंने केवल कंप्यूटर सिमुलेशन (जो नकली हो सकता है) में परीक्षण नहीं किया। उन्होंने रोबोट को वास्तविक दुनिया में उतारा।
- चुनौती: उन्होंने रोबोट का 100 अलग-अलग कार्यों (जैसे कटोरे ढेर करना, नींबू छीलना, या ब्लॉक छाँटना) पर 4 अलग-अलग रोबोट शरीरों के माध्यम से परीक्षण किया।
- स्कोरकार्ड: उन्होंने LingBot-VLA की तुलना तीन अन्य शीर्ष-स्तरीय रोबोट ब्रेन्स से की।
- परिणाम: LingBot-VLA जीत गया। यह कार्यों को पूरा करने में अधिक सफल था और यदि यह पूरा कार्य पूरा नहीं भी कर पाता, तो भी इसने अधिक प्रगति की।
- "स्केलिंग" खोज: उन्होंने एक स्वर्णिम नियम पाया: अधिक डेटा = बेहतर प्रदर्शन। यहाँ तक कि 20,000 घंटों के बाद भी, रोबोट स्मार्ट होता गया। इसने कोई ऐसा "सीलिंग" (सीमा) नहीं छुआ जहाँ इसकी सीखने की क्षमता रुक जाए। यह कहने जैसा है कि, "आप जितनी अधिक किताबें पढ़ेंगे, उतने ही बुद्धिमान बनेंगे," और यह सिद्ध करना कि 20,000 किताबें पढ़ने के बाद भी, आप अभी भी नया सीख रहे हैं।
5. दुनिया को उपहार
शोधकर्ता इस रहस्य को अपने तक सीमित नहीं रख रहे हैं। वे दे रहे हैं:
- कोड (किचन का नुस्खा)।
- मॉडल (प्रशिक्षित मस्तिष्क)।
- डेटा (वीडियो का पुस्तकालय)।
संक्षेप में: यह शोध पत्र एक ऐसे रोबोट मस्तिष्क को प्रस्तुत करता है जिसे वास्तविक दुनिया के अनुभवों के एक विशाल भंडार पर प्रशिक्षित किया गया है, जो कई अलग-अलग प्रकार के रोबोट शरीरों पर काम करता है, जो किसी से भी अधिक तेज़ी से सीखता है, और जिसे आप जितना अधिक डेटा देते हैं वह उतना ही स्मार्ट होता जाता है। यह उन रोबोटों की ओर एक कदम है जो वास्तव में हमारे दैनिक जीवन में हमारी मदद कर सकते हैं, न कि केवल कारखाने में एक दोहराव वाला काम करने के लिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।