Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
यह शोध पत्र Green-VLA का परिचय देता है, जो एक पांच-चरणीय पाठ्यक्रम ढांचा (curriculum framework) है जो बड़े पैमाने पर मल्टीमॉडल प्रीट्रेनिंग, एम्बॉडिमेंट-विशिष्ट अनुकूलन (embodiment-specific adaptation), और सुदृढीकरण शिक्षण (reinforcement learning) को जोड़ता है ताकि एक एकल सामान्यज्ञ नीति (generalist policy) को ग्रीन ह्यूमनाइड सहित विविध रोबोटिक प्रणालियों को बेहतर सुरक्षा और दीर्घ-अवधि दक्षता के साथ मजबूती से नियंत्रित करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक सहायक बटलर (butler) बनने के लिए सिखाना चाहते हैं। अतीत में, आपको उसे बिल्कुल सटीक रूप से दिखाना पड़ता कि एक विशिष्ट कप, फिर एक विशिष्ट प्लेट, और फिर एक विशिष्ट चम्मच कैसे उठाना है, एक-एक करके। यदि आप उसे एक नया कप देते जिसे उसने पहले कभी नहीं देखा था, तो संभावना है कि वह उसे गिरा देगा।
Green-VLA रोबोट को सिखाने का एक नया, स्मार्ट तरीका है। केवल लाखों विशिष्ट गतिविधियों को रटने के बजाय, यह रोबोट को दुनिया को समझने, भौतिकी (physics) के सामान्य नियमों को सीखने, और फिर वास्तव में काम में माहिर होने तक अभ्यास करने के लिए प्रशिक्षित करता है।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल चरणों में विभाजित किया गया है:
1. "फाइव-स्टेज स्कूल" करिकुलम (पाँच-चरणों वाला पाठ्यक्रम)
रोबोट को सीधे गहरे पानी में फेंकने के बजाय, शोधकर्ताओं ने इसे पाँच-चरणीय स्कूल प्रणाली के माध्यम से प्रशिक्षित किया। इसे एक इंसान के बड़े होने की तरह समझें:
- चरण 0 (शिशु): रोबोट एक ऐसे "मस्तिष्क" के साथ शुरू करता है जो पहले से ही भाषा और चित्रों के बारे में बहुत कुछ जानता है (जैसे एक स्मार्ट बच्चा जिसने लाइब्रेरी की हर किताब पढ़ ली हो)। वह जानता है कि "कप" क्या है, लेकिन वह अभी यह नहीं जानता कि उसे कैसे पकड़ना है।
- चरण 1 (एक्सप्लोरर/अन्वेषक): रोबोट इंटरनेट पर लोगों द्वारा किए जाने वाले लाखों वीडियो देखता है। वह सीखता है कि यदि आप कप को धक्का देते हैं, तो वह फिसलता है; यदि आप उसे गिराते हैं, तो वह टूट जाता है। वह सीखता है कि भौतिक दुनिया कैसे काम करती है, इसका "कॉमन सेंस" क्या है।
- चरण 2 (इंटर्न): अब, रोबोट अन्य रोबोटों (हाथों, मोबाइल बॉट्स, ह्यूमनॉइड्स) को कार्य करते हुए देखता है। वह सीखता है कि "पकड़ना" (grabbing) एक पंजे वाले रोबोट या उंगलियों वाले रोबोट के लिए अलग दिख सकता है, लेकिन लक्ष्य वही रहता है। वह अलग-अलग रोबोटिक शरीरों के बीच अनुवाद करना सीखता है।
- चरण 3 (स्पेशलिस्ट/विशेषज्ञ): अंत में, रोबोट को उसका विशिष्ट शरीर ( "Green" ह्यूमनॉइड रोबोट) सौंपा जाता है। वह विशेष रूप से अपने स्वयं के हाथों और अंगों के साथ अभ्यास करता है, यह सीखते हुए कि उसके जोड़ (joints) ठीक कैसे चलते हैं।
- चरण 4 (कोच के साथ प्रशिक्षु): यही असली सफलता का मंत्र है। रोबोट एक कार्य करने की कोशिश करता है। यदि वह विफल होता है, तो एक "कोच" (Reinforcement Learning) केवल यह नहीं कहता कि "फिर से प्रयास करो।" वह कहता है, "आप बहुत धीमे थे," या "आपने इसे इसलिए गिरा दिया क्योंकि आपने इसे पर्याप्त जोर से नहीं दबाया था।" रोबोट अपनी गलतियों से सीखता है और लंबे, जटिल कार्यों में बेहतर होता जाता है।
2. रोबोटिक हाथों के लिए "यूनिवर्सल ट्रांसलेटर"
रोबोटिक्स में सबसे बड़ी समस्याओं में से एक यह है कि हर रोबोट अलग तरह से बनाया जाता है। किसी के दो हाथ हैं, किसी के एक, किसी के पहिए हैं, किसी के पैर हैं। आमतौर पर, आपको प्रत्येक के लिए एक अलग मस्तिष्क प्रशिक्षित करना पड़ता है।
Green-VLA एक यूनिवर्सल एक्शन स्पेस का उपयोग करता है। एक यूनिवर्सल रिमोट कंट्रोल की कल्पना करें। चाहे आप टीवी, पंखा या लाइट को नियंत्रित कर रहे हों, रिमोट एक ही भाषा का उपयोग करता है (वॉल्यूम अप, पावर, चैनल)।
- Green-VLA हर रोबोट की विशिष्ट गतिविधियों को इस "यूनिवर्सल भाषा" में अनुवादित करता है।
- इसका मतलब है कि रोबोट दो हाथों वाले फैक्ट्री रोबोट से सीख सकता है और उस ज्ञान को एक ह्यूमनॉइड रोबोट पर लागू कर सकता है, भले ही वे दिखने में पूरी तरह से अलग हों। यह एक ट्रक चलाने और फिर आसानी से कार चलाना सीख जाने जैसा है क्योंकि आप "स्टीयरिंग" और "ब्रेकिंग" की अवधारणा को समझते हैं।
3. "क्वालिटी कंट्रोल" फ़िल्टर
इंटरनेट खराब डेटा से भरा है: धुंधले वीडियो, हिलते हुए कैमरा फुटेज, या अजीब तरह से चलते हुए रोबोट। यदि आप रोबोट को खराब डेटा पर प्रशिक्षित करते हैं, तो वह अनाड़ी बन जाता है।
टीम ने एक DataQA Pipeline (एक गुणवत्ता निरीक्षक) बनाया है।
- यह एक सख्त फिल्म संपादक की तरह काम करता है। यह स्वचालित रूप से हिलते हुए वीडियो, धुंधले फ्रेम, या उन क्लिप्स को हटा देता है जहाँ रोबोट हिल नहीं रहा है।
- यह अच्छे वीडियो को "स्मूथ" (smooth) भी करता है। यदि एक रोबोट धीरे चलता है और दूसरा तेज़, तो सिस्टम गति को समायोजित करता है ताकि वे एक ही लय में चलते हुए दिखें। इससे रोबोट केवल गति के बजाय गति के पैटर्न को सीख पाता है।
4. चीजों को उठाने के लिए "जीपीएस" (GPS)
कल्पना कीजिए कि आप रोबोट को कहते हैं, "शैम्पू की नीली बोतल उठाओ।" लेकिन बोतल एक बॉक्स के पीछे छिपी है, या यह एक ऐसा ब्रांड है जिसे रोबोट ने पहले कभी नहीं देखा है। एक सामान्य रोबोट भ्रमित हो सकता है और गलत चीज़ पकड़ सकता है।
Green-VLA के पास एक विशेष गाइडेंस मॉड्यूल (उसके हाथों के लिए जीपीएस की तरह) है।
- हिलने से पहले ही, यह अपनी "आंखों" और "मस्तिष्क" का उपयोग करके यह अनुमान लगाता है कि नीली बोतल 3D स्पेस में ठीक कहाँ है।
- इसके बाद, यह अपने हाथ से उस नीली बोतल तक एक अदृश्य रेखा खींचता है और उस रेखा के साथ अपनी गति को निर्देशित करता है। यह उसे उस विशिष्ट बोतल को पकड़ने में मदद करता है जिसे उसने पहले कभी नहीं देखा है।
5. "सेफ्टी नेट" (सुरक्षा जाल)
जब एक रोबोट सीख रहा होता है, तो वह गलती से कुछ खतरनाक या असंभव करने की कोशिश कर सकता है (जैसे मेज के आर-पार पहुँचने की कोशिश करना)।
- Green-VLA में एक Out-of-Distribution Detector है। यह एक सुरक्षा गार्ड की तरह है। यदि रोबोट ऐसी दिशा में बढ़ने लगता है जो "अजीब" है या जो उसने सीखा नहीं है, तो सिस्टम उसे टकराने या कुछ तोड़ने से पहले धीरे से एक सुरक्षित पथ पर वापस लाता है।
परिणाम
अंतिम रोबोट, जिसका नाम Green है, यह कर सकता है:
- "मेज साफ करो और सेबों को टोकरी में डालो" जैसे जटिल निर्देशों को समझना।
- अपने दोनों हाथों का एक साथ उपयोग करना (bimanual manipulation)।
- उन नई वस्तुओं को संभालना जिन्हें उसने पहले कभी नहीं देखा।
- गलतियों से उबरना (यदि वह कुछ गिरा देता है, तो वह घबराने के बजाय उसे फिर से उठा लेता है)।
संक्षेप में: Green-VLA केवल एक स्क्रिप्ट रटने वाला रोबोट नहीं है। यह एक ऐसा रोबot है जो दुनिया को समझता है, गति की एक सार्वभौमिक भाषा बोलता है, और एक कोच से सीखकर एक विश्वसनीय, सामान्य उद्देश्य वाला सहायक बनता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।