FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences
यह शोधपत्र FetchMan को पेश करता है, जो एक एंड-टू-एंड सिम-टू-रियल पाइपलाइन है जो सिंथेटिक बिहेवियर क्लोनिंग की प्रदर्शन सीमाओं को Flow-GRPO सुदृढीकरण शिक्षण (reinforcement learning) के साथ नीतियों को परिष्कृत करके दूर करती है, जिससे एक Unitree G1 ह्यूमनॉइड अनदेखे दृश्यों में लोको-मैनिप्यूलेशन कार्यों में 73.3% ज़ीरो-शॉट सफलता प्राप्त करने में सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसे रोबोट का सपना जो किसी कमरे में चल कर जा सके, एक विशिष्ट वस्तु को पहचान सके और उसे उठा सके, लंबे समय से रोबोटिक्स का एक केंद्रीय लक्ष्य रहा है। दशकों से, शोधकर्ता मशीनों को इस तरह के जटिल व्यवहार को सिखाने के लिए संघर्ष कर रहे हैं क्योंकि इसके लिए दो कठिन कौशलों को एक साथ काम करने की आवश्यकता होती है: अंतरिक्ष में शरीर को चलाना और दुनिया के साथ बातचीत करने के लिए हाथों का उपयोग करना। हालांकि रोबler अपने आप चलने में काफी कुशल हो गए हैं, लेकिन दो पैरों पर संतुलन बनाए रखते हुए पहुँचने और चीजों को पकड़ने की क्षमता जोड़ना भौतिकी का एक ऐसा अराजक मिश्रण पैदा करता है जिसे हाथ से प्रोग्राम करना अविश्वसनीय रूप से कठिन है। इस तरह रोबोट को सिखाने के लिए आवश्यक डेटा एकत्र करना भी एक बड़ी बाधा है; हर संभव कमरे में चलकर एक कटोरे तक पहुँचने और उसे उठाने के हर संभव तरीके को दिखाने के लिए एक इंसान को वर्षों लग जाएंगे और इससे रोबोट के टूटने का जोखिम भी रहेगा। इस समस्या को हल करने के लिए, वैज्ञानिक कंप्यूटर सिमुलेशन की ओर मुड़े हैं, जिससे डिजिटल दुनिया बनाई गई है जहाँ रोबोट बिना किसी नुकसान के डर के लाखों बार अभ्यास कर सकते हैं। हालाँकि, एक बड़ा सवाल बना हुआ था: क्या पूरी तरह से डिजिटल दुनिया में प्रशिक्षित एक रोबोट वास्तव में एक वास्तविक घर की अव्यवस्थित और अप्रत्याशित वास्तविकता को संभालने के लिए सीख सकता है?
कैलिफोर्निया विश्वविद्यालय, लॉस एंजिल्स के शोधकर्ताओं की एक टीम ने, एलन इंस्टीट्यूट फॉर एआई और वॉशिंगटन विश्वविद्यालय के सहयोगियों के साथ मिलकर, इस चुनौती से निपटने के लिए एक नई प्रणाली विकसित की है जिसे वे 'फचमैन' (FetchMan) कहते हैं। उनका कार्य एक ह्युमनॉइड रोबट, यूनिट्री जी1 (Unitree G1) पर केंद्रित है, जो दिखने और चलने में काफी हद तक इंसान जैसा है। टीम यह जानना चाहती थी कि क्या वे इस रोबोट को कंप्यूटर सिमुलेशन में हजारों उदाहरण दिखाकर एक कमरे में जाने और लक्ष्य वस्तु को पकड़ने के लिए प्रशिक्षित कर सकते हैं, और फिर इसे बिना किसी और प्रशिक्षण के वास्तविक दुनिया में पूरी तरह से कार्य करने के लिए तैयार कर सकते हैं। उन्होंने पाया कि केवल रोबोट को अधिक से अधिक उदाहरण दिखाना पर्याप्त नहीं था। 1,50,000 से अधिक विभिन्न दृश्यों पर प्रशिक्षण के बाद भी, रोबोट का प्रदर्शन एक कठिन सीमा पर पहुँच गया। वह डिजिटल शिक्षक की नकल तो कर सकता था, लेकिन चलने से पहुँचने के बीच सुचारू रूप से संक्रमण के लिए आवश्यक सूक्ष्म समय (timing) को नहीं सीख सका। रोबोट अक्सर वस्तु को बहुत जल्दी पकड़ने की कोशिश करता या बहुत जल्दी चलना बंद कर देता, क्योंकि वह एक ऐसे शिक्षक की नकल करने की कोशिश कर रहा था जो उस गुप्त जानकारी का उपयोग कर रहा था जिसे रोबोट देख नहीं सकता था।
इस बाधा को तोड़ने के लिए, शोधकर्ताओं ने प्रशिक्षण प्रक्रिया में एक दूसरा चरण जोड़ा। केवल डिजिटल शिक्षक की नकल करने के बजाय, उन्होंने रोबोट को सिमुलेशन में अपने आप अभ्यास करने दिया और उसे केवल तभी पुरस्कृत किया जब उसने वस्तु तक चलने और उसे उठाने के पूरे कार्य को सफलतापूर्वक पूरा किया। यह विधि, जो 'रीइन्फोर्समेंट लर्निंग' (reinforcement learning) नामक तकनीक का उपयोग करती है, रोबोट को सही समय और गति को अपने आप समझने की अनुमति देती है। इसने सीखा कि हाथ बढ़ाने से पहले वस्तु के करीब कैसे चला जाए, जिससे उन गलतियों को सुधारा जा सका जो वह केवल नकल करते समय करता था। जब टीम ने इस परिष्कृत रोबोट का वास्तविक दुनिया में परीक्षण किया, तो परिणाम चौंकाने वाले थे। रोबोट, जिसने अपने प्रशिक्षण के दौरान कभी भी वास्तविक कमरा या वास्तविक वस्तु नहीं देखी थी, अपरिचित स्थानों में जाने, एक लक्षित कटोरे को पहचानने और 73 प्रतिशत से अधिक की सफलता दर के साथ उसे पकड़ने में सक्षम था। यह प्रारंभिक प्रशिक्षण पद्धति की तुलना में एक महत्वपूर्ण सुधार था, जो वास्तविक दुनिया के परीक्षणों में केवल 57 प्रतिशत बार ही सफल हो पा रही थी।
शोधकर्ताओं ने यह भी पता लगाया कि क्या यह दृष्टिकोण केवल कटोरे के लिए ही नहीं, बल्कि कई अलग-अलग प्रकार की वस्तुओं के लिए भी काम कर सकता है। उन्होंने रोबोट को वस्तु का नाम एक संकेत के रूप में देकर ब्रेड, बोतलें और किताबें जैसी वस्तुओं को पहचानने और उठाने के लिए एक संस्करण को प्रशिक्षित किया। हालांकि यह बहु-वस्तु वाला संस्करण एकल-वस्तु वाले संस्करण जितना सफल नहीं था, फिर भी यह विभिन्न स्थितियों में कार्य करने में सक्षम रहा, जिससे सिद्ध हुआ कि इस पद्धति को बढ़ाया जा सकता है। यह अध्ययन इस बात पर प्रकाश डालता है कि जबकि एक शिक्षक की नकल करना एक अच्छी शुरुआत है, लेकिन जटिल भौतिक कार्यों में महारत हासिल करने के लिए यह पर्याप्त नहीं है। दुनिया को समझने के लिए रोबोट को अपने सफलताओं और विफलताओं से स्वतंत्र रूप से अन्वेषण करने और सीखने की स्वतंत्रता की आवश्यकता होती है। व्यापक सिमुलेशन अभ्यास के साथ आत्म-सुधार के अंतिम चरण को जोड़कर, टीम ने एक स्पष्ट मार्ग दिखाया है जिससे ऐसे रोबोट बनाए जा सकें जो हर कदम पर मानव सहायता के बिना नए वातावरण के अनुकूल हो सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।