From Pretraining to Proficiency: Real-World Subtask RL for Long-Horizon Manipulation with Minimal Human Intervention
यह शोध पत्र PARTS को प्रस्तुत करता है, जो एक वास्तविक दुनिया का सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो केवल महत्वपूर्ण उप-कार्य बाधाओं (subtask bottlenecks) पर मानवीय हस्तक्षेप पर ध्यान केंद्रित करके पूर्व-प्रशिक्षित रोबोट नीतियों को फाइन-ट्यून करता है, जिससे मौजूदा विधियों की तुलना में न्यूनतम मानवीय प्रयास के साथ दीर्घ-अवधि हेरफेर (long-horizon manipulation) की सफलता दर में उल्लेखनीय सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से उन कार्यों के लिए संघर्ष कर रहे हैं जिनमें सटीक चरणों की एक श्रृंखला की आवश्यकता होती है, जैसे कि एक डिब्बा खोलना, एक वस्तु को उठाना और उसे उसके अंदर रखना। वर्षों तक, इंजीनियरों ने रोबोट को एक पूरे काम को करने के हजारों उदाहरण दिखाकर सिखाने की कोशिश की, इस उम्मीद में कि मशीन एक ही बार में पूरी दिनचर्या सीख लेगी। हाल ही में, रोबोट के "मस्तिष्क" की एक नई पीढ़ी उभरी है। इन्हें वीडियो और डेटा के विशाल संग्रह पर प्रशिक्षित किया गया है, जिससे वे भाषा को समझने और विशिष्ट प्रशिक्षण के बिना कई अलग-अलग कार्य करने में सक्षम होते हैं। वे बुनियादी चीजों में आश्चर्यजनक रूप से अच्छे हैं: वे एक कप उठा सकते हैं, उसे मेज पर इधर-उधर रख सकते हैं, या एक दरवाजा खोल सकते हैं। हालांकि, जब वे एक लंबे, जटिल कार्य का सामना करते हैं जिसमें उच्च सटीकता की आवश्यकता होती है, तो ये सामान्य-उद्देश्य वाले रोबोट अक्सर कुछ विशिष्ट, कठिन क्षणों में लड़खड़ा जाते हैं। वे किसी वस्तु को सफलतापूर्वक पकड़ तो सकते हैं, लेकिन उसे गलत तरीके से पकड़ते हैं, जिससे अगला चरण विफल हो जाता है। वैज्ञानिकों के लिए चुनौती यह है कि वे रोबोट को वह सब कुछ फिर से सिखाने में समय बर्बाद किए बिना इन विशिष्ट कमजोर बिंदुओं को कैसे ठीक करें जो वह पहले से ही अच्छी तरह से जानता है।
शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए 'पार्ट्स' (PARTS) नामक एक नई विधि विकसित की है। पूरे कार्य को शुरू से अंत तक फिर से प्रशिक्षित करने के बजाय, उनका दृष्टिकोण विशेष रूप से उन क्षणों पर ध्यान केंद्रित करता है जहाँ रोबोट विफल होता है। कल्पना कीजिए कि एक रोबोट चार्जिंग केस खोल सकता है और उसे स्थिर रख सकता है, लेकिन बार-बार एक ईयरबड को छोटे से स्लॉट में डालने में विफल रहता है। शोधकर्ताओं ने इस विशिष्ट विफलता बिंदु को एक "बॉटलनेक" (bottleneck) के रूप में पहचाना। रोबोट को पूरी दिनचर्या बार-बार अभ्यास कराने के बजाय, उन्होंने रोबोट के सामान्य ज्ञान को फ्रीज कर दिया और केवल उस एक कठिन चरण के लिए एक छोटा, विशेष 'एड-ऑन' (add-on) प्रशिक्षित किया। यह एड-ऑन ठीक उसी समय रोबोट की गतिविधियों में सूक्ष्म, सटीक सुधार करने के लिए प्रशिक्षित होता है जब उनकी आवश्यकता होती है। यह प्रणाली एक कंप्यूटर प्रोग्राम का उपयोग करती है जो रोबोट को देखती है, निर्णय लेती है कि क्या वह एक कठिन चरण में प्रवेश कर रहा है, और विशेष सहायक को सक्रिय करती है। एक बार कठिन चरण पूरा हो जाने के बाद, नियंत्रण रोबोट के मूल, विश्वसनीय मस्तिष्क को वापस मिल जाता है। यह चक्र रोबोट को कठिन हिस्से का बार-बार अभ्यास करने की अनुमति देता है बिना किसी इंसान द्वारा दृश्य को रीसेट किए या उसकी गलतियों को सुधारे बिना।
शोधकर्ताओं ने वास्तविक रोबोट पर जटिल कार्य करते हुए, जैसे कि ईयरबड्स को केस में डालना, छोटे लेगो (LEGO) ब्रिक्स को छांटना और राउटर में केबल लगाना, इस पद्धति का परीक्षण किया। एक प्रयोग में, एक दो-हाथ वाले रोबoret के साथ, मूल संस्करण केवल 32% बार ही पूरे ईयरबड कार्य को पूरा कर सका। उनके लक्षित प्रशिक्षण पद्धति का उपयोग करने के बाद, सफलता दर बढ़कर 61% हो गई। एक अन्य परीक्षण में, जिसमें एक सिंगल-आर्म रोबोट केबल प्लग कर रहा था, सफलता दर 50% से उछलकर 95% हो गई। ये सुधार प्रति कार्य केवल कुछ दस मिनट के वास्तविक दुनिया के अभ्यास में हासिल किए गए। टीम ने अपने तरीके की तुलना प्रशिक्षण के अन्य तरीकों से की, जहाँ पूरे कार्य का शुरुआत से अभ्यास किया जाता है। उन अन्य तरीकों में रोबोट के समान समय की आवश्यकता थी लेकिन उनमें सफलता दर बहुत कम थी, और वे अक्सर रोबोट के प्रदर्शन में सुधार करने में भी विफल रहे। शोधकर्ताओं ने पाया कि केवल उन विशिष्ट चरणों पर ध्यान केंद्रित करके जहाँ रोबोट संघर्ष कर रहा था, वे कम प्रयास और कम मानवीय पर्यवेक्षण के साथ कहीं बेहतर परिणाम प्राप्त कर सके।
इस सफलता की कुंजी यह है कि यह प्रणाली विफलता को कैसे संभालती है। पारंपरिक प्रशिक्षण में, यदि कोई रोबोट लंबे कार्य के बिल्कुल अंतिम चरण में विफल होता है, तो उसे उन कई चरणों के लिए कोई श्रेय नहीं मिलता जो उसने सही किए थे, जिससे सीखना कठिन हो जाता है। नई प्रणाली कार्य को तोड़ देती है और केवल कठिन उप-चरण को सफलतापूर्वक पूरा करने के तुरंत बाद रोबोट को पुरस्कृत करती है। यदि रोबोट ईयरबड को सफलतापूर्वक डाल देता है, तो उसे तुरंत एक सकारात्मक संकेत मिलता है, भले ही केस अभी तक पूरी तरह से बंद न हुआ हो। यह बार-बार मिलने वाला फीडबैक रोबोट को तेजी से सीखने में मदद करता है। इसके अलावा, सिस्टम में अभ्यास डेटा को व्यवस्थित करने का एक स्मार्ट तरीका शामिल है। जब रोबोट अंततः एक कठिन चरण में सफल होता है, तो उस सफल प्रयास को सहेजा जाता है और विशेष सहायक को अधिक गहनता से पुनः प्रशिक्षित करने के लिए उपयोग किया जाता है, यह सुनिश्चित करने के लिए कि वह यह न भूल जाए कि क्या काम कर रहा था। यह प्रक्रिया स्वचालित रूप से होती है, जिसमें रोबोट खुद को रीसेट करता है या केवल तभी मानव हस्तक्षेप मांगता है जब वास्तव में आवश्यक हो, जैसे कि जब कोई वस्तु फर्श पर गिर जाती है।
यह अध्ययन दर्शाता है कि रोबोट को जटिल काम करने में बेहतर होने के लिए शून्य से फिर से प्रशिक्षित करने की आवश्यकता नहीं है। कुछ विशिष्ट क्षणों की पहचान करके जहाँ वे संघर्ष करते हैं और उन क्षणों पर केंद्रित, लक्षित अभ्यास लागू करके, इंजीनियर रोबोट की लंबी, कठिन कार्यों को पूरा करने की क्षमता को महत्वपूर्ण रूप से बढ़ा सकते हैं। यह दृष्टिकोण रोबोट की मौजूदा क्षमताओं का सम्मान करता है, जो हिस्से जो अच्छा काम करते हैं उन्हें वैसा ही रखते हुए कमजोर कड़ियों को मजबूत करता है। परिणाम एक व्यावहारिक मार्ग सुझाते हैं जिसे वास्तविक दुनिया के परिवेश में रोबोट तैनात करने के लिए उपयोग किया जा सकता है, जहाँ कार्य अक्सर लंबे होते हैं और जिनमें सामान्य कौशल और सटीक निष्पादन का मिश्रण आवश्यक होता है। शोधकर्ता निष्कर्ष निकालते हैं कि बाधाओं (bottlenecks) पर प्रयास केंद्रित करने की यह विधि रोबोट को अधिक कुशलता से सीखने की अनुमति देती है, जिसमें कम मानवीय हस्तक्षेप की आवश्यकता होती है और उच्च विश्वसनीयता प्राप्त होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।