ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
ADEPТ एक बड़े पैमाने का सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो सामान्य कार्यों पर प्री-ट्रेनिंग करके और एक स्थिर पोस्ट-ट्रेनिंग रेसिपी का उपयोग करके उच्च-डिग्री-ऑफ-फ्रीडम वाले रोबोटों में मानव-स्तर की निपुणता के विकास को गति देता है, ताकि रॉ विज़ुओ-टैक्टाइल धारणा (visuo-tactile perception) से जटिल, दीर्घ-अवधि के हेरफेर कार्यों को हल करने के लिए ज़ीरो-शॉट सिम-टू-रियल स्थानांतरण को सक्षम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से कारखानों के उस्ताद रहे हैं, जो कारों को जोड़ने या बक्सों को एक के ऊपर एक रखने के लिए कठोर सटीकता के साथ चलते हैं। फिर भी, जब उन्हें दैनिक जीवन के तरल और नाजुक कार्यों को करने के लिए कहा जाता है—जैसे कि एक नाजुक अंडे को उठाना, उसे पलटना और फिर धीरे से एक कटोरे में रखना—तो अधिकांश मशीनें विफल हो जाती हैं। यह निपुणता (dexterity) की चुनौती है। इसके लिए एक रोबोट को एक साथ दर्जनों हिलते हुए हिस्सों को समन्वित करने की आवश्यकता होती है, और वस्तुओं के फिसलने, लुढ़कने या टकराने की अराजक भौतिकी को प्रबंधित करने के लिए वास्तविक समय में स्पर्श और दृष्टि पर प्रतिक्रिया देने की आवश्यकता होती है। वर्षों से, शोधकर्ताओं ने रोबोट को कठोर नियमों के साथ प्रोग्राम करके या उन्हें मानवीय प्रदर्शन दिखाकर ये कौशल सिखाने की कोशिश की है, लेकिन ये विधियाँ अक्सर तब विफल हो जाती हैं जब वातावरण में थोड़ा सा भी बदलाव होता है। हालाँकि, एक नया दृष्टिकोण सुझाव देता है कि रोबोटिक निपुणता का रहस्य रोबोट को हर विशिष्ट कार्य को शुरू से सिखाने में नहीं, बल्कि पहले उसे भौतिक दुनिया के साथ एक व्यापक, मौलिक अनुभव देने में निहित है।
एक टीम के शोधकर्ताओं ने ADEPT नामक एक नया ढांचा विकसित किया है जो रोबोट को वस्तुओं के "पुनः स्थिति निर्धारण" (repositioning) के एक सामान्य खेल में महारत हासिल करके जटिल हेरफेर कौशल सीखने के लिए प्रशिक्षित करता है। कल्पना कीजिए कि एक रोबोट हाथ एक आभासी दुनिया में महीनों बिताता है, जहाँ वह केवल यादृच्छिक आकृतियों—बेलनाकार, घन, गोले—को उठाता है और उन्हें मेज पर अलग-अलग जगहों पर ले जाता है। वह बिना किसी विशिष्ट लक्ष्य के, केवल उन्हें सफलतापूर्वक स्थानांतरित करने के लिए, वस्तुओं तक पहुँचने, पकड़ने, उठाने और घुमाने का कौशल सीखता है। यह चरण वस्तुओं के व्यवहार और रोबोट की अपनी उंगलियों को उन्हें नियंत्रित करने के लिए कैसे हिलना चाहिए, इसकी गहरी, सहज समझ विकसित करता है। एक बार यह आधार तैयार हो जाने के बाद, शोधकर्ता एक विशिष्ट नया कार्य पेश करते हैं, जैसे कि एक पेग (peg) को छेद में डालना या एक प्लेट को डिश रैक में रखना। शुरू से शुरू करने के बजाय, रोबोट अपने पूर्व अनुभव को एक मार्गदर्शक के रूप में उपयोग करता है। शोधकर्ताओं ने पाया कि यह विधि रोबोट को प्रारंभिक, अनाड़ी सीखने के चरण को छोड़ने और तुरंत अपने सामान्य कौशल को नई, विशिष्ट चुनौती पर लागू करने की अनुमति देती है।
इस दृष्टिकोण की शक्ति तब स्पष्ट हो जाती है जब रोबोट को ऐसे कार्य का सामना करना पड़ता है जिसे उसने पहले कभी नहीं देखा है। अपने प्रयोगों में, शोधकर्ताओं ने दो अलग-अलग रोबोट भुजाओं का परीक्षण किया जो मल्टी-फिंगर्ड हाथों से लैस थीं: एक जिसमें तेईस चलते हुए जोड़ थे और दूसरा जिसमें उनतीस। उन्होंने रोबोट को एक उच्च-सटीकता वाले सिमुलेशन में प्रशिक्षित किया जहाँ वे एक साथ हजारों परीक्षण चला सकते थे। रोबोट ने पहले विभिन्न सरल आकृतियों को पुनः व्यवस्थित करना सीखा। जब शोधकर्ताओं ने रोबोट को एक कठिन कार्य करने के लिए कहा—एक बोर्ड में पेग डालना, जो सटीक संरेखण और संपर्क बलों के प्रबंधन की मांग करता है—तो रोबोट ने शून्य से शुरुआत नहीं की। उन्होंने तुरंत पहुँचने, पकड़ने और उठाने की आवश्यकता को पहचान लिया, जो कौशल उन्होंने पहले ही मास्टर कर लिए थे। उन्हें केवल अंतिम, नाजुक प्रविष्टि (insertion) को सीखना था।
हालाँकि, केवल एक कार्य पर प्रशिक्षित रोबोट को लेकर उसे दूसरा कार्य करने के लिए कहना अक्सर उसके द्वारा सीखे गए ज्ञान को भुला देता है। शोधकर्ताओं ने पाया कि यदि वे रोबोट के व्यवहार को सीधे परिष्कृत (fine-tune) करने की कोशिश करते हैं, तो नए निर्देश पुराने कौशल को मिटा देते हैं, जिससे रोबोट पकड़ने या उठाने की अपनी क्षमता खो देता है। इसे हल करने के लिए, उन्होंने एक सावधानीपूर्वक प्रशिक्षण पद्धति विकसित की। सबसे पहले, उन्होंने एक ऐसी तकनीक का उपयोग किया जो रोबोट के नए व्यवहार को धीरे से पुराने, सफल व्यवहार जैसा बनाने के लिए प्रेरित करती है, जिससे यह सुनिश्चित होता है कि मूल कौशल बरकरार रहें। फिर, उन्होंने रोबोट की एक "अच्छे" चाल की समझ को धीरे-धीरे समायोजित किया, जिससे वह अपना संतुलन खोए बिना अनुकूलित हो सके। अंत में, उन्होंने रोबोट का एक दूसरा, सरल संस्करण प्रशिक्षित किया जो केवल कैमरों के माध्यम से देख सकता था और अपनी उंगलियों के माध्यम से महसूस कर सकता था, जिससे प्रशिक्षण के दौरान उपयोग किए जाने वाले आंतरिक डेटा को हटा दिया गया। इस "छात्र" रोबोट को फिर वास्तविक दुनिया में भेजा गया।
परिणाम आश्चर्यजनक थे। वास्तविक दुनिया में, ये रोबोट सफलतापूर्वक एक पेग को उठा सकते थे, उसे अपने हाथ में घुमा सकते थे और उसे छेद में डाल सकते थे, और यह सब केवल दृश्य और स्पर्श फीडबैक पर निर्भर करते हुए कर सकते थे। वे एक सममित (symmetric) स्टार के आकार के पेग और एक बहुत अधिक कठिन, असममित वर्गाकार-और-गोलाकार पेग, जिसे फिट होने के लिए एक सटीक ओरिएंटेशन की आवश्यकता होती है, दोनों को संभाल सकते थे। सिस्टम ने एक सपाट प्लेट को पकड़ने, उसे पलटने और उसे डिश रैक में रखने का क्रम भी सीखा, जो कि प्रारंभिक प्रशिक्षण में स्पष्ट रूप से नहीं दिखाया गया था। रोबोटों ने इन कार्यों को पांच से दस सेकंड में पूरा किया, जो मानव गति के तुल्य है, जबकि सरल ग्रिपर्स और बाहरी फिक्स्चर का उपयोग करने वाले पिछले तरीकों में इसमें बीस से सत्तर सेकंड लगते थे।
महत्वपूर्ण रूप से, शोधकर्ताओं ने पाया कि रोबोटों ने वस्तुओं को पकड़ने के प्राकृतिक, मानव जैसे तरीके विकसित किए। पेग को कैसे पकड़ना है, यह बताए बिना ही, रोबोटों ने इसे एक स्थिर, बहु-बिंदु ग्रिप में लपेटना सीखा, ठीक वैसे ही जैसे एक मानव हाथ। इसके विपरीत, जिन रोबोटों को प्रारंभिक पुन: स्थिति निर्धारण चरण के बिना प्रशिक्षित किया गया था, वे अक्सर वस्तु को पकड़ने के अजीब और अस्थिर तरीके विकसित करते थे जो एक क्षण के लिए तो काम करते थे लेकिन दबाव में विफल हो जाते थे। अध्ययन बताता है कि पहले वस्तुओं की भौतिकी के साथ एक व्यापक, सामान्य अनुभव देकर, एक रोबोट नए, विशिष्ट कौशल बहुत तेजी से और अधिक विश्वसनीयता के साथ सीख सकता है। यह दृष्टिकोण न केवल रोबोटों को तेज़ बनाता है; यह उन्हें अधिक मजबूत बनाता है, जिससे वे वास्तविक दुनिया की अप्रत्याशित प्रकृति को उस स्तर की निपुणता के साथ संभाल सकते हैं जो पहले पहुंच से बाहर थी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।