Residual Reward Models: Leveraging Prior Knowledge for Efficient Preference-based Reinforcement Learning in Robotics
यह शोध पत्र रेसिडुअल रिवॉर्ड मॉडल्स (RRM) को प्रस्तुत करता है, जो एक ऐसी विधि है जो रिवॉर्ड फंक्शन को एक पूर्व ज्ञान घटक और एक सीखने योग्य रेसिडुअल ऑफसेट में विभाजित करती है ताकि रोबोटिक्स में प्राथमिकता-आधारित सुदृढीकरण शिक्षण (preference-based reinforcement learning) की सैंपल दक्षता और वास्तविक दुनिया की प्रयोज्यता को महत्वपूर्ण रूप से बढ़ाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक रोबोट को एक जटिल शारीरिक कार्य करने के लिए सिखाना, जैसे कि बटन दबाना या किसी नाजुक वस्तु को उठाना, इंजीनियरों के लिए एक कठिन पहेली है। रोबोटिक्स की दुनिया में, मशीन को निर्देशों के एक ऐसे सेट की आवश्यकता होती है जो इसे बताता है कि वह क्या अच्छा कर रहा है और वह क्या खराब कर रहा है। निर्देशों के इस सेट को 'रिवॉर्ड फंक्शन' (reward function) कहा जाता है। यदि निर्देश अस्पष्ट या गलत हैं, तो रोबोट सिस्टम को दरकिनार करने का तरीका ढूंढ सकता है, यानी कार्य को वास्तव में पूरा किए बिना ही उच्च स्कोर प्राप्त करने का कोई रास्ता निकाल सकता है, या यह भी हो सकता है कि वह हार मान ले क्योंकि वह समझ नहीं पाता कि उससे क्या अपेक्षा की जा रही है। पारंपरिक रूप से, मनुष्यों को ये निर्देश हाथ से लिखने पड़ते हैं, जिसमें वे इस बात का अनुमान लगाते हैं कि कौन सी गतिविधियाँ सफलता की ओर ले जाएंगी। यह प्रक्रिया धीमी, महंगी है, और अक्सर तब विफल हो जाती है जब रोबोट ऐसी स्थिति का सामना करता है जिसकी मनुष्यों ने कल्पना नहीं की थी।
एक नया दृष्टिकोण, जिसे 'प्रेफरेंस-बेस्ड लर्निंग' (preference-based learning) के रूप में जाना जाता है, इस समस्या को हल करने की कोशिश करता है। यह मनुष्यों को जटिल नियम लिखने के बजाय, केवल यह कहने की अनुमति देता है कि दो रोबोटिक गतिविधियों में से कौन सी बेहतर दिखती है। हालांकि यह सुनने में सरल लगता है, लेकिन यह एक नई समस्या पैदा करता है: रोबोट को कुछ भी उपयोगी सीखने के लिए हजारों ऐसे तुलनात्मक निर्णयों की आवश्यकता होती है। एक वास्तविक दुनिया के परिवेश में, किसी इंसान से बार-बार एक रोबोट को देखने और निर्णय लेने के लिए कहना अव्यावहारिक और महंगा है। रोबोट बहुत धीरे सीखता है, और मानव ध्यान की लागत एक ऐसी बाधा बन जाती है जो इन मशीनों को नियंत्रित लैब के बाहर उपयोगी बनने से रोक देती है।
टोरंटो विश्वविद्यालय और सिंघुआ विश्वविद्यालय के शोधकर्ताओं ने इस प्रक्रिया को काफी तेज करने के लिए एक विधि विकसित की है। वे अपने दृष्टिकोण को 'रेसिड्यूअल रिवॉर्ड मॉडल' (Residual Reward Model) कहते हैं। शून्य से शुरुआत करने और रोबol से यह पूछने के बजाय कि उसे सब कुछ कैसे करना है, यह विधि रोबोट को इस बात के साथ शुरू करने की अनुमति देती है कि कार्य कैसे किया जाना चाहिए, इसका एक "सबसे अच्छा अनुमान" (best guess) क्या है। यह अनुमान एक इंजीनियर द्वारा लिखे गए सरल नियम, एक लार्ज लैंग्वेज मॉडल द्वारा उत्पन्न विवरण, या यहाँ तक कि एक बार मानव को कार्य करते हुए देखकर सीखी गई रिवॉर्ड फंक्शन से आ सकता है। रोबोट फिर इस प्रारंभिक अनुमान को एक आधार के रूप में उपयोग करता है। जब कोई मानव प्राथमिकता प्रदान करता है, जैसे कि यह कहना कि "यह गति उस गति से बेहतर थी," तो रोबोट पूरे नियम पुस्तिका को फिर से लिखने की कोशिश नहीं करता है। इसके बजाय, वह केवल उस छोटे से अंतर या "रेसिड्यूअल" (residual) को सीखता है, जो प्रारंभिक अनुमान को सुधारने के लिए आवश्यक है।
इसे एक ऐसे छात्र की तरह समझें जिसे पहले से ही एक खेल के बुनियादी नियम पता हैं लेकिन उसे अपनी तकनीक की बारीकियों की ओर इशारा करने के लिए एक कोच की आवश्यकता है। छात्र को फिर से दौड़ना या फेंकना सीखने की आवश्यकता नहीं है; उसे केवल अपने कोच के फीडबैक के अनुसार अपने रूप (form) को थोड़ा समायोजित करने की आवश्यकता है। इसी तरह, रोबकल अपने पूर्व-मौजूदा कार्य की समझ में छोटे, सटीक समायोजन करने के लिए मानव फीडबैक का उपयोग करता है। यह संरचना सीखने की प्रक्रिया को स्थिर रखती है। यदि प्रारंभिक अनुमान त्रुटिपूर्ण है, तो भी रोबोट सीख सकता है क्योंकि उसे पूरी अवधारणा को शून्य से खोजने के बजाय केवल त्रुटियों को सुधारना होता है।
शोधकर्ताओं ने विभिन्न सिम्युलेटेड वातावरणों में इस विचार का परीक्षण किया, जिसमें कार्यों के समूह शामिल थे जहाँ एक रोबोटिक हाथ को बटन दबाना, वस्तुओं को बिन में झाड़ना, या दरवाजे खोलना था। उन्होंने प्रयोगशाला सेटिंग में एक वास्तविक भौतिक रोबोट, फ्रैंका पांडा (Franka Panda) आर्म पर भी इसका परीक्षण किया। हर मामले में, इस विधि ने जो "सबसे अच्छा अनुमान" और छोटे सुधारों का उपयोग करती थी, उसने उन विधियों की तुलना में बहुत तेजी से सीखा जो अकेले मानव प्राथमिकताओं से सब कुछ सीखने की कोशिश करती थीं। सिमुलेशन में, इस नई विधि का उपयोग करने वाले रोबोट ने कई कार्यों में पूर्ण सफलता दर प्राप्त की, जबकि इसके लिए बहुत कम मानव निर्णयों की आवश्यकता पड़ी। उदाहरण के लिए, एक कार्य में जहाँ रोबोट को बटन दबाना था, शून्य से सीखने की कोशिश करने वाली मानक विधि बीस प्रतिशत की सफलता दर पर रुक गई, जबकि नई विधि ने सौ प्रतिशत तक पहुँच बनाई।
अध्ययन ने यह भी दिखाया कि यह दृष्टिकोण गलतियों के प्रति मजबूत है। यदि प्रारंभिक "सबसे अच्छा अनुमान" थोड़ा गलत था, या यदि मानव फीडबैक कभी-कभी शोर युक्त या असंगत था, तो भी रोबोट सही व्यवहार सीख सकता था। प्रारंभिक अनुमान ने एक सुरक्षा जाल के रूप में कार्य किया, जिससे रोबोट बेकार व्यवहारों में भटकने से बच गया, जबकि सुधारों ने यह सुनिश्चित किया कि वह अंततः सही पथ खोज ले। यह विशेष रूप से महत्वपूर्ण था जब शोधकर्ताओं ने बहुत सीमित मानव फीडबैक के साथ सिस्टम का परीक्षण किया। यहाँ तक कि जब मानव को केवल बहुत कम संख्या में निर्णय देने के लिए कहा गया, तब भी रेसिड्यूअल विधि का उपयोग करने वाला रोबोट सुधार करता रहा, जबकि मानक विधि कुछ भी उपयोगी सीखने में विफल रही।
शायद सबसे महत्वपूर्ण बात यह है कि शोधकर्ताओं ने प्रदर्शित किया कि यह लर्निंग सीधे कंप्यूटर सिमुलेशन से एक वास्तविक भौतिक रोबोट में बिना किसी अतिरिक्त ट्यूनिंग के स्थानांतरित हो सकती है। उन्होंने एक वर्चुअल वातावरण में रोबोट को प्रशिक्षित किया और फिर सीखी गई पॉलिसी को एक वास्तविक फ्रैंका पांडा आर्म पर लागू किया ताकि वस्तु तक पहुँचने, ब्लॉक को धकेलने, या किसी चीज़ को उठाने और ले जाने जैसे कार्य किए जा सकें। रेसिड्यूअल विधि के साथ प्रशिक्षित रोबोट ने बेसलाइन विधि की तुलना में वास्तविक दुनिया के इन कार्यों में बहुत तेजी से सफलता प्राप्त की। एक कठिन कार्य में, जिसमें किसी वस्तु को धकेलना शामिल था, मानक विधि व्यापक प्रशिक्षण के बाद भी केवल आधी बार सफल हो पाई, जबकि नई विधि ने समान प्रशिक्षण समय के साथ पचानवे प्रतिशत सफलता दर हासिल की।
निष्कर्ष बताते हैं कि पूर्व ज्ञान को मानव फीडबैक के साथ जोड़कर, रोबोट पहले की तुलना में बहुत कम मानव पर्यवेक्षण के साथ जटिल शारीरिक कौशल सीख सकते हैं। इसका मतलब यह नहीं है कि रोब la पहले से ही सब कुछ जानता है, बल्कि यह है कि वह जो कुछ भी जानता है उसका उपयोग एक शुरुआती बिंदु के रूप में करता है ताकि उसे मिलने वाले प्रत्येक मानव फीडबैक का अधिकतम लाभ उठाया जा सके। यह दक्षता इन मशीनों को वास्तविक दुनिया की नौकरियों के लिए व्यावहारिक बनाने की दिशा में एक महत्वपूर्ण कदम हो सकती है, जहाँ समय और मानव ध्यान सीमित संसाधन हैं। यह कार्य पुष्टि करता है कि रोबोट को एक शुरुआत देना, भले ही वह कच्ची ही क्यों न हो, उसे मानव प्राथमिकताओं से सीखने में सक्षम बनाता है जो शून्य से शुरू करने की तुलना में बहुत तेज़ और अधिक विश्वसनीय है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।