Passivity-Centric Safe Reinforcement Learning for Contact-Rich Robotic Tasks
यह शोध पत्र एक ऐसे ढांचे का प्रस्ताव करके संपर्क-समृद्ध रोबोटिक कार्यों में पारंपरिक सुदृढीकरण शिक्षण (reinforcement learning) की सुरक्षा और स्थिरता सीमाओं को संबोधित करता है जो ऊर्जा-आधारित बाधाओं के साथ पैसिविटी-अवेयर प्रशिक्षण और परिनियोजन के लिए एक पैसिविटी फिल्टर को एकीकृत करता है, जिससे नियंत्रण स्थिरता सुनिश्चित होती है और ऊर्जा दक्षता में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक रोबोटिक हाथ की कल्पना करें जो एक दीवार को छूने के लिए आगे बढ़ रहा है, उसे दूर धकेलने के लिए नहीं, बल्कि अंधेरे, घुमावदार भूलभुलैया में अपना रास्ता खोजने के लिए महसूस करने के लिए। यह 'कॉन्टैक्ट-रिच' (संपर्क-समृद्ध) रोबics की दुनिया है, जहाँ मशीनों को समस्याओं को हल करने के लिए अपने परिवेश के साथ भौतिक रूप से बातचीत करनी पड़ती है। वर्षों से, वैज्ञानिकों ने रोबोटों को यह सिखाने के लिए 'रीइन्फोर्समेंट लर्निंग' (सुदृढ़ीकरण शिक्षण) नामक एक शक्तिशाली उपकरण का उपयोग किया है। इसे एक डिजिटल 'ट्रायल-एंड-एरर' (प्रयास और त्रुटि) प्रक्रिया के रूप में समझें: रोबोट एक गति का प्रयास करता है, यदि वह सफल होता है तो उसे इनाम मिलता है, और वह अपनी गलतियों से सीखता है। हालांकि इस पद्धति ने कंप्यूटर सिमुलेशन में प्रभावशाली परिणाम दिए हैं, लेकिन इन रोबोटों को वास्तविक दुनिया में ले जाने में एक बड़ी बाधा बनी हुई है। एल्गोरिदम लक्ष्य तक पहुँचने का रास्ता खोजने में उत्कृष्ट हैं, लेकिन वे भौतिकी के एक मौलिक नियम को अक्सर अनदेखा कर देते हैं: ऊर्जा। यदि कोई रोबोट ऐसी रणनीति सीखता है जिसमें उसे अपने जोड़ों या वातावरण में बहुत अधिक ऊर्जा पंप करने की आवश्यकता होती है, तो वह अस्थिर हो सकता है, हिंसक रूप से हिल सकता है, या यहाँ तक कि खुद को और उन वस्तुओं को नुकसान पहुँचा सकता है जिन्हें वह छूता है। एक रोबोट की गतिविधियों को सुरक्षित और स्थिर बनाना केवल एक सैद्धांतिक चिंता नहीं है; यह उस किसी भी मशीन के लिए एक व्यावहारिक आवश्यकता है जो मनुष्यों के साथ काम करेगी।
जेनोआ, इटली के 'इस्टीट्यूटो इटालियानो डी टेक्नोलॉजी' के शोधकर्ताओं ने इस विशिष्ट समस्या को हल करने का बीड़ा उठाया। उन्होंने एक सरल लेकिन महत्वपूर्ण प्रश्न पूछा: क्या हम एक रोबोट को न केवल कार्य में कुशल बना सकते हैं, बल्कि ऊर्जा के उपयोग के संबंध में स्वाभाविक रूप से सुरक्षित भी बना सकते हैं? उनका कार्य 'पैसिविटी' (निष्क्रियता/पैसेविटी) नामक एक अवधारणा पर केंद्रित है। सरल शब्दों में, पैसिविटी का अर्थ है कि एक प्रणाली शून्य से ऊर्जा उत्पन्न नहीं कर सकती; यह केवल वही संग्रहीत कर सकती है जो उसे प्राप्त होती है या उसे नष्ट (dissipate) कर सकती है। एक 'पैसिव' रोबोट वह है जो एक अच्छी तरह से डैम्प्ड स्प्रिंग की तरह व्यवहार करता है, जो झटकों को बढ़ाने के बजाय उन्हें सोख लेता है। टीम ने पाया कि मानक रीइन्फोर्समेंट लर्निंग नीतियां, जो कार्य की सफलता को अधिकतम करने के लिए प्रशिक्षित की जाती हैं, अक्सर इस नियम का सम्मान करने में विफल रहती हैं। अपने प्रयोगों में, इन मानक नीतियों ने कार्यों को जल्दी से पूरा करना सीखा, लेकिन ऐसा करने के लिए उन्होंने ऐसे नियंत्रण कमांड उत्पन्न किए जिन्होंने ऊर्जा सीमाओं का उल्लंघन किया, जिससे वास्तविक दुनिया में तैनात होने पर अस्थिरता पैदा हुई।
इसे ठीक करने के लिए, शोधकर्ताओं ने एक नया दृष्टिकोण विकसित किया जो कृत्रिम बुद्धिमत्ता की सीखने की शक्ति को सख्त ऊर्जा नियमों के साथ जोड़ता है। उन्होंने एक ऐसी प्रणाली बनाई जिसमें दो अलग-अलग भाग मिलकर काम करते हैं। पहला भाग प्रशिक्षण चरण के दौरान होता है। यहाँ, उन्होंने रोबोट को "पैसिविटी-अवेयर" (निष्क्रियता के प्रति जागरूक) होना सिखाया। केवल रोबोट को भूलभुलैया के निकास तक पहुँचने के लिए पुरस्कृत करने के बजाय, उन्होंने इसमें अदृश्य बाधाएं जोड़ीं जो उसे बहुत अधिक ऊर्जा का उपयोग करने या अपनी कठोरता (stiffness) को बहुत तेज़ी से बदलने के लिए दंडित करती थीं। इसने रोबोट को हिलने-डुलने के अधिक किफायती तरीके सीखने, स्वाभाविक रूप से कोमल और अधिक स्थिर रणनीतियों को खोजने के लिए मजबूर किया। दूसरा भाग तब होता है जब रोबोट वास्तव में काम कर रहा होता है। बेहतर प्रशिक्षण के बावजूद, शोधकर्ता जानते थे कि एक कंप्यूटर प्रोग्राम अभी भी गलती कर सकता है। इसलिए, उन्होंने एक 'सेफ्टी फिल्टर' (सुरक्षा फ़िल्टर) जोड़ा, जो सुरक्षा की एक अंतिम परत है, जो रोबोट के मस्तिष्क और उसकी मांसपेशियों के बीच स्थित है। यह फ़िल्टर निरंतर ऊर्जा प्रवाह की निगरानी करता है। यदि रोबोट ऐसी चाल चलने की कोशिश करता है जो सिस्टम में बहुत अधिक ऊर्जा इंजेक्ट करेगी, तो फ़िल्टर स्वचालित रूप से उसे कम कर देता है, यह सुनिश्चित करता है कि रोबोट सुरक्षित सीमाओं के भीतर रहे।
टीम ने एक चुनौतीपूर्ण परिदृश्य में इस पद्धति का परीक्षण किया: एक भूलभुलैया अन्वेषण कार्य जहाँ एक रोबोटिक हाथ को दीवारों को छूकर अपना रास्ता खोजना था। उन्होंने चार अलग-अलग प्रकार के रोबोटों की तुलना की: एक जिसने ऊर्जा नियमों को पूरी तरह से अनदेखा किया, एक जिसे ऊर्जा के प्रति जागरूक होने के लिए प्रशिक्षित किया गया था लेकिन जिसमें सुरक्षा फ़िल्टर नहीं था, एक जिसमें सुरक्षा फ़िल्टर था लेकिन जिसे ऊर्जा नियमों के बिना प्रशिक्षित किया गया था, और अंत में, उनका नया तरीका जो ऊर्जा-जागरूक प्रशिक्षण और सुरक्षा फ़िल्टर दोनों को जोड़ता है। परिणाम स्पष्ट थे। बिना ऊर्जा नियमों के प्रशिक्षित रोबोट सिमुलेशन में भूलभुलैया पूरी कर सकता था, लेकिन जब उन्होंने इसे एक वास्तविक भौतिक रोबोट पर चलाने की कोशिश की, तो यह विफल रहा। यह बहुत आक्रामक तरीके से चला, मोड़ पर अत्यधिक बल लगाया, जिससे यह नियंत्रण खो बैठा। इसके विपरीत, ऊर्जा बाधाओं के साथ प्रशिक्षित रोबोटों ने अधिक रूढ़िवादी (conservative) तरीके से चलना सीखा। उन्हें प्रशिक्षण चरण के दौरान कार्य सीखने में थोड़ा अधिक समय लगा, लेकिन तैनात होने के बाद, वे बहुत अधिक विश्वसनीय थे।
जब शोधकर्ताओं ने सर्वश्रेष्ठ-प्रशिक्षित मॉडलों का वास्तविक दुनिया में परीक्षण किया, तो अंतर स्पष्ट था। उनका संयुक्त तरीका उपयोग करने वाला रोबिड भूलभुलैया को हर बार सफलतापूर्वक पूरा करता है, कभी भी बल सीमाओं का उल्लंघन नहीं करता या अपने ऊर्जा बजट से बाहर नहीं जाता है। मानक रोबोट, भले ही सुरक्षा फ़िल्टर द्वारा संरक्षित हो, संघर्ष करता है क्योंकि उसने मूल रूप से अपनी ऊर्जा को कुशलतापूर्वक प्रबंधित करना नहीं सीखा था। सुरक्षा फ़िल्टर अकेले एक आपदा को रोक सकता था, लेकिन यह रोबोट को कुशल नहीं बना सकता था। ऊर्जा-जागरूक प्रशिक्षण अकेले रोबोट को कुशल बना सकता था, लेकिन यह गारंटी नहीं दे सकता था कि यदि रोबोट अचानक, अप्रत्याशित त्रुटि करता है तो वह सुरक्षित रहेगा। केवल दोनों को मिलाकर ही उन्होंने एक ऐसी प्रणाली प्राप्त की जो सुरक्षित और कुशल दोनों थी। शोधकर्ताओं ने पाया कि सख्त ऊर्जा सीमाओं के साथ प्रशिक्षित रोबोट अपने ऊर्जा बजट का उपयोग बहुत धीरे-धीरे और समान रूप से करता है, जिससे उसे अपनी ऊर्जा समाप्त किए बिना जटिल मोड़ों और बाधाओं को संभालने में मदद मिलती है।
यह कार्य इस बात को रेखांकित करता है कि हम बुद्धिमान मशीनें कैसे बनाते हैं, इसमें एक महत्वपूर्ण बदलाव आया है। यह सुझाव देता है कि रोबोटों को हमारे भौतिक संसार में सुरक्षित रूप से काम करने के लिए, उन्हें केवल स्मार्ट होना ही नहीं सिखाया जाना चाहिए; उन्हें भौतिक रूप से जिम्मेदार भी होना सिखाया जाना चाहिए। ऊर्जा संरक्षण के नियमों को सीधे सीखने की प्रक्रिया में शामिल करके और इसे वास्तविक समय के सुरक्षा फ़िल्टर के साथ पुख्ता करके, शोधकर्ताओं ने ऐसी रोबोटिक्स का मार्ग दिखाया है जो न केवल सक्षम है बल्कि भरोसेमंद भी है। सात-जोड़ों वाले रोबोटिक हाथ पर उनके प्रयोगों ने सिद्ध किया है कि यह मशीन को भौतिक वास्तविकता में जमीन से जुड़े रहने वाले नियमों के मार्गदर्शन में, अपने स्वयं के अनुभव के माध्यम से ऊर्जा की सीमाओं को सीखते हुए, एक कठिन, संपर्क-प्रधान वातावरण में नेविगेट करना सिखाना संभव है। यह विधि दुनिया के जटिल गणितीय मॉडलों पर निर्भर नहीं है जो गलत हो सकते हैं; इसके बजाय, यह रोबोट द्वारा अनुभव के माध्यम से अपनी ऊर्जा की सीमाओं को सीखने पर निर्भर करती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।