← नवीनतम पेपर
💻 computer science

Passivity-Centric Safe Reinforcement Learning for Contact-Rich Robotic Tasks

यह शोध पत्र एक ऐसे ढांचे का प्रस्ताव करके संपर्क-समृद्ध रोबोटिक कार्यों में पारंपरिक सुदृढीकरण शिक्षण (reinforcement learning) की सुरक्षा और स्थिरता सीमाओं को संबोधित करता है जो ऊर्जा-आधारित बाधाओं के साथ पैसिविटी-अवेयर प्रशिक्षण और परिनियोजन के लिए एक पैसिविटी फिल्टर को एकीकृत करता है, जिससे नियंत्रण स्थिरता सुनिश्चित होती है और ऊर्जा दक्षता में सुधार होता है।

मूल लेखक: Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani

प्रकाशित 2026-09-03
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक रोबोटिक हाथ की कल्पना करें जो एक दीवार को छूने के लिए आगे बढ़ रहा है, उसे दूर धकेलने के लिए नहीं, बल्कि अंधेरे, घुमावदार भूलभुलैया में अपना रास्ता खोजने के लिए महसूस करने के लिए। यह 'कॉन्टैक्ट-रिच' (संपर्क-समृद्ध) रोबics की दुनिया है, जहाँ मशीनों को समस्याओं को हल करने के लिए अपने परिवेश के साथ भौतिक रूप से बातचीत करनी पड़ती है। वर्षों से, वैज्ञानिकों ने रोबोटों को यह सिखाने के लिए 'रीइन्फोर्समेंट लर्निंग' (सुदृढ़ीकरण शिक्षण) नामक एक शक्तिशाली उपकरण का उपयोग किया है। इसे एक डिजिटल 'ट्रायल-एंड-एरर' (प्रयास और त्रुटि) प्रक्रिया के रूप में समझें: रोबोट एक गति का प्रयास करता है, यदि वह सफल होता है तो उसे इनाम मिलता है, और वह अपनी गलतियों से सीखता है। हालांकि इस पद्धति ने कंप्यूटर सिमुलेशन में प्रभावशाली परिणाम दिए हैं, लेकिन इन रोबोटों को वास्तविक दुनिया में ले जाने में एक बड़ी बाधा बनी हुई है। एल्गोरिदम लक्ष्य तक पहुँचने का रास्ता खोजने में उत्कृष्ट हैं, लेकिन वे भौतिकी के एक मौलिक नियम को अक्सर अनदेखा कर देते हैं: ऊर्जा। यदि कोई रोबोट ऐसी रणनीति सीखता है जिसमें उसे अपने जोड़ों या वातावरण में बहुत अधिक ऊर्जा पंप करने की आवश्यकता होती है, तो वह अस्थिर हो सकता है, हिंसक रूप से हिल सकता है, या यहाँ तक कि खुद को और उन वस्तुओं को नुकसान पहुँचा सकता है जिन्हें वह छूता है। एक रोबोट की गतिविधियों को सुरक्षित और स्थिर बनाना केवल एक सैद्धांतिक चिंता नहीं है; यह उस किसी भी मशीन के लिए एक व्यावहारिक आवश्यकता है जो मनुष्यों के साथ काम करेगी।

जेनोआ, इटली के 'इस्टीट्यूटो इटालियानो डी टेक्नोलॉजी' के शोधकर्ताओं ने इस विशिष्ट समस्या को हल करने का बीड़ा उठाया। उन्होंने एक सरल लेकिन महत्वपूर्ण प्रश्न पूछा: क्या हम एक रोबोट को न केवल कार्य में कुशल बना सकते हैं, बल्कि ऊर्जा के उपयोग के संबंध में स्वाभाविक रूप से सुरक्षित भी बना सकते हैं? उनका कार्य 'पैसिविटी' (निष्क्रियता/पैसेविटी) नामक एक अवधारणा पर केंद्रित है। सरल शब्दों में, पैसिविटी का अर्थ है कि एक प्रणाली शून्य से ऊर्जा उत्पन्न नहीं कर सकती; यह केवल वही संग्रहीत कर सकती है जो उसे प्राप्त होती है या उसे नष्ट (dissipate) कर सकती है। एक 'पैसिव' रोबोट वह है जो एक अच्छी तरह से डैम्प्ड स्प्रिंग की तरह व्यवहार करता है, जो झटकों को बढ़ाने के बजाय उन्हें सोख लेता है। टीम ने पाया कि मानक रीइन्फोर्समेंट लर्निंग नीतियां, जो कार्य की सफलता को अधिकतम करने के लिए प्रशिक्षित की जाती हैं, अक्सर इस नियम का सम्मान करने में विफल रहती हैं। अपने प्रयोगों में, इन मानक नीतियों ने कार्यों को जल्दी से पूरा करना सीखा, लेकिन ऐसा करने के लिए उन्होंने ऐसे नियंत्रण कमांड उत्पन्न किए जिन्होंने ऊर्जा सीमाओं का उल्लंघन किया, जिससे वास्तविक दुनिया में तैनात होने पर अस्थिरता पैदा हुई।

इसे ठीक करने के लिए, शोधकर्ताओं ने एक नया दृष्टिकोण विकसित किया जो कृत्रिम बुद्धिमत्ता की सीखने की शक्ति को सख्त ऊर्जा नियमों के साथ जोड़ता है। उन्होंने एक ऐसी प्रणाली बनाई जिसमें दो अलग-अलग भाग मिलकर काम करते हैं। पहला भाग प्रशिक्षण चरण के दौरान होता है। यहाँ, उन्होंने रोबोट को "पैसिविटी-अवेयर" (निष्क्रियता के प्रति जागरूक) होना सिखाया। केवल रोबोट को भूलभुलैया के निकास तक पहुँचने के लिए पुरस्कृत करने के बजाय, उन्होंने इसमें अदृश्य बाधाएं जोड़ीं जो उसे बहुत अधिक ऊर्जा का उपयोग करने या अपनी कठोरता (stiffness) को बहुत तेज़ी से बदलने के लिए दंडित करती थीं। इसने रोबोट को हिलने-डुलने के अधिक किफायती तरीके सीखने, स्वाभाविक रूप से कोमल और अधिक स्थिर रणनीतियों को खोजने के लिए मजबूर किया। दूसरा भाग तब होता है जब रोबोट वास्तव में काम कर रहा होता है। बेहतर प्रशिक्षण के बावजूद, शोधकर्ता जानते थे कि एक कंप्यूटर प्रोग्राम अभी भी गलती कर सकता है। इसलिए, उन्होंने एक 'सेफ्टी फिल्टर' (सुरक्षा फ़िल्टर) जोड़ा, जो सुरक्षा की एक अंतिम परत है, जो रोबोट के मस्तिष्क और उसकी मांसपेशियों के बीच स्थित है। यह फ़िल्टर निरंतर ऊर्जा प्रवाह की निगरानी करता है। यदि रोबोट ऐसी चाल चलने की कोशिश करता है जो सिस्टम में बहुत अधिक ऊर्जा इंजेक्ट करेगी, तो फ़िल्टर स्वचालित रूप से उसे कम कर देता है, यह सुनिश्चित करता है कि रोबोट सुरक्षित सीमाओं के भीतर रहे।

टीम ने एक चुनौतीपूर्ण परिदृश्य में इस पद्धति का परीक्षण किया: एक भूलभुलैया अन्वेषण कार्य जहाँ एक रोबोटिक हाथ को दीवारों को छूकर अपना रास्ता खोजना था। उन्होंने चार अलग-अलग प्रकार के रोबोटों की तुलना की: एक जिसने ऊर्जा नियमों को पूरी तरह से अनदेखा किया, एक जिसे ऊर्जा के प्रति जागरूक होने के लिए प्रशिक्षित किया गया था लेकिन जिसमें सुरक्षा फ़िल्टर नहीं था, एक जिसमें सुरक्षा फ़िल्टर था लेकिन जिसे ऊर्जा नियमों के बिना प्रशिक्षित किया गया था, और अंत में, उनका नया तरीका जो ऊर्जा-जागरूक प्रशिक्षण और सुरक्षा फ़िल्टर दोनों को जोड़ता है। परिणाम स्पष्ट थे। बिना ऊर्जा नियमों के प्रशिक्षित रोबोट सिमुलेशन में भूलभुलैया पूरी कर सकता था, लेकिन जब उन्होंने इसे एक वास्तविक भौतिक रोबोट पर चलाने की कोशिश की, तो यह विफल रहा। यह बहुत आक्रामक तरीके से चला, मोड़ पर अत्यधिक बल लगाया, जिससे यह नियंत्रण खो बैठा। इसके विपरीत, ऊर्जा बाधाओं के साथ प्रशिक्षित रोबोटों ने अधिक रूढ़िवादी (conservative) तरीके से चलना सीखा। उन्हें प्रशिक्षण चरण के दौरान कार्य सीखने में थोड़ा अधिक समय लगा, लेकिन तैनात होने के बाद, वे बहुत अधिक विश्वसनीय थे।

जब शोधकर्ताओं ने सर्वश्रेष्ठ-प्रशिक्षित मॉडलों का वास्तविक दुनिया में परीक्षण किया, तो अंतर स्पष्ट था। उनका संयुक्त तरीका उपयोग करने वाला रोबिड भूलभुलैया को हर बार सफलतापूर्वक पूरा करता है, कभी भी बल सीमाओं का उल्लंघन नहीं करता या अपने ऊर्जा बजट से बाहर नहीं जाता है। मानक रोबोट, भले ही सुरक्षा फ़िल्टर द्वारा संरक्षित हो, संघर्ष करता है क्योंकि उसने मूल रूप से अपनी ऊर्जा को कुशलतापूर्वक प्रबंधित करना नहीं सीखा था। सुरक्षा फ़िल्टर अकेले एक आपदा को रोक सकता था, लेकिन यह रोबोट को कुशल नहीं बना सकता था। ऊर्जा-जागरूक प्रशिक्षण अकेले रोबोट को कुशल बना सकता था, लेकिन यह गारंटी नहीं दे सकता था कि यदि रोबोट अचानक, अप्रत्याशित त्रुटि करता है तो वह सुरक्षित रहेगा। केवल दोनों को मिलाकर ही उन्होंने एक ऐसी प्रणाली प्राप्त की जो सुरक्षित और कुशल दोनों थी। शोधकर्ताओं ने पाया कि सख्त ऊर्जा सीमाओं के साथ प्रशिक्षित रोबोट अपने ऊर्जा बजट का उपयोग बहुत धीरे-धीरे और समान रूप से करता है, जिससे उसे अपनी ऊर्जा समाप्त किए बिना जटिल मोड़ों और बाधाओं को संभालने में मदद मिलती है।

यह कार्य इस बात को रेखांकित करता है कि हम बुद्धिमान मशीनें कैसे बनाते हैं, इसमें एक महत्वपूर्ण बदलाव आया है। यह सुझाव देता है कि रोबोटों को हमारे भौतिक संसार में सुरक्षित रूप से काम करने के लिए, उन्हें केवल स्मार्ट होना ही नहीं सिखाया जाना चाहिए; उन्हें भौतिक रूप से जिम्मेदार भी होना सिखाया जाना चाहिए। ऊर्जा संरक्षण के नियमों को सीधे सीखने की प्रक्रिया में शामिल करके और इसे वास्तविक समय के सुरक्षा फ़िल्टर के साथ पुख्ता करके, शोधकर्ताओं ने ऐसी रोबोटिक्स का मार्ग दिखाया है जो न केवल सक्षम है बल्कि भरोसेमंद भी है। सात-जोड़ों वाले रोबोटिक हाथ पर उनके प्रयोगों ने सिद्ध किया है कि यह मशीन को भौतिक वास्तविकता में जमीन से जुड़े रहने वाले नियमों के मार्गदर्शन में, अपने स्वयं के अनुभव के माध्यम से ऊर्जा की सीमाओं को सीखते हुए, एक कठिन, संपर्क-प्रधान वातावरण में नेविगेट करना सिखाना संभव है। यह विधि दुनिया के जटिल गणितीय मॉडलों पर निर्भर नहीं है जो गलत हो सकते हैं; इसके बजाय, यह रोबोट द्वारा अनुभव के माध्यम से अपनी ऊर्जा की सीमाओं को सीखने पर निर्भर करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →