← नवीनतम पेपर
🤖 machine learning

Constraint-Enhanced Reinforcement Learning Based on Dynamic Decoupled Spherical Radial Squashing

यह शोध पत्र डायनेमिक डिकपल्ड स्फेरिक रेडियल स्क्वैशिंग (DD-SRad) को प्रस्तुत करता है, जो एक बाधा-संवर्धित सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो स्थिति-अनुकूलित, प्रति-जोड़ त्रिज्याओं की गणना करके विषम एक्चुएटर दर सीमाओं और समदैशिक बाधाओं के बीच ज्यामितीय बेमेल को हल करती है, जिससे शून्य बाधा उल्लंघन, सटीक ग्रेडिएंट बैकप्रोपैगेशन, और सिमुलेशन एवं उच्च-निष्ठा वाले ह्यूमनॉइड रोबोट परिनियोजन दोनों में उत्कृष्ट कार्य प्रदर्शन प्राप्त होता है।

मूल लेखक: Qijun Liao, Zhaoxin Yu, Jue Yang

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qijun Liao, Zhaoxin Yu, Jue Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो गेम कंट्रोलर का उपयोग करके एक रोबोट को चलना, नाचना या दौड़ना सिखा रहे हैं। वास्तविक दुनिया में, रोबोट के जोड़ों (जैसे घुटने, कूल्हे और टखने) की गति की कुछ भौतिक सीमाएँ होती हैं। यदि आप रोबोट के घुटने को एक स्थिति से दूसरी स्थिति में बहुत तेज़ी से झटके से जाने के लिए कहते हैं, तो उसका मोटर जल सकता है, या रोबोट लड़खड़ा कर गिर सकता है।

समस्या यह है कि हर जोड़ की एक अलग गति सीमा होती है। आपके रोबोट के कूल्हे (hips) मज़बूत और तेज़ हो सकते हैं, जो तेज़ी से हिल सकते हैं, जबकि उसके टखने (ankles) नाजुक और धीमे हो सकते हैं। यह एक ऐसी कार की तरह है जिसका इंजन तो ऊँची आरपीएम (RPM) तक जा सकता है, लेकिन पहिए कीचड़ में फंसे हुए हैं और केवल धीरे ही घूम सकते हैं।

समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) वाली गलती

रोबोट को सिखाने के पुराने तरीकों ने इन गति सीमाओं को संभालने के लिए पूरे रोबोट पर एक "ग्लोबल स्पीड कैप" (वैश्विक गति सीमा) लगाने की कोशिश की। कल्पना कीजिए कि आपके पास धावकों का एक समूह है: एक स्प्रिंटर (तेज़ दौड़ने वाला), एक मैराथन धावक और एक छोटा बच्चा। यदि आप उन सभी से कहते हैं, "आप केवल बच्चे जितनी तेज़ दौड़ सकते हैं," तो स्प्रिंटर को अनावश्यक रूप से रोक दिया जाता है। यदि आप उनसे कहते हैं, "जितनी हो सके उतनी तेज़ दौड़ो," तो बच्चा पीछे छूट जाएगा (या रोबोट के मामले में, वह टूट जाएगा)।

गणितीय शब्दों में, पेपर कहता है कि पुराने तरीकों ने अनुमत गतिविधियों के एक आयताकार बॉक्स के अंदर एक पूर्ण वृत्त (गोले) को फिट करने की कोशिश की।

  • बॉक्स: वास्तविक दुनिया का प्रतिनिधित्व करता है जहाँ कूल्हा बहुत अधिक हिल सकता है, लेकिन टखना थोड़ा ही हिल सकता है।
  • वृत्त: पुराने AI पद्धति का प्रतिनिधित्व करता है। यह उस बॉक्स के अंदर एक वृत्त को फिट करने की कोशिश करता है।
  • परिणाम: वृत्त बॉक्स के बड़े खाली कोनों को छोड़ देता है। रोबलेट को बताया जाता है कि वह अपने कूल्हे को उतनी तेज़ी से नहीं हिला सकता जितना कि वह शारीरिक रूप से कर सकता है, सिर्फ इसलिए ताकि "वृत्त" सुरक्षित रहे। यह रोबोट की क्षमता को बर्बाद करता है।

समाधान: DD-SRad (डायनामिक डिकपल्ड स्फेरिक रेडियल स्क्वैशिंग)

लेखकों ने DD-SRad नामक एक नई विधि बनाई है। इसे प्रत्येक उंगली (जोड़) के लिए एक स्मार्ट, समायोज्य दस्ताने (adjustable glove) देने के रूप में समझें।

पूरे हाथ के लिए एक बड़े नियम के बजाय, DD-SRad प्रत्येक उंगली के लिए एक विशिष्ट "गति सीमा" की गणना करता है जो निम्नलिखित पर आधारित है:

  1. वह विशिष्ट उंगली कितनी तेज़ी से हिलने की अनुमति है।
  2. वह उंगली वर्तमान में कहाँ स्थित है।

यदि रोबोट का कूल्हा ऐसी स्थिति में है जहाँ वह सुरक्षित रूप से तेज़ी से हिल सकता है, तो "दस्ताना" उसे जाने देता है। यदि टखना अपनी सीमा के करीब है, तो "दस्ताना" केवल उस टखने के लिए कस जाता है।

उपमा (Analogy):
कल्पना कीजिए कि आप एक बहुत ही संवेदनशील एक्सीलेटर और भारी ब्रेक वाली कार चला रहे हैं।

  • पुरानी विधि: आप एक्सीलेटर के नीचे लकड़ी का एक ब्लॉक रख देते हैं ताकि आप उसे 1 इंच से अधिक न दबा सकें। यह आपको सुरक्षित रखता है, लेकिन आप तब भी तेज़ नहीं हो सकते जब रास्ता साफ़ हो।
  • DD-SRad: आपके पास एक स्मार्ट पेडल है जो आपकी वर्तमान गति और सड़क की स्थिति के आधार पर जानता है कि आप इसे कितनी ज़ोर से दबा सकते हैं। यह आपको सुरक्षित होने पर पूरी रफ़्तार से जाने देता है, लेकिन दीवार के करीब आने पर धीरे से गति कम कर देता है।

यह क्यों महत्वपूर्ण है (परिणाम)

पेपर का परीक्षण डिजिटल रोबोटों (MuJoCo नामक सिम्युलेटर में) और वास्तविक मानवॉइड (Unitree H1 और G1) के उच्च-सटीकता वाले सिमुलेशन पर किया गया।

  1. शून्य टूटे हुए जोड़: यह विधि गारंटी देती है कि रोबोट कभी भी किसी जोड़ को उसकी सीमा से अधिक तेज़ी से हिलने के लिए नहीं कहेगा। यह 100% सुरक्षा गारंटी है।
  2. अधिकतम प्रदर्शन: क्योंकि यह तेज़ जोड़ों को रोकने में बाधा नहीं डालता है, रोबोटों ने पहले की विधियों की तुलना में बेहतर और तेज़ी से हिलना सीखा। परीक्षणों में, उन्होंने बिना किसी नियम को तोड़े उच्चतम संभव स्कोर प्राप्त किए।
  3. बेहतर कवरेज: पेपर का दावा है कि यह विधि पुराने "वृत्त" (circle) तरीकों की तुलना में 30% से 50% अधिक संभावित गतिविधियों को कवर करती है। यह बॉक्स के उन कोनों को भर देती है जो पहले खाली थे।
  4. कोई धीमापन नहीं: अन्य विधियों के विपरीत जिन्हें सुरक्षा जांचने के लिए हर चरण में जटिल गणितीय गणनाओं (समीकरणों को हल करने) की आवश्यकता होती है, DD-SRad एक सरल सूत्र के साथ इसे तुरंत करता है। यह वास्तविक समय के नियंत्रण (real-time control) के लिए पर्याप्त तेज़ है।

मुख्य निष्कर्ष (The Bottom Line)

पेपर का तर्क है कि वास्तविक दुनिया में रोबोट को सुरक्षित और फुर्तीला बनाने के लिए, हमें सभी जोड़ों के साथ एक जैसा व्यवहार करना बंद करना होगा। प्रत्येक जोड़ को उसकी अपनी कस्टम "गति सीमा" देकर जो रोबोट के हिलने के साथ बदलती रहती है, हम नुकसान के जोखिम के बिना रोबोट की पूरी क्षमता को अनलॉक कर सकते हैं। लेखकों ने सफलतापूर्वक इसे सिम्युलेटेड मानवॉइड पर प्रदर्शित किया है, जो एक रोबोट के तकनीकी मैनुअल (डेटाशीट) से एक सुरक्षित रूप से तैनात, उच्च-प्रदर्शन वाली मशीन तक का स्पष्ट मार्ग दिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →