← नवीनतम पेपर
💻 computer science

CALOS: Control-Affine Lyapunov On-manifold Safety Layer for Safe Deep Reinforcement Learning for Quadrotors

यह शोध पत्र CALOS को प्रस्तुत करता है, जो एक रियल-टाइम, कंट्रोल-एफिन लयापुनोव-आधारित सुरक्षा परत (safety layer) है जो एक कुशलतापूर्वक हल होने वाले क्वाड्रेटिक प्रोग्राम के माध्यम से क्वाड्रोटर एटीट्यूड बाधाओं को लागू करता है, जिससे अंतर्निहित पॉलिसी को संशोधित किए बिना सुरक्षा उल्लंघनों को समाप्त करना, ट्रैकिंग त्रुटियों को कम करना और डीप रिइन्फोर्समेंट लर्निंग अभिसरण (convergence) को तेज करना संभव होता है।

मूल लेखक: Fabrizio Cesareo, Sebastiano Mengozzi, Nicola Mimmo, Andrea Acquaviva

प्रकाशित 2026-09-17
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Fabrizio Cesareo, Sebastiano Mengozzi, Nicola Mimmo, Andrea Acquaviva

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: CALOS – कंट्रोल-एफिन लिआपुनोव ऑन-मैनिफोल्ड सेफ्टी लेयर

समस्या विवरण
डीप रिइन्फोर्समेंट लर्निंग (DRL) ने क्वाड्रोटर को नियंत्रित करने में महत्वपूर्ण क्षमता प्रदर्शित की है, फिर भी सीखी गई नीतियां प्रशिक्षण या तैनाती के दौरान सुरक्षा बाधाओं (safety constraints) के संबंध में औपचारिक गारंटी की कमी रखती हैं। मौजूदा सुरक्षित DRL दृष्टिकोण एक निरंतर तनाव का सामना करते हैं: कंस्ट्रेंड मार्कोव डिसीजन प्रोसेस (CMDPs) सीखने को अस्थिर कर सकते हैं, जबकि रनटाइम फिल्टर (शील्डिंग या कंट्रोल बैरियर फंक्शन्स) अक्सर ग्रेडिएंट सिग्नल को खराब कर देते हैं यदि वे क्रियाओं को बहुत आक्रामक तरीके से ठीक करते हैं। इसके अलावा, वर्तमान वास्तुशिल्प सीमाएं कई सुरक्षा प्रमाणों (safety certificates) के संयुक्त अनुकूलन को रोकती हैं। ATACOM जैसी विधियां क्रियाओं को बाधा मैनिफोल्ड पर प्रोजेक्ट करती हैं लेकिन रोटेशनल डिसिपेशन के लिए ऊर्जा-आधारित प्रमाणों की कमी रखती हैं, जबकि लिआपुनोव-आधारित विधियां अक्सर बाधाओं को स्वतंत्र रूप से मानती हैं, जिससे एक बाधा को संतुष्ट करने के प्रयास में दूसरी बाधा के उल्लंघन का जोखिम बना रहता है। इन विधियों का अनुक्रमिक संयोजन (sequential composition) संयुक्त व्यवहार्यता (joint feasibility) की गारंटी देने में विफल रहता है, विशेष रूप से जब बड़े ट्रैकिंग एरर के लिए अधिकतम नियंत्रण अधिकार की आवश्यकता होती है, क्योंकि अनुक्रमिक स्केलिंग अक्सर इसे शून्य कर देती है।

कार्यप्रणाली
यह शोध पत्र CALOS (कंट्रोल-एफिन लिआपुनोव ऑन-मैनिफोल्ड सेफ्टी) का प्रस्ताव करता है, जो एक रनटाइम सुरक्षा परत है जो मानक DRL नीति (विशेष रूप से प्रॉक्सिमल पॉलिसी ऑप्टिमाइजेशन, PPO) के ऊपर पारदर्शी रूप से कार्य करती है, बिना अंतर्निहित लर्निंग एल्गोरिदम को बदले। CALOS टिल्ट बाधाओं और एक लिआपुनोव स्थिरता स्थिति को एक एकल क्वाड्रेटिक प्रोग्राम (QP) में एकीकृत करता है ताकि नाममात्र टॉर्क आउटपुट के न्यूनतम-नॉर्म सुधार की गणना की जा सके।

  1. टिल्ट बाधाएं (प्रेडिक्टिव टिल्ट प्रोजेक्शन):
    रोटेशनल सिंगुलैरिटीज़ से बचने के लिए एटीट्यूड को बॉडी फ्रेम में ग्रेविटी वेक्टर (gbg_b) द्वारा दर्शाया गया है। सिम्प्लेक्टिक यूलर डिसक्रेटाइजेशन का उपयोग करके, भविष्य के ग्रेविटी वेक्टर को कंट्रोल टॉर्क के एक एफाइन फंक्शन के रूप में मॉडल किया गया है। यह फॉर्मूलेशन रोल और पिच सीमाओं (ϕmax=θmax=60\phi_{max} = \theta_{max} = 60^\circ) को चार रैखिक असमानताओं (APTPτbPTPA_{PTP}\tau \le b_{PTP}) के रूप में लागू करने की अनुमति देता है।

  2. लिआपुनोव बाधा (Lyapunov Constraint):
    टिल्ट एरर और एंगुलर वेलोसिटी के आधार पर एक लिआपुनोव कैंडिडेट फंक्शन V(x)V(x) को परिभाषित किया गया है। लेयर एक क्षय स्थिति V˙cV\dot{V} \le -cV को लागू करती है, जो रोटेशनल डायनेमिक्स की कंट्रोल-एफिन प्रकृति के कारण, एक एकल रैखिक असमानता (ALτbLA_L\tau \le b_L) में बदल जाती है। यह रोटेशनल एनर्जी डिसिपेशन सुनिश्चित करता है।

  3. एकीकृत फॉर्मूलेशन (Unified Formulation):
    अनुक्रमिक दृष्टिकोणों के विपरीत, जो पहले टिल्ट प्रोजेक्शन लागू करते हैं और फिर लिआपुनोव स्केलिंग करते हैं (जो बड़े एरर होने पर टॉर्क को शून्य कर सकता है), CALOS पांच रैखिक बाधाओं (चार टिल्ट, एक लिआपुनोव) को एक एकल सिस्टम में जोड़ता है। सुरक्षा परत हल करती है:
    τ=argminτR312ττ02सर्त (s.t.)A(x)τb(x) \tau^\star = \arg \min_{\tau \in \mathbb{R}^3} \frac{1}{2} \|\tau - \tau_0\|^2 \quad \text{सर्त (s.t.)} \quad A(x)\tau \le b(x)
    जहाँ τ0\tau_0 नीति से प्राप्त नाममात्र टॉर्क है।

  4. सॉल्वर (Solvers):

  • CALOS-P: एक डैम्प्ड स्यूडो-इनवर्स करेक्शन का उपयोग करके एक प्रोजेक्टेड एप्रोक्सिमेशन। यह सभी बाधाओं को संयुक्त रूप से लागू करता है, सटीक न्यूनतम-नॉर्म समाधान की गारंटी दिए बिना, और बड़े पैमाने पर समानांतर प्रशिक्षण के लिए गति को प्राथमिकता देता है।
  • CALOS-QP: एक सटीक सॉल्वर जो तीन-आयामी टॉर्क स्पेस का लाभ उठाता है। यह सटीक न्यूनतम-नॉर्म समाधान खोजने के लिए सभी संभावित एक्टिव सेट्स (26 उम्मीदवार) को सूचीबद्ध करता है जो कारुश-कुहन-टकर (KKT) स्थितियों को पूरा करते हैं। यदि कोई व्यवहार्य समाधान मौजूद नहीं है, तो सिस्टम अनकरेक्टेड पॉलिसी एक्शन और एक्चुएटर क्लैम्पिंग के साथ बैकअप लेता है।

मुख्य योगदान

  • एकीकृत सुरक्षा परत: एक एकल QP स्टेप में टिल्ट बाधाओं और लिआपुनोव स्थिरता को संयुक्त रूप से अनुकूलित करने वाली पहली रनटाइम लेयर, जो अनुक्रमिक संयोजन की व्यवहार्यता समस्याओं से बचती है।
  • रियल-टाइम स्केलेबिलिटी: सटीक सॉल्वर (CALOS-QP) आधुनिक व्यापक रूप से समानांतर DRL प्रशिक्षण की आवश्यकता के अनुरूप, हजारों समानांतर सिमुलेशन वातावरणों में चलने के लिए पर्याप्त रूप से कुशल है।
  • प्रशिक्षण प्रक्षेप पथों पर शून्य उल्लंघन: यह विधि बाधाओं को प्रशिक्षण के दौरान सख्ती से लागू करती है, जिससे एजेंट को असुरक्षित स्टेट स्पेस क्षेत्रों में जाने से रोका जाता है।

प्रायोगिक परिणाम
NVIDIA Isaac Lab में ट्राजेक्टरी-ट्रैकिंग कार्यों पर मूल्यांकन किया गया, जहाँ CALOS की तुलना अनकंस्ट्रेंड PPO, स्टैंडअलोन टिल्ट प्रोजेक्शन (PTP), स्टैंडअलोन लिआपुनोव स्केलिंग, और दोनों के अनुक्रमिक कैस्केड से की गई।

  • ट्रैकिंग प्रदर्शन: CALOS-P और CALOS-QP ने प्रशिक्षण प्रक्षेप पथों पर अनकंस्ट्रेंड PPO बेसलाइन की तुलना में लेटरल ट्रैकिंग एरर को 55–60% कम कर दिया। बड़े प्रारंभिक स्थिति ऑफसेट वाले अनदेखे प्रक्षेप पथों पर, CALOS वेरिएंट्स ने एरर को 0.08 मीटर से नीचे बनाए रखा, जबकि लिआपुनोव और कैस्केड विधियां टॉर्क न्यूलिफिकेशन के कारण ट्रैकिंग करने में विफल रहीं।
  • सुरक्षा मेट्रिक्स: प्रशिक्षण प्रक्षेप पथ पर, CALOS-QP ने शून्य एटीट्यूड-कंस्ट्रेंट उल्लंघन प्राप्त किया। अत्यधिक प्रारंभिक ऑफसेट के तहत, उल्लंघन CALOS-P के लिए अधिकतम 3 लगातार स्टेप्स और CALOS-QP के लिए 9 स्टेप्स तक सीमित थे, जबकि अनुक्रमिक विधियों के लिए यह 27 स्टेप्स तक था।
  • अभिसरण और डेटा दक्षता (Convergence and Data Efficiency): अन्वेषण (exploration) को सुरक्षित क्षेत्रों तक सीमित करके, CALOS ने प्रशिक्षण अभिसरण को तेज किया।
  • आंतरिक व्यवहार (Internalized Behavior): CALOS के साथ प्रशिक्षित नीतियां सुरक्षा लेयर को अक्षम (disable) करने पर भी सुरक्षित और सटीक व्यवहार बनाए रखती हैं, जो PPO-प्रशिक्षित नीतियों की तुलना में 55-74% कम लेटरल एरर दिखाती हैं। यह दर्शाता है कि नीति ने सुरक्षा बाधाओं को सफलतापूर्वक आत्मसात कर लिया है।

महत्व
यह शोध पत्र दावा करता है कि CALOS सुरक्षा प्रवर्तन और सीखने की दक्षता के बीच के व्यापार-बंद (trade-off) को हल करता है। सुरक्षा को एक एकल, निम्न-आयामी QP के रूप में स्वरूपित करके, यह सुनिश्चित करता है कि ग्रेडिएंट सिग्नल आक्रामक, अनुक्रमिक सुधारों द्वारा खराब न हो। यह विधि नीति को सुरक्षित मैनिफोल्ड के भीतर इष्टतम व्यवहार सीखने की अनुमति देती है, जिसके परिणामस्वरूप ट्रैकिंग प्रदर्शन से समझौता किए बिना स्वाभाविक रूप से सुरक्षित और अधिक डेटा-कुशल नीतियां प्राप्त होती हैं। लेखकों ने उल्लेख किया कि QP व्यवहार्य सेट सभी परीक्षणों में गैर-रिक्त (non-empty) रहा, जो संयुक्त फॉर्मूलेशन की मजबूती की पुष्टि करता है।

भावी कार्य
लेखक भविष्य के अनुसंधान के लिए तीन दिशाएं पहचानते हैं:

  1. गैर-शून्य लेकिन व्यवहार्य संदर्भ एटीट्यूड को ट्रैक करने के लिए सीखे गए, कार्य-जागरूक लिआपुनोव प्रमाणों (learned, task-aware Lyapunov certificates) को विकसित करना।
  2. फ्रेमवर्क को गैर-कंट्रोल-एफिन डायनेमिक्स (जैसे कि रोटर-स्पीड डायनेमिक्स या ब्लेड-फ्लैपिंग प्रभाव शामिल मॉडल) तक विस्तारित करना।
  3. भौतिक हार्डवेयर पर मॉडल अनिश्चितता को संभालने के लिए डोमेन रैंडमाइजेशन और डेटा-संचालित सुरक्षा फिल्टर का उपयोग करके सिम-टू-रियल ट्रांसफर की जांच करना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →