← नवीनतम पेपर
💻 computer science

Safe Execution of RL Policies Via Acceleration-Based CBF-QP Constraint Enforcement for Real-World Robotic Deployments

यह शोध पत्र Acc-CBF-QP को प्रस्तुत करता है, जो एक त्वरण-आधारित क्वाड्रेटिक प्रोग्राम (Quadratic Program) सुरक्षा फ़िल्टर है जो प्रशिक्षण में बदलाव किए बिना वास्तविक दुनिया के रोबोटिक परिनियोजन में सुदृढीकरण शिक्षण (reinforcement learning) नीतियों पर जॉइंट पोजीशन, वेलोसिटी, टॉर्क और टकराव संबंधी बाधाओं को लागू करता है, जिससे Unitree H1 और Kinova Gen3 जैसे हार्डवेयर पर कार्य प्रदर्शन को बनाए रखते हुए सुरक्षा उल्लंघनों को महत्वपूर्ण रूप से कम किया जाता है।

मूल लेखक: Bastien Muraccioli, Alice Cariou, Pierre-Alexandre Leziart, Mathieu Celerier, Arnaud Demont, Gentiane Venture, Mehdi Benallegue

प्रकाशित 2026-07-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bastien Muraccioli, Alice Cariou, Pierre-Alexandre Leziart, Mathieu Celerier, Arnaud Demont, Gentiane Venture, Mehdi Benallegue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट कठोर नियमों के साथ प्रोग्राम किए जाने के बजाय, एक छोटे बच्चे के चलने सीखने की तरह, 'परीक्षण और त्रुटि' (trial and error) के खेल के माध्यम से चलना सीखते हैं। यह रीइन्फोर्समेंट लर्निंग (Reinforcement Learning - RL) का क्षेत्र है। इस डिजिटल खेल के मैदान में, एक रोबोट लाखों क्रियाएं आज़माता है, सफलता के लिए "पॉइंट्स" प्राप्त करता है और विफलता के लिए "जुर्माना" झेलता है, और अंततः अविश्वसनीय चपलता के साथ दौड़ने, कूदने या वस्तुओं को पकड़ने का तरीका सीख जाता है। हालाँकि, इसमें एक पेंच है: जबकि ये AI मस्तिष्क नए करतब सीखने में बहुत कुशल हैं, वे अपनी सीमाओं को जानने में बहुत खराब हैं। यदि आप किसी सीखने वाले रोबोट को बहुत तेज़ दौड़ने या बहुत दूर तक पहुँचने के लिए कहते हैं, तो वह अपना हाथ मरोड़ सकता है या दीवार से टकरा सकता है क्योंकि उसने अभी तक परिणामों से डरना नहीं सीखा है।

इन रोबोटों को सुरक्षित रखने के लिए, इंजीनियर अक्सर कंट्रोल बैरियर फंक्शन्स (Control Barrier Functions - CBFs) का उपयोग करते हैं। इन्हें एक अदृश्य, अटूट बल क्षेत्र (force field) या एक "गार्जियन एंजल" एल्गोरिदम के रूप में समझें जो लगातार यह जाँचता रहता है कि क्या रोबोट कुछ खतरनाक करने वाला है। यदि रोबोट एक रेखा पार करने की कोशिश करता है, तो गार्जियन हस्तक्षेप करता है और उसे धीरे से (या बिना किसी नरमी के) वापस सुरक्षा की ओर धकेलता है। सबसे बड़ी चुनौती हमेशा सीखने वाले रोबोट की जंगली रचनात्मकता और सुरक्षा गार्जियन के सख्त नियमों को इस तरह जोड़ने की रही है जिससे रोबोट की गति धीमी न हो या उसका मस्तिष्क खराब न हो जाए।

यह शोध पत्र एक चतुर समाधान पेश करता है जिसे Acc-CBF-QP कहा जाता है, जो रोबोटिक लर्निंग के लिए एक वास्तविक समय के रेफरी (referee) के रूप में कार्य करता है। शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो रोबोट के "मस्तिष्क" (RL पॉलिसी) और उसके "मांसपेशियों" (मोटर्स) के बीच स्थित है। जब रोबोट का मस्तिष्क एक ऐसा कमांड भेजता है जो नियम तोड़ने जैसा दिखता है—जैसे कि किसी जोड़ (joint) को बहुत तेज़ी से घुमाना या दीवार से टकराना—तो यह सुरक्षा फ़िल्टर तुरंत उस कमांड की पुनर्गणना करता है। यह रोबोट को रोकता नहीं है; इसके बजाय, यह सबसे करीबी संभव सुरक्षित गति खोजता है जो अभी भी वैसा ही दिखता है जैसा कि रोबोट करना चाहता था।

टीम ने दो बहुत अलग रोबोटों पर इसका परीक्षण किया: एक 7-भुजाओं वाला मैकेनिकल आर्म (Kinova Gen3) और एक 19-जोड़ों वाला ह्यूमनाइड रोबोट (Unitree H1)। उन्होंने पाया कि इस फ़िल्टर के बिना, रोबोट लगातार सुरक्षा नियमों को तोड़ रहे थे। वास्तविक ह्यूमनाइड रोबोट पर, अनफ़िल्टर्ड AI ने हर सेकंड लगभग 10 बार सुरक्षा उल्लंघन किए। लेकिन जब उन्होंने Acc-CBF-QP फ़िल्टर जोड़ा, तो वे उल्लंघन 92% कम होकर प्रति सेकंड एक से भी कम रह गए। मैकेनिकल आर्म पर, यह फ़िल्टर इतना प्रभावी था कि इसने सभी उल्लंघनों को पूरी तरह से समाप्त कर दिया।

महत्वपूर्ण रूप से, शोधकर्ताओं ने पाया कि इस सुरक्षा जाल ने रोबोटों को अनाड़ी नहीं बनाया। जब रोबोट अपने सामान्य कार्यों को बिना किसी खतरे के क्षेत्र में टकराए कर रहे थे, तो फ़िल्टर ने उन्हें बिल्कुल वैसे ही चलने दिया जैसा कि AI चाहता था, बिना किसी प्रदर्शन हानि के। यहाँ तक कि जब रोबोटों को आक्रामक गति कमांड के साथ उनकी सीमाओं तक धकेला गया, तब भी फ़िल्टर ने उन्हें टकराने या बंद होने से बचाया, जिससे वे अपने दम पर रहने की तुलना में बहुत अधिक समय तक जीवित रह सके। शोध पत्र सुझाव देता है कि यह विधि तब भी काम करती है जब रोबोट का अपने शरीर का आंतरिक मानचित्र (map) सटीक नहीं होता, क्योंकि इसमें एक विशेष "डिस्टर्बेंस ऑब्जर्वर" (disturbance observer) है जो यह अनुमान लगाता है कि बाहरी बल रोबोट को कैसे धकेल रहे हैं।

लेखकों ने फ़िल्टर द्वारा रोबोट के कमांड की व्याख्या करने के दो अलग-अलग तरीकों की भी तुलना की: एक जो ठीक उसी बल (टॉर्क) से मेल खाने पर केंद्रित था जिसे रोबोट उपयोग करना चाहता था, और दूसरा जो गति (त्वरण/acceleration) के सटीक मिलान पर केंद्रित था। उन्होंने पाया कि "फोर्स-मैचिंग" (बल-मिलान) संस्करण अधिक मजबूत था जब रोबोट का भौतिक मॉडल थोड़ा गलत था, जबकि "स्पीड-मैचिंग" (गति-मिलान) संस्करण थोड़ा बेहतर था जब मॉडल एकदम सटीक था। हालाँकि, वास्तविक दुनिया में, जहाँ मॉडल कभी भी पूर्ण नहीं होते, फोर्स-मैचिंग दृष्टिकोण अधिक विश्वसनीय साबित हुआ।

संक्षेप में, यह शोध पत्र यह दावा नहीं करता है कि इसने रोबोटिक्स की सभी सुरक्षा समस्याओं को हल कर दिया है, न ही यह कहता है कि शुरुआत से ही रोबोट को सुरक्षित बनाना एक बुरा विचार है। इसके बजाय, यह एक व्यावहारिक, प्लग-एंड-प्ले टूल प्रदान करता है जिसे किसी भी मौजूदा रोबोट AI के चारों ओर लपेटा जा सकता है, जिससे इसे बिना AI को फिर से प्रशिक्षित किए वास्तविक हार्डवेयर पर तैनात करना सुरक्षित हो जाता है। यह सीखने वाले रोबोटों की जंगली, लचीली दुनिया और भौतिक दुनिया की सख्त, निर्दयी वास्तविकता के बीच के अंतर को पाटता है, और यह सिद्ध करता है कि आप उच्च प्रदर्शन और सख्त सुरक्षा दोनों एक साथ प्राप्त कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →