← नवीनतम पेपर
🤖 machine learning

CAPSULE: Control-Theoretic Action Perturbations for Safe Uncertainty-Aware Reinforcement Learning

CAPSULE एक सुरक्षित सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक ऑफलाइन सेटिंग में संभाव्य नियंत्रण-समान (control-affine) गतिकी मॉडल सीखता है और जटिल प्रणालियों में सुरक्षित अन्वेषण सुनिश्चित करने के लिए ऑनलाइन, बाधा-आधारित क्रिया सुधार हेतु अनिश्चितता-जागरूक कंट्रोल बैरियर फंक्शन्स (CBFs) का निर्माण करने के लिए इसका उपयोग करता है।

मूल लेखक: Rahul Narava, Siddharth Verma, Ojas Jain, Shashi Shekhar Jha, Mayank Shekhar Jha

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Rahul Narava, Siddharth Verma, Ojas Jain, Shashi Shekhar Jha, Mayank Shekhar Jha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छोटे बच्चे को साइकिल चलाना सिखा रहे हैं।

यदि आप उन्हें सिर्फ इतना कहते हैं, "तेज़ चलने की कोशिश करो, लेकिन टकराने से बचने की कोशिश करना," तो वे "टकराने से बचने की कोशिश करें" को केवल एक सुझाव के रूप में ले सकते हैं। वे शायद थोड़ा तेज़ चलें, डगमगाएँ, और अंततः किसी दीवार से टकरा जाएँ। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, अधिकांश रीइन्फोर्समेंट लर्निंग (RL) इसी तरह काम करता है: AI परीक्षण और त्रुटि (trial and error) के माध्यम से सीखता है, और "सुरक्षा" अक्सर केवल एक सांख्यिकीय उम्मीद होती है कि वह बहुत अधिक बार नहीं टकराएगा।

CAPSULE नामक शोध पत्र AI को सिखाने का एक बहुत ही स्मार्ट तरीका प्रस्तावित करता है। उसे सुरक्षा के बारे में केवल "सुझाव" देने के बजाय, यह AI को एक "सेफ्टी गार्डरेल" (Safety Guardrail) देता है जो उसे कोई भी खतरनाक कदम उठाने से भौतिक रूप से रोकता है।

यहाँ बताया गया है कि वे इसे कैसे करते हैं, रोज़मर्रा के उदाहरणों का उपयोग करते हुए:

1. "सपनों का सिम्युलेटर" (ऑफलाइन प्रीट्रेनिंग)

इससे पहले कि AI वास्तव में साइकिल को छुए, शोधकर्ता उसे एक "सपनों का सिम्युलेटर" देते हैं। वे उसे लोगों के साइकिल चलाने के हजारों वीडियो दिखाते हैं। AI इसका उपयोग भौतिकी (physics) के काम करने के तरीके के बारे में एक मानसिक मॉडल बनाने के लिए करता है: "यदि मैं हैंडल को बाईं ओर मोड़ता हूँ, तो साइकिल बाईं ओर झुकती है।"

महत्वपूर्ण रूप से, AI केवल यह नहीं सीखता कि क्या होगा; यह यह भी सीखता है कि वह कितना अनिश्चित (uncertain) है। यह कहना सीख जाता है, "मैं 99% सुनिश्चित हूँ कि बाईं ओर मुड़ने से काम बनेगा, लेकिन मैं इस बात को लेकर केवल 50% सुनिश्चित हूँ कि बजरी के पैच पर टकराने से क्या होगा।" यह एक ऐसे ड्राइवर की तरह है जो जानता है कि वह किन मोड़ों पर आश्वस्त है और कौन से मोड़ उसे घबराहट में डाल देते हैं।

2. "अदृश्य सुरक्षा बुलबुला" (कंट्रोल बैरियर फंक्शन्स)

यही इस शोध पत्र का मूल है। कल्पना कीजिए कि AI साइकिल चला रहा है, और वह निर्णय लेता है, "मैं उस तीखे मोड़ पर बहुत तेज़ गति से जाने वाला हूँ!"

मानक AI में, AI बस ऐसा करेगा और टकरा जाएगा। लेकिन CAPSULE में, साइकिल के चारों ओर एक अदृश्य "सुरक्षा बुलबुला" (तकनीकी रूप से जिसे कंट्रोल बैरियर फंक्शन कहा जाता है) होता है।

जैसे ही AI किसी खतरनाक स्थिति (जैसे ढलान या दीवार) के करीब पहुँचता है, वह बुलबुला पीछे की ओर धकेलता है। यह AI को चलाने से नहीं रोकता; यह बस अंतिम मिलीसेकंड में स्टीयरिंग व्हील या ब्रेक को हल्का सा मोड़ता (nudge) है ताकि साइकिल "सुरक्षित क्षेत्र" के भीतर रहे। यह एक पेशेवर ड्राइविंग इंस्ट्रक्टर को रखने जैसा है जिसके पास नियंत्रण का दूसरा सेट है जो केवल तभी हस्तक्षेप करता है जब वह देखता है कि आप सड़क से उतरने वाले हैं।

3. "स्मार्ट असिस्टेंट" (द कंपनसेटर)

शोधकर्ताओं ने महसूस किया कि यदि "सुरक्षा बुलबुला" लगातार हैंडल को झटके देता है, तो AI भ्रमित हो जाएगा और कभी भी सुचारू रूप से चलाना नहीं सीख पाएगा।

इसे ठीक करने के लिए, उन्होंने एक कंपनसेटर (Compensator) जोड़ा। इसे एक स्मार्ट असिस्टेंट के रूप में सोचें जो सुरक्षा बुलबुले पर नज़र रखता है। असिस्टेंट सीखता है, "हे, हर बार जब हम इस कोने पर पहुँचते हैं, तो सुरक्षा बुलबुले को ब्रेक लगाने के लिए धक्का देना पड़ता है। मैं ब्रेक को थोड़ा पहले ही दबाना शुरू कर दूँगा ताकि सवारी सुचारू हो सके और सुरक्षा बुलबुले को इतनी मेहनत न करनी पड़े।" यह AI को एक सुचारू, उच्च-प्रदर्शन वाला कौशल सीखने की अनुमति देता है जबकि सुरक्षा प्रणाली बैकग्राउंड में रहती है, किसी भी वास्तविक गलती को पकड़ने के लिए तैयार रहती है।

परिणाम: उच्च प्रदर्शन, कम जोखिम

प्रयोगों में (जंपिंग रोबोट या दौड़ते हुए चीते जैसे जटिल डिजिटल सिमुलेशन का उपयोग करके), शोधकर्ताओं ने पाया कि:

  • पुराने तरीके: अक्सर "लापरवाह" होकर उच्च स्कोर प्राप्त करते थे—उन्हें उच्च रिवॉर्ड मिलते थे लेकिन वे लगातार टकराते थे।
  • CAPSULE: समान उच्च स्कोर प्राप्त किया लेकिन बहुत कम दुर्घटनाओं के साथ।

संक्षेप में: CAPSULE AI को एक लापरवाह किशोर से बदलकर एक पेशेवर ड्राइवर बना देता है जो एक हाई-टेक, प्रेडिक्टिव सेफ्टी सिस्टम का उपयोग करता है, जो दुर्घटनाओं को होने से पहले ही रोकने के लिए सवारी को सुचारू बनाता रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →