← नवीनतम पेपर
🤖 machine learning

A Survey of Safe Reinforcement Learning and Constrained MDPs: A Technical Survey on Single-Agent and Multi-Agent Safety

यह तकनीकी सर्वेक्षण कंस्ट्रेंड एमडीपी (Constrained MDPs) पर आधारित सेफ रिइन्फोर्समेंट लर्निंग और मल्टी-एजेंट सेफ आरएल का एक गणितीय रूप से कठोर अवलोकन प्रदान करता है, जो सैद्धांतिक नींव और अत्याधुनिक एल्गोरिदम की समीक्षा करते हुए भविष्य की प्रगति को निर्देशित करने के लिए पांच खुले अनुसंधान प्रस्ताव रखता है।

मूल लेखक: Ankita Kushwaha, Kiran Ravish, Preeti Lamba, Pawan Kumar

प्रकाशित 2026-04-30
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ankita Kushwaha, Kiran Ravish, Preeti Lamba, Pawan Kumar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: एक रोबोट को बिना टकराए गाड़ी चलाना सिखाना

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। आप चाहते हैं कि वह जितनी जल्दी हो सके किराने के सामान की दुकान तक पहुँचे (यह है Reward/इनाम)। लेकिन आपके पास एक सख्त नियम भी है: उसे कभी भी किसी पैदल यात्री से नहीं टकराना चाहिए।

मानक सुदृढीकरण शिक्षण (Standard Reinforcement Learning - RL) में, रोबोट 'परीक्षण और त्रुटि' (trial and error) के माध्यम से सीखता है। वह शायद भीड़ के बीच से निकलने की कोशिश कर सकता है ताकि वह जल्दी पहुँच सके, और गलती से किसी पैदल यात्री से टकरा सकता है, और फिर सीख सकता है कि "ठीक है, ऐसा नहीं करना है।" वास्तविक दुनिया में, वह "ओह! गलती हो गई" वाला क्षण विनाशकारी हो सकता है।

सेफ रिइन्फोर्समेंट लर्निंग (SafeRL) वह क्षेत्र है जो यह सुनिश्चित करने के लिए समर्पित है कि रोबोट कभी भी टकराकर न सीखे। यह रोबोट को कार चलाते समय सीटबेल्ट पहनने, एक सह-पायलट रखने और एक सख्त नियम पुस्तिका का पालन करने के साथ-साथ सिखाने जैसा है।

यह शोध पत्र शोधकर्ताओं के लिए एक विशाल "मानचित्र" या "सर्वेक्षण" है। यह उन सभी विभिन्न तरीकों को व्यवस्थित करता है जिनका उपयोग वैज्ञानिक इस समस्या को हल करने के लिए कर रहे हैं, जो दो मुख्य क्षेत्रों पर केंद्रित हैं:

  1. सिंगल-एजेंट (Single-Agent): एक रोबोट जो अपने आप सीख रहा है।
  2. मल्टी-एजेंट (Multi-Agent/SafeMARL): रोबड़ों की एक पूरी टीम (जैसे ड्रोन का झुंड या सेल्फ-ड्राइविंग कारों का बेड़ा) जो एक-दूसरे से टकराए बिना मिलकर काम करना सीख रही है।

भाग 1: नियम पुस्तिका (Constrained MDPs)

यह पेपर बताता है कि सुरक्षा के बारे में गणितीय रूप से बात करने का सबसे अच्छा तरीका कन्स्ट्रेंड मार्कोव डिसीजन प्रोसेस (Constrained Markov Decision Process - CMDP) है।

एक मानक सीखने की समस्या को एक वीडियो गेम की तरह समझें जहाँ आप बस उच्चतम स्कोर चाहते हैं। एक CMDP वही गेम है, लेकिन इसमें एक "हेल्थ बार" और एक "जीवन सीमा" (Life Limit) भी है।

  • लक्ष्य: उच्चतम स्कोर प्राप्त करना (Reward)।
  • प्रतिबंध (Constraint): आप 3 हार्ट (Hearts) से अधिक नहीं खो सकते (Cost)। यदि आप 4 हार्ट खो देते हैं, तो गेम समाप्त हो जाता है, और आप विफल हो जाते हैं।

यह पेपर "हेल्थ बार" (सुरक्षा प्रतिबंधों) के विभिन्न प्रकारों को स्पष्ट करता है जिनका उपयोग शोधकर्ता करते हैं:

  • इंस्टेंटेनियस कंस्ट्रेंट्स (Instantaneous Constraints): "आप अभी दीवार को नहीं छू सकते।" (जैसे एक रोबोटिक हाथ जो बहुत अधिक मुड़ नहीं सकता)।
  • क्यूमुलेटिव कंस्ट्रेंट्स (Cumulative Constraints): "आप दीवार को कुछ बार छू सकते हैं, लेकिन पूरी यात्रा के दौरान आपका कुल नुकसान कम रहना चाहिए।" (जैसे ईंधन के लिए बजट)।
  • प्रोबेबिलिटी कंस्ट्रेंट्स (Probability Constraints): "आपके पास खाई में गिरने की 99% संभावना नहीं है।" (एक छोटा जोखिम स्वीकार करना, लेकिन बड़ा नहीं)।
  • रिस्क मेजर्स (Risk Measures): "भले ही औसत जोखिम कम हो, हम ऐसा परिदृश्य नहीं चाहते जहाँ रोबोट नष्ट हो जाए।" (सबसे खराब स्थिति पर ध्यान केंद्रित करना)।

भाग 2: उपकरण (रोबोट को कैसे सिखाएं)

यह पेपर उन "उपकरणों" की समीक्षा करता है जिनका उपयोग शोधकर्ता प्रशिक्षण के दौरान रोबोट को सुरक्षित रखने के लिए करते हैं। वे तीन मुख्य श्रेणियों में आते हैं:

1. "प्राइस टैग" विधि (Lagrangian Optimization)

कल्पना कीजिए कि रोबोट के पास एक बटुआ है। हर बार जब वह असुरक्षित कार्य करता है, तो उसे जुर्माना भरना पड़ता है।

  • यह कैसे काम करता है: रोबोट अपने स्कोर में से जुर्माने को घटाकर अधिकतम करने की कोशिश करता है।
  • चुनौती: यदि रोबot नियम तोड़ता रहता है, तो "प्राइस टैग" (जुर्माना) बढ़ता जाता है जब तक कि रोबोट फिर से नियम तोड़ने से डरने न लगे।
  • पेपर का दृष्टिकोण: यह एक लोकप्रिय विधि है, लेकिन यह पेचीदा है। यदि जुर्माना बहुत कम है, तो रोबोट टकरा जाएगा। यदि यह बहुत अधिक है, तो रोबोट डर जाएगा और हिलना-डुलना भी बंद कर देगा।

2. "सेफ्टी शील्ड" (Action Correction)

कल्पना कीजिए कि रोबोट गाड़ी चला रहा है, लेकिन एक मानवीय सुरक्षा अधिकारी बगल वाली सीट पर बैठा है।

  • यह कैसे काम करता है: रोबोट दीवार की ओर मुड़ने का निर्णय लेता है। सुरक्षा अधिकारी यह देखता है, स्टीयरिंग व्हील को पकड़ता है, और इसे दाईं ओर मोड़ देता है। रोबोट वास्तव में दीवार से नहीं टकराता।
  • पेपर का दृष्टिकोण: यह प्रशिक्षण के दौरान शून्य टक्करों की गारंटी देने का एकमात्र तरीका है। यह किसी भी ऐसे कदम को रोकने के लिए गणित (जैसे "सेफ्टी फिल्टर्स") का उपयोग करता है जो खतरनाक लग सकता है।

3. "ट्रस्ट रीजन" (CPO)

कल्पना कीजिए कि रोबोट कदम उठा रहा है। मानक लर्निंग कहता है, "तेजी से सीखने के लिए एक बड़ी छलांग लगाओ!" सेफ लर्निंग कहता है, "छोटे, सतर्क कदम उठाओ।"

  • यह कैसे काम करता है: रोबोट को एक बार में अपने व्यवहार को थोड़ा सा बदलने की अनुमति है। वह यह सुनिश्चित करने के लिए अपने गणित की जांच करता है कि इस छोटे से बदलाव के साथ भी वह अनजाने में सुरक्षा नियमों को नहीं तोड़ देगा।
  • पेपर का दृष्टिकोण: यह बहुत सुरक्षित है लेकिन गणनात्मक रूप से भारी है (हर छोटे कदम की गणना करने में बहुत अधिक दिमागी शक्ति लगती है)।

भाग 3: टीम का खेल (Safe Multi-Agent Learning)

यह पेपर SafeMARL (Multi-Agent) पर काफी समय बिताता है। यह तब होता है जब आपके पास 100 ड्रोन उड़ रहे हों।

समस्या: एजेंट A सुरक्षित हो सकता है, और एजेंट B सुरक्षित हो सकता है, लेकिन यदि वे दोनों एक ही समय में चलते हैं, तो वे एक-दूसरे से टकरा सकते हैं।

  • सेंट्रलाइज्ड अप्रोच (Centralized Approach): एक "दिमाग" सभी 100 ड्रोनों को नियंत्रित करता है। वह सब कुछ देखता है और सुनिश्चित करता है कि कोई टक्कर न हो।
    • लाभ: बहुत सुरक्षित।
    • हानि: यदि "दिमाग" पर बोझ बढ़ जाए या इंटरनेट कट जाए, तो पूरी टीम विफल हो जाती है।
  • डीसेंट्रलाइज्ड अप्रोच (Decentralized Approach): प्रत्येक ड्रोन केवल अपने पड़ोसियों को देखता है। उन्हें टकराव से बचने के लिए एक-दूसरे से बात करनी पड़ती है।
    • लाभ: यह आसानी से स्केल हो सकता है (आप 1,000 ड्रोन जोड़ सकते हैं)।
    • हानि: यह साबित करना कठिन है कि वे टकराएंगे नहीं। यदि ड्रोन A को यह नहीं पता कि ड्रोन B क्या कर रहा है, तो वे टकरा सकते हैं।

पेपर इस बात पर प्रकाश डालता है कि जबकि हमारे पास एक रोबोट के लिए अच्छे तरीके हैं, एक पूरी टीम को सुरक्षित रहने के लिए सिखाना अभी भी एक बड़ा, अनसुलझा पहेली है।


भाग 4: पाँच बड़ी रहस्यमय बातें (Open Research Problems)

लेखक पाँच "होली ग्रेल" समस्याओं की सूची के साथ निष्कर्ष निकालते हैं जिन्हें शोधकर्ताओं को आगे हल करने की आवश्यकता है। इन्हें SafeRL के "लेवल बॉस" के रूप में सोचें:

  1. "जीरो-वाइलेशन" लक्ष्य (The Zero-Violation Goal): क्या हम एक रोबोट को बिना कभी भी सुरक्षा नियम तोड़े सीखना सिखा सकते हैं? वर्तमान में, अधिकांश रोबोट सीखते समय कुछ नियम तोड़ते हैं। हमें एक ऐसा तरीका चाहिए जो पहले दिन से ही शून्य गलतियों की गारंटी दे सके।
  2. "आंखों पर पट्टी बंधा" रोबोट (The Blindfolded Robot): क्या होगा यदि रोबोट सब कुछ नहीं देख सकता? (जैसे एक कार जो कोने के पार नहीं देख सकती)। जब वह अनुमान लगा रहा हो कि क्या हो रहा है, तो हम उसे सुरक्षित कैसे रख सकते हैं?
  3. "बिना बॉस वाली" टीम (The No Boss Team): हम एक केंद्रीय नियंत्रक के बिना एक रोबोट टीम को सुरक्षित कैसे बना सकते हैं? (विकेंद्रीकृत सुरक्षा)।
  4. "प्रतिद्वंद्वी" टीम (The Rival Team): क्या होगा यदि अन्य एजेंट दोस्त नहीं हैं? (प्रतिस्पर्धी सेटिंग्स)। आप सुरक्षित कैसे रहते हैं जब दूसरी टीम आपको हराने की कोशिश कर रही हो, और वे खतरनाक चीजें कर सकते हैं?
  5. "चलता हुआ लक्ष्य" (The Moving Target): क्या होगा यदि रोबोट के सीखते समय नियम बदल जाते हैं? (Non-stationarity)। यदि सड़क का लेआउट बदल जाता है या नए प्रकार की कारें आती हैं, तो क्या रोबोट बिना टकराए तुरंत अनुकूलित हो सकता है?

सारांश

यह पेपर शोधकर्ताओं के लिए एक मार्गदर्शिका है। यह कहता है:

  • हमारे पास अच्छा गणित है (CMDPs) सुरक्षा को समझाने के लिए।
  • हमारे पास अच्छे उपकरण हैं (Shields, Price Tags, Trust Regions) एकल रोबोट को सुरक्षित रखने के लिए।
  • लेकिन हम अभी शुरुआत कर रहे हैं यह समझने में कि रोबोट की टीमों को सुरक्षित कैसे रखा जाए, खासकर जब वे प्रतिस्पर्धा कर रहे हों या जब वे सब कुछ नहीं देख सकते।

अंतिम लक्ष्य AI को "टकराकर सीखने" से "सावधानी बरतकर सीखने" की ओर ले जाना है, ताकि हम अपने अस्पतालों, सड़कों और कारखानों में रोबोटों पर भरोसा कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →