← नवीनतम पेपर
🤖 machine learning

Boundary-Seeking Policy Gradient for Safe Reinforcement Learning

यह शोध पत्र बाउंड्री-सीकिंग पॉलिसी ग्रेडिएंट (BSPG) प्रस्तुत करता है, जो सुरक्षित सुदृढीकरण शिक्षण (सेफ रीइन्फोर्समेंट लर्निंग) के लिए एक प्रथम-क्रम विधि है, जो स्पर्शरेखीय रिवॉर्ड आरोहण (टैन्जेंशियल रिवॉर्ड एसेंट) को एक हस्ताक्षरित अभिलंब घटक (साइंड नॉर्मल कंपोनेंट) के साथ जोड़कर नीतियों को सक्रिय सुरक्षा बाधाओं की ओर स्पष्ट रूप से निर्देशित करता है, जिससे KKT शर्तों को संतुष्ट करते हुए मौजूदा बेसलाइनों की तुलना में उच्च रिवॉर्ड और अधिक सटीक सीमा अनुपालन प्राप्त होता है।

मूल लेखक: Chenhua Fan, Jiahui Zhu, Yuhang Zhang, Honghao Wei

प्रकाशित 2026-08-12
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenhua Fan, Jiahui Zhu, Yuhang Zhang, Honghao Wei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक हाई-स्टेक्स वीडियो गेम खेलना सिखा रहे हैं। लक्ष्य सरल है: उच्चतम संभव स्कोर प्राप्त करना। लेकिन इसमें एक पेंच है। गेम का एक सख्त नियम है: स्तर समाप्त होने से पहले रोबोट की बैटरी खत्म नहीं होनी चाहिए। यदि यह खत्म हो जाती है, तो वह तुरंत हार जाता है। यह सेफ रीइन्फोर्समेंट लर्निंग (Safe Reinforcement Learning) की दुनिया है। इस क्षेत्र में, वैज्ञानिक कंप्यूटर को चीजें आजमाकर और गलतियों से सीखकर निर्णय लेना सिखाते हैं, लेकिन एक सुरक्षा जाल के साथ। चुनौती एक आदर्श संतुलन खोजने की है: रोबोट को अंक पाने के लिए जितना संभव हो सके उतना साहसी और चतुर बनने के लिए प्रेरित करना, जबकि उसे नियमों को कभी न तोड़ने के लिए पर्याप्त सुरक्षित रखना।

लंबे समय तक, इन रोबोटों को सिखाने का मानक तरीका यह था कि उन्हें कहें, "नियम मत तोड़ो," और उम्मीद करें कि वे खुद समझ जाएंगे कि बिना गिरे किनारे के कितने करीब जा सकते हैं। यह एक रस्सी पर चलने वाले (tightrope walker) को यह बताने जैसा है कि, "गिरना मत," लेकिन उन्हें संतुलन बनाने के लिए कोई डंडा देने के बजाय। रोबगर अक्सर बहुत सुरक्षित खेलता था, बैटरी की सीमा से दूर रहता था, जिससे बहुत सारे संभावित अंक हाथ से निकल जाते थे। यह 60 मील प्रति घंटे के क्षेत्र में केवल यह सुनिश्चित करने के लिए 20 मील प्रति घंटे की गति से कार चलाने जैसा था कि दुर्घटना न हो जाए।

एक नया शोध पत्र इन रोबोटों को सिखाने का एक स्मार्ट तरीका पेश करता है, जिसे बाउंड्री-सीकिंग पॉलिसी ग्रेडिएंट (Boundary-Seeking Policy Gradient - BSPG) कहा जाता है। लेखकों, चेनहुआ फैन, जियाहुई झू, युहांग झांग और होंगहाओ वे ने महसूस किया कि जीतने का सबसे अच्छा तरीका सुरक्षा क्षेत्र के बीच में रहना नहीं है, बल्कि खतरे की रेखा के बिल्कुल किनारे पर नृत्य करना है। उन्होंने पाया कि जब एक रोबोट इष्टतम रूप से खेल रहा होता है, तो उसे अपने पूरे सुरक्षा बजट का उपयोग करना चाहिए—जैसे कि एक रस्सी पर चलने वाला व्यक्ति संतुलन बनाए रखने के लिए रस्सी के हर इंच का उपयोग करता है, न कि सुरक्षा रेल के पास चिपके रहने के बजाय।

यह शोध पत्र रोबोट के लिए एक नया "डांस मूव" प्रस्तावित करता है। केवल किनारे से बचने की कोशिश करने के बजाय, रोबोट को एक ही समय में दो विशिष्ट निर्देश दिए जाते हैं। पहला, यह सीखता है कि संतुलन खोए बिना अधिक अंक प्राप्त करने के लिए सुरक्षा रेखा के किनारे के साथ तिरछा (sideways) कैसे चला जाए। दूसरा, इसे एक हल्का सा धक्का (nudge) मिलता है जो इसे रेखा की ओर खींचता यदि यह बहुत दूर भटक जाए, या इसे वापस धकेलता है यदि यह गिरने के बहुत करीब हो जाए। यह "धक्का" विशेष है क्योंकि यह दोनों तरफ से काम करता है: यदि रोबोट बहुत सावधान है, तो धक्का कहता है, "थोड़ा और आगे जाओ!" यदि वह बहुत लापरवाह है, तो धक्का कहता है, "पीछे हटो!"

शोधकर्ताओं ने गणितीय रूप से सिद्ध किया कि यह तरीका काम करता है। उन्होंने दिखाया कि समय के साथ, रोबोट का "सेफ्टी मीटर" ठीक सीमा पर स्थिर हो जाएगा, न कि उससे नीचे। उन्होंने यह भी दिखाया कि यह तरीका पिछले तरीकों से बेहतर है, जो अक्सर रोबोट को बहुत अधिक सुरक्षित खेलने के लिए छोड़ देते थे। अपने परीक्षणों में, एक मानक नेविगेशन गेम का उपयोग करते हुए, इस नए तरीके ने रोबोट को सुरक्षा सीमा के बिल्कुल किनारे पर रहते हुए उच्च स्कोर प्राप्त करने में मदद की, जिससे यह साबित हुआ कि आप सुरक्षित और महत्वाकांक्षी दोनों हो सकते हैं।

सुरक्षित रोबोट की कहानी

समस्या: "बहुत सुरक्षित" का जाल
कल्पना कीजिए कि आप एक डिलीवरी ट्रक चलाने के लिए एक रोबोट को प्रशिक्षित कर रहे हैं। ट्रक में एक ईंधन टैंक है, और नियम है: "आपको गंतव्य पर कम से कम 5 गैलन ईंधन बचाकर पहुँचना होगा।" यदि आप 0 गैलन के साथ पहुँचते हैं, तो आप दुर्घटनाग्रस्त हो जाते हैं। यदि आप 5 गैलॉन के साथ पहुँचते हैं, तो आप सुरक्षित हैं।

रोबोटों को प्रशिक्षित करने के पुराने तरीके एक घबराए हुए माता-पिता की तरह थे जो कार चला रहे हों। वे रोबोट को बताते थे, "सुनिश्चित करें कि आपके पास कम से कम 5 गैलॉन बचा रहे।" रोबोट, दुर्घटना होने के डर से, जैसे ही उसके पास 10 गैलॉन बचते, वह ड्राइविंग रोक देता। वह सुरक्षित रूप से पहुँच जाता, लेकिन उसने 5 गैलॉन ईंधन बर्बाद कर दिया जो तेज़ चलने या बेहतर रास्ता चुनने के लिए इस्तेमाल किया जा सकता था। वह सुरक्षित था, लेकिन वह अपने काम में बहुत अच्छा नहीं था।

यह शोध पत्र तर्क देता है कि यह एक बर्बादी है। "परफेक्ट" रोबोट को ठीक 5 गैलॉन के साथ पहुँचना चाहिए। उसे अपने प्रदर्शन को बेहतर बनाने के लिए उपलब्ध हर बूंद का उपयोग करना चाहिए, ठीक उस चट्टान के किनारे तक। लेकिन वहाँ पहुँचना कठिन है। यदि रोबोट किनारे के करीब जाने की कोशिश करता है, तो वह गलती से फिसल सकता है और दुर्घटनाग्रस्त हो सकता है। यदि वह बहुत पीछे रहता है, तो वह अंक खो देता है।

समाधान: दो-चरणीय नृत्य (The Two-Step Dance)
इस शोध पत्र के लेखकों ने एक नई रणनीति विकसित की जिसे बाउंड्री-सीकिंग पॉलिसी ग्रेडिएंट (BSPG) कहा जाता है। इसे रोबोट को एक दो-चरणीय नृत्य सिखाने के रूप में सोचें।

  1. साइड-स्टेप (टैन्जेंशियल मूव): कल्पना कीजिए कि रोबोट एक रस्सी पर खड़ा है। नृत्य का पहला हिस्सा रस्सी के साथ चलना है। यह रोबोट को किनारे के करीब या दूर जाए बिना (जैसे तार पर सिक्के उठाना) अधिक अंक प्राप्त करने में मदद करता है। यह पूरी तरह से सुरक्षित रहते हुए खेल में बेहतर होने के बारे में है।
  2. धक्का (नॉर्मल मूव): दूसरा हिस्सा एक विशेष धक्का है जो रोबोट को रस्सी पर बनाए रखता है।
    • यदि रोबोट "सुरक्षित क्षेत्र" में बहुत पीछे खड़ा है (बहुत अधिक ईंधन बचाकर), तो धक्का उसे किनारे की ओर आगे धकेलता है। यह कहता है, "आपके पास अतिरिक्त ईंधन है; इसका उपयोग अधिक अंक पाने के लिए करें!"
    • यदि वह गिरने के बहुत करीब डगमगा रहा है (बहुत अधिक ईंधन खर्च कर रहा है), तो धक्का उसे वापस खींचता है। यह कहता, "सावधान! आप दुर्घटना के बहुत करीब पहुँच रहे हैं!"

यह पुराने तरीकों से अलग है। पुराने तरीके आमतौर पर केवल कहते थे, "यदि आप दुर्घटनाग्रस्त होने वाले हैं, तो रुक जाएँ!" उनके पास यह कहने का कोई तरीका नहीं था कि, "यदि आप बहुत सुरक्षित हो रहे हैं, तो थोड़ा और आगे बढ़ें!" यह नया तरीका सुरक्षा सीमा को एक चुंबक की तरह मानता है जो रोबोट को दोनों तरफ से खींचता है, जिससे वह बिल्कुल किनारे पर संतुलित रहता है।

उन्होंने क्या पाया
लेखकों ने केवल अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने इसे सिद्ध करने के लिए गणित का उपयोग किया। उन्होंने दिखाया कि यदि आप इस नए नृत्य का उपयोग करते हैं, तो रोबोट अंततः इधर-उधर भटकना बंद कर देगा और सुरक्षा सीमा के ठीक किनारे पर स्थिर हो जाएगा। उन्होंने साबित किया कि जैसे-जैसे रोबोट सीखता है, उसका "सेफ्टी मीटर" शून्य के करीब पहुँचता जाता है (जिसका अर्थ है कि उसके पास ठीक उतना ही ईंधन बचा है जितनी आवश्यकता है)।

उन्होंने इसका परीक्षण सेफ्टी-जिमनेजियम (Safety-Gymnasium) नामक एक कंप्यूटर सिमुलेशन में भी किया, जो रोबोट सुरक्षा के परीक्षण के लिए एक वीडियो गेम की तरह है। इस गेम में, रोबोट को एक भूलभुलैया (maze) से गुजरना था। उन्होंने अपने नए तरीके (BSPG) की तुलना दो अन्य लोकप्रिय तरीकों से की।

  • पुराने तरीके घबराए हुए माता-पिता की तरह थे: उन्होंने रोबोट को खतरे के क्षेत्र से दूर रखा, जिससे कई अंक हाथ से निकल गए।
  • नया तरीका (BSPG) एक कुशल रस्सी पर चलने वाले (tightrope walker) की तरह था। उसने बहुत अधिक स्कोर प्राप्त किया क्योंकि उसने तेज़ और स्मार्ट तरीके से चलने के लिए लगभग अपने पूरे "सुरक्षा बजट" का उपयोग किया।

यह क्यों महत्वपूर्ण है
यह शोध पत्र महत्वपूर्ण है क्योंकि यह हमारे सोचने के तरीके को बदल देता है कि सुरक्षा क्या है। लंबे समय तक, हमने सोचा कि सुरक्षा का अर्थ खतरे से दूर रहना है। यह शोध पत्र दिखाता है कि वास्तविक सुरक्षा यह जानना है कि खतरा कहाँ है और बिना गिरे ठीक उसके बगल में चलना सीखना है। यह रोबलों को बहुत अधिक कुशल और प्रभावी बनाता है, चाहे वे कार चला रहे हों, पावर ग्रिड का प्रबंधन कर रहे हों, या गेम खेल रहे हों, बिना कभी नियमों को तोड़े।

लेखक बहुत सावधानी से कहते हैं कि यह उनके गणितीय मॉडल और कंप्यूटर सिमुलेशन में पूरी तरह से काम करता है। उन्होंने दिखाया कि रोबोट सुरक्षा रेखा को कसकर पकड़ना सीख जाता है, जिससे वह सुरक्षित रहते हुए सर्वोत्तम संभव प्रदर्शन करता है। यह मशीनों को साहसी लेकिन लापरवाह होने के बजाय निडर बनाने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →