← नवीनतम पेपर
🤖 machine learning

Stochastic Decision Horizons for Constrained Reinforcement Learning

यह शोध पत्र स्टोकेस्टिक डिसीजन होराइजन्स (SDH) को प्रस्तुत करता है, जो एक सैद्धांतिक रूप से आधारित ढांचा है जो उल्लंघनों को प्रभावी क्षितिज लघुकरण (horizon shortenings) के रूप में मॉडल करके कंस्ट्रेंड रिइन्फोर्समेंट लर्निंग में प्रत्येक-चरण बाधा संतुष्टि सुनिश्चित करता है, जिससे VT-MPO जैसे नवीन ऑफ-पॉलिसी एल्गोरिदम प्राप्त होते हैं जो अत्याधुनिक विधियों की तुलना में बेहतर रिवॉर्ड-उल्लंघन ट्रेड-ऑफ और प्रशिक्षण स्थिरता प्राप्त करते हैं।

मूल लेखक: Nikola Milosevic, Leonard Franz, Daniel Haeufle, Georg Martius, Nico Scherf, Pavel Kolev

प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nikola Milosevic, Leonard Franz, Daniel Haeufle, Georg Martius, Nico Scherf, Pavel Kolev

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना सिखा रहे हैं। इसे करने के पुराने तरीके (जिसे Constrained MDPs या CMDPs कहा जाता है) में, आप रोबोट को गलतियाँ करने का एक "बजट" देते हैं। इसे एक क्रेडिट कार्ड की तरह समझें: "आप मुसीबत में पड़ने से पहले 10 बार घास पर पैर रख सकते हैं।" रोबोट कुछ समय तक सावधानी से चल सकता है, फिर अचानक बहुत बड़ा जोखिम उठा सकता है, लगातार 9 बार घास पर पैर रख सकता है, और फिर भी वह "सुरक्षित" रहेगा क्योंकि उसने अभी तक सीमा को नहीं छुआ है। यह ईंधन की खपत जैसी चीजों के लिए काम करता है, लेकिन उन चीजों के लिए खतरनाक है जैसे कि रोबोट का गिर जाना या मरीज के दिल की धड़कन का अचानक बढ़ जाना, जहाँ एक गलत कदम तुरंत आपदा का कारण बन सकता है।

यह शोध पत्र (paper) रोबोट को सिखाने का एक नया तरीका प्रस्तावित करता है जिसे Stochastic Decision Horizons (SDH) कहा जाता है। क्रेडिट कार्ड बजट के बजाय, SDH हर कदम को एक "उत्तरजीविता जांच" (survival check) की तरह मानता है।

मुख्य विचार: "नाजुक कांच" की उपमा (The "Fragile Glass" Analogy)

कल्पना कीजिए कि एक रोबोट नाजुक कांच से बने फर्श पर चल रहा है।

  • पुराना तरीका (बजट): फर्श पर एक काउंटर है। यदि रोबोट बहुत ज़ोर से कदम रखता है, तो काउंटर बढ़ जाता है। जब तक काउंटर 10 से नीचे है, रोबोट ठीक है। वह पागलों की तरह कूदने-फांदने की कोशिश कर सकता है, इस उम्मीद में कि वह सीमा तक पहुँचने से बच जाएगा।
  • नया तरीका (SDH): हर बार जब रोबोट कदम उठाता है, तो कांच के चटकने की संभावना होती है। यदि कदम सुरक्षित है, तो कांच मजबूत रहता है। यदि कदम खतरनाक है (एक "उल्लंघन" या violation), तो कांच थोड़ा और नाजुक हो जाता है। यदि रोबोट बहुत बुरा कदम उठाता है, तो कांच पूरी तरह से टूट सकता है, और उस विशिष्ट प्रशिक्षण रन में रोबोट का "जीवन" तुरंत समाप्त हो सकता है।

SDH में, एक उल्लंघन केवल स्कोर में एक अंक नहीं जोड़ता; यह रोबोट के भविष्य को छोटा कर देता है। यदि रोबोट को पता है कि एक बुरा कदम अभी उसके "जीवन" को समाप्त कर सकता है, तो वह केवल अपने बजट सीमा के करीब होने पर ही नहीं, बल्कि हर एक बार सावधानी बरतना सीखता है।

"चटके हुए कांच" को संभालने के दो तरीके

यह शोध पत्र दो अलग-अलग दर्शनों (philosophies) की खोज करता है कि क्या होता है जब कांच चटक जाता है (एक उल्लंघन होता है):

  1. "एब्जॉर्बिंग स्टेट" (Absorbing State - AS-SAC): कल्पना कीजिए कि कांच टूट गया है, और रोबोट एक ब्लैक होल में गिर गया है। वह पूरी तरह से निर्णय लेना बंद कर देता है। उस विशिष्ट प्रयास के लिए खेल खत्म हो गया है। रोबोट सीखता है कि यदि वह गड़बड़ी करता है, तो वह अपने भविष्य के सभी पुरस्कार खो देता है। यह एक "हार्ड स्टॉप" की तरह है।
  2. "वर्चुअल टर्मिनेशन" (Virtual Termination - VT-MPO): कल्पना कीजिए कि कांच चटक गया है, और रोबोट अभी भी खड़ा है, लेकिन अब वह "भूतिया" (ghostly) अवस्था में है। वह अभी भी अपने पैरों को हिला सकता है और निर्णय ले सकता है, लेकिन वह अपने कार्यों के लिए कोई अंक (पुरस्कार) अर्जित नहीं कर सकता। यह एक वीडियो गेम की तरह है जहाँ आप अभी भी जीवित हैं, लेकिन आपका स्कोर शून्य पर जम गया है। रोबकर चलता रहता है, लेकिन वह सीखता है कि बुरे कदम उसके भविष्य को बेकार बना देते हैं।

शोध पत्र पाता है कि दूसरा तरीका (VT-MPO) अक्सर अधिक स्थिर और प्रशिक्षित करने में आसान होता है, विशेष रूप से जटिल कार्यों के लिए।

बड़ी सफलता: यथार्थवादी चलना (Realistic Walking)

लेखकों ने इसका परीक्षण एक बहुत ही जटिल, यथार्थवादी मानव जैसे रोबोट पर किया जिसमें 90 मांसपेशियां हैं (जिसे H21�0 कहा जाता है)। इस रोबोट को बिना गिरे या खुद को चोट पहुँचाए स्वाभाविक रूप से चलना सिखाना एक बड़ी चुनौती है।

  • समस्या: पिछले तरीकों ने "तेज़ चलने" बनाम "कम ऊर्जा का उपयोग करने" के बीच संतुलन बनाने की कोशिश की, जो लगातार नियमों को बदलते रहते थे (जैसे एक शिक्षक चिल्ला रहा हो, "तेज़ चलो!" फिर "धीरे हो जाओ!")। इसने रोबोट के प्रशिक्षण को अस्थिर बना दिया और इसमें बहुत समय लगा।
  • परिणाम: SDH (विशेष रूप से VT-MPO विधि) का उपयोग करके, रोबोट ने पिछले सर्वोत्तम तरीकों के समान ही यथार्थवादी तरीके से चलना सीखा, लेकिन उसने यह काम 4 गुना तेज़ी से और बहुत अधिक स्थिर प्रशिक्षण के साथ किया। उसे नियमों को लगातार बदलने की आवश्यकता नहीं थी; उसने बस यह सीखा कि बुरे कदम उसके भविष्य को छोटा कर देते हैं, इसलिए उसने स्वाभाविक रूप से सुरक्षित और कुशल तरीके से चलना सीख लिया।

यह कब काम करता है? (द "सिंगल स्केल" नियम)

यह शोध पत्र यह भी समझाता है कि यह तरीका कब सबसे अच्छा काम करता है।

  • यह बहुत अच्छा काम करता है जब खतरे सुसंगत (consistent) हों। उदाहरण के लिए, यदि हर बार जब रोबोट बहुत ज़ोर से कदम रखता है, तो वह एक "मध्यम" जोखिम होता है जो उसके जीवन को थोड़ा कम कर देता है। यह एक ऐसे फर्श पर चलने जैसा है जहाँ हर ढीली टाइल समान रूप से खतरनाक है।
  • इसे संघर्ष करना पड़ता है जब खतरे मिले-जुले हों। कल्पना कीजिए कि 99% समय, एक टाइल पर कदम रखने से कुछ नहीं होता, लेकिन 1% समय, एक टाइल पर कदम रखने से पूरी इमारत उड़ जाती है। "उत्तरजीविता" (survival) वाला तरीका इस दुर्लभ, विशाल विस्फोट को नहीं पकड़ पाएगा क्योंकि वह छोटे, बार-बार होने वाले दरारों के लिए अभ्यस्त है। ऐसे मामलों में, पुराने "बजट" तरीके की अभी भी आवश्यकता हो सकती है।

सारांश

यह शोध पत्र रोबोट को सुरक्षा सिखाने का एक स्मार्ट तरीका पेश करता है। उन्हें गलतियों के लिए "बजट" देने के बजाय, यह उन्हें सिखाता है कि हर गलती उनके भविष्य को कम कर देती है। यह उन्हें हर एक कदम पर सुरक्षित रहने के लिए मजबूर करता है, जिससे जटिल कार्यों जैसे कि यथार्थवादी मानव चाल के लिए तेज़ और अधिक स्थिर शिक्षण मिलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →