← नवीनतम पेपर
🤖 machine learning

Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration

यह शोध पत्र COX-Q का प्रस्ताव करता है, जो एक ऑफ-पॉलिसी सेफ रीइन्फोर्समेंट लर्निंग एल्गोरिदम है जो डेटा संग्रह और परिनियोजन (डिप्लॉयमेंट) दोनों के दौरान सुरक्षा बाधाओं को पूरा करते हुए उच्च सैंपल दक्षता प्राप्त करने के लिए कॉस्ट-कंस्ट्रेंड ऑप्टिमिस्टिक एक्सप्लोरेशन को ट्रंकेटेड क्वांटाइल क्रिटिक्स के साथ जोड़ता है।

मूल लेखक: Guopeng Li, Matthijs T. J. Spaan, Julian F. P. Kooij

प्रकाशित 2026-03-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guopeng Li, Matthijs T. J. Spaan, Julian F. P. Kooij

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। आप चाहते हैं कि वह पॉइंट A से पॉइंट B तक जितनी जल्दी हो सके पहुंचे (यह आपका रिवॉर्ड/इनाम है), लेकिन आपका एक सख्त नियम है: वह दुर्घटना नहीं कर सकता, पैदल यात्री से नहीं टकरा सकता, या रेड लाइट नहीं तोड़ सकता (यह आपकी सेफ्टी कॉस्ट/सुरक्षा लागत है)।

यह सेफ रीइन्फोर्समेंट लर्निंग (Safe RL) की मूल चुनौती है। रोबोट 'प्रयास और त्रुटि' (trial and error) से सीखता है। लेकिन समस्या यह है: यदि आप रोबोट को जल्दी सीखने के लिए बेतहाशा गाड़ी चलाने देते हैं, तो वह नियम समझने से पहले कुछ बार दुर्घटनाग्रस्त हो सकता है। वास्तविक दुनिया में, दुर्घटनाएं महंगी और खतरनाक होती हैं।

यह पेपर COX-Q (Constrained Optimistic eXploration Q-learning) नामक एक नई विधि पेश करता है। इसे एक "स्मार्ट ड्राइविंग इंस्ट्रक्टर" के रूप में समझें जो रोबोट को अभ्यास के दौरान दुर्घटना किए बिना तेज़ी से गाड़ी चलाना सिखाता है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "लापरवाह छात्र" बनाम "धीमा शिक्षक"

  • पुरानी विधियाँ (On-Policy): कल्पना कीजिए कि एक शिक्षक है जो छात्र को केवल एक बंद ट्रैक पर बहुत धीरे-धीरे चलाने देता है, छात्र के एक्सीलेटर छूने से पहले ही उसकी हर हरकत की जांच करता है। यह बहुत सुरक्षित है, लेकिन इसमें सीखने में बहुत समय लगता है।
  • अन्य विधियाँ (Off-Policy): कल्पना कीजिए कि एक शिक्षक छात्र को तेज़ चलाने देता है और उसे पिछली गलतियों (जैसे वीडियो रीप्ले) से सीखने देता है। यह बहुत तेज़ (कुशल) है, लेकिन छात्र अक्सर बहुत उत्साहित हो जाता है, रेड लाइट पार कर जाता है, और दुर्घटनाग्रस्त हो जाता है क्योंकि उन्हें तब तक खतरे का एहसास नहीं होता जब तक कि बहुत देर न हो जाए।

COX-Q दोनों का सबसे अच्छा मिश्रण है: यह दूसरे तरीके की तरह तेज़ी से सीखता है लेकिन पहले तरीके की तरह सुरक्षित भी रहता है।

2. सीक्रेट सॉस: दो मुख्य तरकीबें

तरकीब A: "संतुलित दिशा-सूचक" (Cost-Constrained Optimistic Exploration)

जब एक रोबोट सीखता है, तो उसके पास दो प्रतिस्पर्धी लक्ष्य होते हैं:

  1. तेज़ चलें (रिवॉर्ड को अधिकतम करें)।
  2. दुर्घटना न करें (लागत को कम करें)।

कभी-कभी, वह दिशा जो आपको लक्ष्य तक सबसे तेज़ी से पहुँचाती है, वही दुर्घटना की ओर ले जाने वाली दिशा भी हो सकती है। गणितीय शब्दों में, ये "विरोधाभासी ग्रेडिएंट्स" (conflicting gradients) हैं।

  • पुराना तरीका: रोबोट शायद एक दिशा चुन लेगा और दूसरी को अनदेखा कर देगा, या उन्हें औसत करने की कोशिश करेगा, जिससे अक्सर दुर्घटना हो जाती है।
  • COX-Q का तरीका: कल्पना कीजिए कि रोबोट के पास एक कम्पास (दिशा-सूचक) है।
    • यदि रास्ता सुरक्षित है, तो कम्पास सीधे लक्ष्य की ओर इशारा करता है (तेज़ चलें!)।
    • यदि रास्ता खतरनाक लग रहा है, तो कम्पास केवल रुकता नहीं है; यह एक नया रास्ता खोजता है जो आपको आगे बढ़ने के लिए उतना ही आगे बढ़ाता है जितना सीखना ज़रूरी है, लेकिन पूरी तरह से "सुरक्षित क्षेत्र" के भीतर रहता है।
    • इसके पास एक स्पीड लिमिटर भी है। यदि रोबट "खतरे की रेखा" के बहुत करीब आ रहा है, तो इंस्ट्रक्टर स्वचालित रूप से रोबोट के सीखने के चरणों को धीमा कर देता है ताकि वह नियंत्रण से बाहर न जाए और दुर्घटना न हो।

तरकीब B: "क्रिस्टल बॉल" (Distributional Value Learning)

वास्तविक दुनिया में, हम केवल औसत परिणाम नहीं चाहते; हम जानना चाहते हैं कि सबसे खराब स्थिति क्या हो सकती है।

  • पुराना तरीका: रोबोट सोच सकता है, "औसत रूप से, मैं ठीक रहूँगा," और एक जोखिम भरा शॉर्टकट ले सकता है।
  • COX-Q का तरीका: रोबोट एक क्रिस्टल बॉल (जिसे ट्रंकेटेड क्वांटाइल क्रिटिक्स कहा जाता है) का उपयोग करता है। केवल औसत लागत का अनुमान लगाने के बजाय, यह "सबसे खराब-मामले" (worst-case scenarios) को देखता है।
    • उपमा: कल्पना कीजिए कि आप अंधेरे में चल रहे हैं। एक सामान्य व्यक्ति कह सकता है, "मुझे लगता है कि मैं हर 100 कदमों में एक बार लड़खड़ाऊंगा।" COX-Q कहता है, "ठीक है, लेकिन क्या होगा अगर मैं अभी लड़खड़ा जाऊं? चलिए मान लेते हैं कि सबसे बुरा हो सकता है और सावधानी से चलते हैं।"
    • सबसे खराब स्थितियों पर ध्यान केंद्रित करके, रोबोट स्वाभाविक रूप से जोखिम भरे क्षेत्रों के प्रति सतर्क हो जाता है, जिससे खतरनाक आदतें विकसित होने से रुक जाती हैं।

3. परिणाम: "सेफ्टी चैंपियन"

लेखकों ने तीन अलग-अलग दुनिया में COX-Q का परीक्षण किया:

  1. रोबोट रनर्स: रोबोट्स को बिना गिरे तेज़ी से दौड़ना सिखाना।
  2. रोबोट नेविगेटर्स: रोबोट्स को बाधाओं से टकराए बिना लक्ष्य तक पहुँचाना।
  3. सेल्फ-ड्राइविंग कार्स: सबसे कठिन परीक्षण। ट्रैफिक में गाड़ी चलाना, लेन बदलना और चौराहों पर मुड़ना।

फैसला:

  • गति (Speed): COX-Q ने "धीमे शिक्षक" वाली विधियों की तुलना में बहुत तेज़ी से सीखा।
  • सुरक्षा (Safety): सीखने की प्रक्रिया के दौरान ( "अभ्यास" चरण में), COX-Q "लापरवाह छात्र" वाली विधियों की तुलना में काफी कम बार दुर्घटनाग्रस्त हुआ या नियम तोड़े।
  • प्रदर्शन (Performance): अंतिम परीक्षण में, COX-Q ने बेहतरीन विधियों के समान ही अच्छा प्रदर्शन किया, लेकिन बिना किसी खतरनाक अभ्यास सत्र के।

सारांश

COX-Q एक ऐसे ड्राइविंग इंस्ट्रक्टर की तरह है जो जानता है कि कितना जोखिम स्वीकार्य है। यह छात्र को तेज़ी से सीखने के लिए पर्याप्त तेज़ चलने देता है, लेकिन एक "सुरक्षा जाल" और "सबसे खराब स्थिति वाली क्रिस्टल बॉल" का उपयोग करता है ताकि यह सुनिश्चित हो सके कि छात्र कभी भी आपदा की सीमा को पार न करे। यह इसे वास्तविक दुनिया के अनुप्रयोगों जैसे कि सेल्फ-ड्राइविंग कारों, मेडिकल रोबोट्स या औद्योगिक मशीनों के लिए एकदम सही बनाता है, जहाँ गलतियों की कीमत बहुत अधिक होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →