Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism
यह शोधपत्र NEUBAY को प्रस्तुत करता है, जो एक लॉन्ग-होरिज़न मॉडल-आधारित ऑफलाइन रीइन्फोर्समेंट लर्निंग एल्गोरिदम है जो एपिस्टेमिक अनिश्चितता (epistemic uncertainty) को प्रभावी ढंग से संभालने और विविध डेटासेट्स पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए स्पष्ट रूढ़िवादिता (explicit conservatism) को बेयसियन परिप्रेक्ष्य (Bayesian perspective) से बदल देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कमरे के आर-पार चलना सिखाने की कोशिश कर रहे हैं। आपके पास अन्य रोबोटों के चलने के वीडियो का एक विशाल पुस्तकालय है, लेकिन आप अपने रोबोट को वास्तविक दुनिया में अभ्यास करने की अनुमति नहीं दे सकते क्योंकि वह गिर सकता है और कुछ तोड़ सकता है। यह ऑफलाइन रीइन्फोर्समेंट लर्निंग (Offline Reinforcement Learning) की दुनिया है: केवल पिछले अनुभवों के एक स्थिर डेटासेट से सीखना।
वर्षों से, रोबोटों को वीडियो से सिखाने के लिए मानक सलाह रही है: "अत्यधिक सावधान रहें।"
पुराना तरीका: "सुरक्षा प्रथम" दृष्टिकोण
अधिकांश पिछले तरीके एक घबराए हुए माता-पिता की तरह व्यवहार करते हैं। वे कहते हैं, "यदि रोबोट वीडियो लाइब्रेरी में देखी गई किसी स्थिति को देखता है, तो हमें सबसे बुरे की कल्पना करनी चाहिए। कुछ भी नया करने की कोशिश न करें, अन्यथा आप दुर्घटनाग्रस्त हो सकते हैं।"
- रूपक: कल्पना कीजिए कि आप केवल एक छोटे से पड़ोस के मानचित्र के आधार पर कार चला रहे हैं। यदि आप मानचित्र पर न दिखने वाली सड़क देखते हैं, तो "सावधान" दृष्टिकोण कहता है, "रुको! वह सड़क खतरनाक है। ज्ञात सड़कों पर ही रहो।"
- समस्या: यह तब अच्छा काम करता है जब मानचित्र एकदम सही हो, लेकिन यदि मानचित्र में किसी बेहतर मंजिल तक पहुँचने वाला कोई छोटा रास्ता (शॉर्टकट) गायब है, तो सावधान ड्राइवर उसे कभी नहीं खोज पाएगा। वे "सुरक्षित लेकिन औसत दर्प" के एक लूप में फंस जाते हैं।
नया विचार: "बेयसियन जासूस" (The Bayesian Detective)
इस शोध पत्र के लेखक, NEUBAY, एक अलग सवाल पूछते हैं: क्या होगा यदि हम इतने निराशावादी होना बंद कर दें और इसके बजाय एक ऐसे जासूस की तरह कार्य करें जो चलते समय अपने विश्वासों को अपडेट करता रहता है?
अनजान के बारे में सबसे बुरा मानने के बजाय, बेयसियन दृष्टिकोण कहता है: "मैं सटीक रूप से नहीं जानता कि दुनिया कैसे काम करती है, लेकिन मेरे पास संभावनाओं की एक रेंज है। आइए यह पता लगाने की कोशिश करें कि कौन सी संभावना सच है, जैसे-जैसे मैं आगे बढ़ता हूँ।"
- रूपक: कल्पना कीजिए कि आप टॉर्च के साथ एक अंधेरे कमरे में हैं। "सावधान" विधि इसलिए आगे बढ़ने से मना कर देती है क्योंकि वह पूरे कमरे को नहीं देख सकती। "बेयसियन" विधि कहती है: "मैं एक कदम उठाऊंगा, रोशनी डालूंगा, देखूंगा कि वहां क्या है, और अपने मानसिक मानचित्र को अपडेट करूँगा। यदि मुझे दीवार दिखती है, तो मैं मुड़ जाऊंगा; यदि मुझे रास्ता दिखता है, तो मैं उस पर चलूँगा।"
- परिणाम: उन स्थितियों में जहाँ वीडियो लाइब्रेरी अव्यवस्थित या अधूरी (कम गुणवत्ता वाला डेटा) है, यह जासूसी दृष्टिकोण बेहतर रास्ता खोजने में बहुत बेहतर है क्योंकि यह केवल ज्ञात रास्तों पर टिके रहने के बजाय अज्ञात को खोजने के लिए तैयार है।
बड़ी चुनौती: "भ्रम" का जाल (The "Hallucination" Trap)
एक पेंच है। जब आप सावधान रहना छोड़ देते हैं, तो भ्रम (hallucinating) का जोखिम होता है।
- रूपक: यदि आप एक कमजोर अनुमान के आधार पर भविष्य के 100 कदमों की भविष्यवाणी करने की कोशिश करते हैं, तो आपकी भविष्यवाणी जल्दी ही एक कल्पना बन जाएगी। यह अपने आप के साथ "टेलीफोन" गेम खेलने जैसा है; 50वें कदम तक, संदेश पूरी तरह से गलत हो जाएगा।
- शोध पत्र का अंतर्दृष्टि: लेखकों ने पाया कि इन भ्रमों से बचने के लिए—बिना अत्यधिक सावधान हुए—आपको वास्तव में आगे की अधिक गहराई से सोचना होगा, न कि कम।
- क्यों? यदि आप केवल 5 कदम आगे की सोचते हैं, तो आपको 6वें कदम पर क्या होगा, इसका अनुमान लगाना पड़ता है। यदि आप 500 कदम आगे की सोचते हैं, तो योजना के बिल्कुल अंत में किया गया "अनुमान" कम महत्व रखता है (डिस्काउंट हो जाता है), और योजना की शुरुआत का वास्तविक, ज्ञात डेटा अधिक वजन रखता है।
- उपमा: यह एक रोड ट्रिप की योजना बनाने जैसा है। यदि आप केवल 10 मील की योजना बनाते हैं, तो आप डेड एंड (बंद रास्ते) में जा सकते हैं क्योंकि आपने 20 मील दूर लगे साइन को नहीं देखा था। यदि आप पूरी यात्रा की योजना बनाते हैं, तो आप डेड एंड को आते हुए देख लेंगे और उससे बच जाएंगे, भले ही आपका मानचित्र थोड़ा धुंधला हो।
NEUBAY इसे कैसे हल करता है
लेखकों ने एक सिस्टम बनाया जिसे NEUBAY कहा जाता है, जो तीन चतुर तरीकों को जोड़ता है ताकि यह "दीर्घकालिक सोच" बिना रोबोट के टकराए काम कर सके:
- "अनिश्चितता स्पीड बंप" (The Uncertainty Speed Bump): एक सख्त रोक के बजाय, रोबोट अपने आत्मविश्वास की जांच करता है। यदि उसे महसूस होने लगता है कि इलाके के बारे में अनिश्चितता बढ़ रही है (उच्च अनिश्चितता), तो वह उस विशिष्ट पथ की योजना बनाना बंद कर देता है। यह एक हाइकर की तरह है जो रास्ता बहुत धुंधला होने पर रुक जाता है, न कि हाइकिंग करने से ही मना कर देता है।
- "स्टेबलाइज़र" (The Stabilizer - Layer Normalization): उन्होंने रोबोट के मस्तिष्क में एक गणितीय "शॉक एब्जॉर्बर" जोड़ा। यह रोबोट की भविष्यवाणियों को अनियंत्रित होने से रोकता है जब वह घटनाओं के लंबे अनुक्रमों की कल्पना करता है। यह रोबोट की कल्पना को ज़मीन से जोड़े रखता है।
- "मेमोरी बैंक" (The Memory Bank): चूंकि रोबोट दुनिया के नियमों को चलते समय समझने की कोशिश कर रहा है, इसलिए उसे यह याद रखने की आवश्यकता है कि पहले क्या हुआ था। उन्होंने रोबोट को एक दीर्घकालिक स्मृति दी ताकि वह केवल पिछले कदम से ही नहीं, बल्कि अपनी पूरी यात्रा से सीख सके।
उन्होंने क्या पाया
उन्होंने इसे 33 अलग-अलग चुनौतीपूर्ण कार्यों (जैसे रोबोट का चलना, दरवाजे खोलना और भूलभुलैया में नेविगेट करना) पर परखा।
- विजेता: NEUBAY ने 7 डेटासेट्स पर सर्वश्रेष्ठ "सावधान" तरीकों को हराया और लगभग सभी पर प्रतिस्पर्धी रहा।
- सही स्थान (Sweet Spot): यह तब सबसे अधिक चमकता है जब प्रशिक्षण डेटा अव्यवस्थित या अधूरा होता है। उन मामलों में, "सावधान" तरीके फंस जाते हैं, लेकिन NEUBAY का जासूसी काम समाधान खोज लेता है।
- आश्चर्य: उन्होंने पाया कि बहुत लंबी प्लानिंग हॉरिजन (सैकड़ों कदम आगे सोचना) का उपयोग करना वास्तव में सफलता की कुंजी थी, जो अन्य अधिकांश शोधकर्ताओं के बिल्कुल विपरीत है।
संक्षेप में
यह शोध पत्र तर्क देता है कि पुराने डेटा से सीखने की दुनिया में, अंधा अंधविश्वास हमेशा सबसे सुरक्षित दांव नहीं होता। एक रोबोट पर भरोसा करके कि वह अपने इतिहास से सीख सके और भविष्य की लंबी योजना बना सके—जबकि भ्रमित होने पर सुरक्षा जाल भी बनाए रखे—हम ऐसे एजेंट बना सकते हैं जो केवल "सुरक्षित रहने" के निर्देश पाने वाले एजेंटों की तुलना में अधिक स्मार्ट और अनुकूलन योग्य होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।