← नवीनतम पेपर
⚡ electrical engineering

Optimistic World Models: Efficient Exploration in Model-Based Deep Reinforcement Learning

यह शोध पत्र ऑप्टिमिस्टिक वर्ल्ड मॉडल्स (OWMs) को प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो एक ऑप्टिमिस्टिक डायनेमिक्स लॉस को शामिल करके मॉडल-आधारित सुदृढीकरण लर्निंग (reinforcement learning) को बढ़ाता है, जो कल्पित ट्रांज़िशन को उच्च-पुरस्कार परिणामों की ओर पक्षपाती बनाता है, जिससे स्पार्स-रिवॉर्ड (sparse-reward) वातावरण में अन्वेषण दक्षता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Akshay Mete, Shahid Aamir Sheikh, Tzu-Hsiang Lin, Dileep Kalathil, P. R. Kumar

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Akshay Mete, Shahid Aamir Sheikh, Tzu-Hsiang Lin, Dileep Kalathil, P. R. Kumar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक विशाल, अंधेरे और अपरिचित हवेली में छिपे हुए खजानों को खोजने के लिए नेविगेट करना सिखा रहे हैं।

वर्तमान में, अधिकांश "स्मार्ट" रोबोट वर्ल्ड मॉडल्स (World Models) नामक एक विधि का उपयोग करते हैं। यह रोबोट को एक स्केचबुक देने जैसा है। जैसे-जैसे रोबोट दीवारों से टकराता है और सिक्के पाता है, वह हवेली का नक्शा अपनी स्केचबुक में बनाता है ताकि वह बाद में हवेली के बारे में "सपने" देख सके। वह वास्तविक दीवारों से टकराने के बजाय अपने ही रेखाचित्रों के माध्यम से दौड़ने का अभ्यास करता है।

समस्या: "बोरिंग मैप" का जाल
मुद्दा यह है कि ये रोबोट अक्सर बहुत अधिक यथार्थवादी होते हैं। यदि रोबोट की स्केचबुक में केवल वही गलियारे हैं जिनसे वह पहले ही गुजर चुका है, तो वह उन्हीं गलियारों के बारे में सपने देखता रहेगा। क्योंकि उसे अभी तक कोई खजाना नहीं मिला है, इसलिए उसके "सपने" उबाऊ और खाली होंगे। वह पहले से ज्ञात गलियारे में चलने का अभ्यास करने के लूप में फंस जाता है, और कभी उन अंधेरे कमरों में जाने की कोशिश नहीं करता जहाँ वास्तव में खजाना है। वैज्ञानिक इसे "स्पार्स रिवॉर्ड" (sparse reward) की समस्या कहते हैं।

समाधान: ऑप्टिमिस्टिक वर्ल्ड मॉडल्स (OWMs)

शोधकर्ताओं ने ऑप्टिमिस्टिक वर्ल्ड मॉडल्स (Optimistic World Models) नामक एक चतुर तकनीक पेश की है।

केवल यह दिखाने के बजाय कि वास्तव में क्या हुआ था, वे रोबोट को कहते हैं: "जब तुम अपना नक्शा बनाओ, तो कल्पना करो कि अनछुए कमरे सोने से भरे हुए हैं।"

उपमा: "आशावादी स्वप्नद्रष्टा" (The Optimistic Dreamer)

इसे इस प्रकार सोचें:

  • मानक रोबोट: एक सतर्क छात्र जो केवल उन्हीं अध्यायों का अध्ययन करता है जिन्हें उसने पहले ही पढ़ लिया है। यदि पाठ्यपुस्तक में किसी सरप्राइज परीक्षा का उल्लेख नहीं किया गया है, तो वह मान लेता है कि ऐसी कोई परीक्षा नहीं होगी।
  • आशावादी रोबोट (OWM): एक स्वप्नद्रष्टा जो, अपनी पाठ्यपुस्तक के खाली पन्ने को देखते समय सोचता है, "मुझे यकीन है कि इस अध्याय में कोई बहुत बड़ा, जीवन बदलने वाला रहस्य छिपा है!"

क्योंकि रोबोट "सपनों" में यह कल्पना करता है कि अज्ञात क्षेत्र उच्च-पुरस्कार वाले क्षेत्र हैं, इसलिए उसके आंतरिक अभ्यास सत्र (उसकी "कल्पना") बहुत अधिक रोमांचक हो जाते हैं। वह विशेष रूप से उन "काल्पनिक खजानों" तक पहुँचने के लिए डिज़ाइन किए गए पैंतरेबाज़ी (maneuvers) का अभ्यास करना शुरू कर देता है। यह उत्साह रोबोट को वास्तव में दुनिया में बाहर जाने और उन अंधेरे, अनमैप्ड कमरों में जाकर देखने के लिए प्रेरित करता है कि क्या वहां वास्तव में सोना है।

उन्होंने इसे कैसे किया (The "Secret Sauce")

तकनीकी शब्दों में, उन्होंने रोबोट के प्रशिक्षण में ऑप्टिमिस्टिक डायनेमिक्स लॉस (Optimistic Dynamics Loss) नामक एक नया गणितीय नियम जोड़ा।

केवल यह लक्ष्य रखने के बजाय कि "नक्शे को यथासंभव सटीक रूप से बनाओ," नया लक्ष्य यह है: "नक्शे को सटीक रूप से बनाओ, लेकिन अपने रेखाचित्रों को थोड़ा उस ओर झुकाओ जो ऐसे परिणामों की ओर संकेत करते हों जो बड़े पुरस्कारों की ओर ले जा सकते हैं।"

यह एक जीपीएस (GPS) की तरह है जो न केवल आपको वे सड़कें दिखाता है जिन पर आप चल चुके हैं, बल्कि संभावित शॉर्टकट और सुंदर मार्गों को भी चमकीले रंगों में हाइलाइट करता है, भले ही उसने अभी तक उनकी पुष्टि न की हो।

क्या यह काम करता है?

हाँ! शोधकर्ताओं ने इसका परीक्षण प्रसिद्ध डिजिटल "ऑब्स्टेकल कोर्स" (जैसे अटरी गेम्स और भौतिक सिमुलेशन) पर किया।

  • "स्पार्स" (Sparse) दुनिया में (जहाँ खजाना ढूंढना बहुत कठिन है), मानक रोबोटों की तुलना में ऑप्टिमिस्टिक रोबोट बहुत तेज़ी से और बेहतर तरीके से लक्ष्य तक पहुँचने में सक्षम थे।
  • "डेंस" (Dense) दुनिया में (जहाँ हर जगह पुरस्कार मौजूद है), वे अभी भी असाधारण रूप से अच्छा प्रदर्शन करते रहे।

संक्षेप में: रोबोट को अज्ञात से सर्वश्रेष्ठ की उम्मीद करने वाले "स्वप्नद्रष्टा" बनाकर, हम उन्हें अज्ञात को खोजने का साहस देते हैं, जिससे वे सतर्क पर्यवेक्षकों से साहसी खोजकर्ताओं में बदल जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →