← नवीनतम पेपर
🤖 machine learning

Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning

यह शोध पत्र एक्सपेक्टाइल nn-स्टेप Q-लर्निंग (ENQ) प्रस्तुत करता है, जो एक ऑफ-पॉलिसी सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) एल्गोरिदम है जो मल्टी-स्टेप रिटर्न्स में निहित निराशावादी पूर्वाग्रह को कम करने के लिए एक एसिमेट्रिक एक्सपेक्टाइल लॉस का उपयोग करता है, जो कॉन्ट्रैक्शन के सैद्धांतिक आश्वासन और लॉन्ग-होरिज़न Q-लर्निंग जैसे मौजूदा तरीकों की तुलना में विविध कार्यों में बेहतर अनुभवजन्य प्रदर्शन प्रदान करता है।

मूल लेखक: Abdelghani Ghanem, Mounir Ghogho

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abdelghani Ghanem, Mounir Ghogho

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक विशाल, जटिल भूलभुलैया (maze) में नेविगेट करना सिखा रहे हैं। आप उसके साथ हर रास्ते पर चलकर नहीं जा सकते; इसके बजाय, आप उसे अन्य रोबोटों द्वारा तय किए गए रास्तों की एक लॉगबुक देते हैं, जिनमें से कुछ विशेषज्ञ थे और कई बस बिना किसी उद्देश्य के इधर-उधर घूम रहे थे। यह ऑफलाइन रीइन्फोर्समेंट लर्निंग (offline reinforcement learning) की दुनिया है: आर्टिफिशियल इंटेलिजेंस की एक शाखा जहाँ एक एजेंट लाइव ट्रायल-एंड-एरर के बजाय पिछले डेटा से सीखता है। लक्ष्य इनाम तक पहुँचने के लिए सबसे अच्छे मूव्स का पता लगाना है, जैसे कि निकास ढूँढना या किसी वस्तु को पकड़ना।

जल्दी सीखने के लिए, ये रोबोट मल्टी-स्टेप रिटर्न्स (multi-step returns) नामक एक तरकीब का उपयोग करते हैं। केवल एक कदम आगे देखने के बजाय कि क्या कोई चाल अच्छी थी, वे एक साथ कई कदम आगे देखते हैं, जैसे कहानी के केवल एक वाक्य को समझने के बजाय पूरे अध्याय को पढ़कर प्लॉट को समझना। यह रिवॉर्ड्स को सिस्टम में तेज़ी से फैलाने में मदद करता है। हालाँकि, इसमें एक पेंच है: यदि लॉगबुक में अनाड़ी रोबोटों द्वारा लिए गए कई खराब रास्ते शामिल हैं, तो बहुत दूर तक देखना सीखने वाले को अत्यधिक निराशावादी (pessimistic) बना सकता है। वह सोचने लगता है, "यदि मैं यह कदम उठाता हूँ, तो मैं उन भयानक रास्तों में से एक पर पहुँच जाऊँगा," और वह कोई भी जोखिम लेने से मना कर देता है, भले ही एक अच्छा रास्ता मौजूद हो। यह पेपर इसी विशिष्ट समस्या पर काम करता है: कैसे भविष्य को देखने की गति को बनाए रखा जाए बिना खराब पिछले डेटा की निराशावाद में फंसे।

शोधकर्ता एक नई विधि प्रस्तावित करते हैं जिसे एक्सपेक्टाइल एन-स्टेप क्यू-लर्निंग (Expectile n-step Q-learning - ENQ) कहा जाता है। एक लॉगबुक से सीखने को एक खेल के पिछले मैचों के सीजन के आधार पर खेल के अंतिम स्कोर का अनुमान लगाने जैसा समझें। एक मानक दृष्टिकोण एक विशिष्ट प्ले के बाद के सभी खेलों का औसत (average) निकाल सकता है। लेकिन यदि लॉगबुक उन खेलों से भरी है जहाँ टीम बुरी तरह हार गई थी, तो औसत कम होगा, जो खिलाड़ी को वह प्ले फिर से आज़माने से हतोत्साहित करेगा। ENQ खेल के नियम बदल देता है। औसत निकालने के बजाय, यह एक "अपर एक्सपेक्टाइल" (upper expectile) की गणना करता है। सरल शब्दों में, इसका अर्थ है कि यह सबसे खराब परिणामों को अनदेखा करता है और उन बेहतर, अधिक आशावादी परिदृश्यों पर ध्यान केंद्रित करता है जो वास्तव में लॉगबुक में हुए थे। यह एक कोच की तरह है जो, खिलाड़ी के इतिहास की समीक्षा करते समय कहता है, "आपके खराब खेलने वाले दिनों को अनदेखा करें; आइए उन दिनों पर ध्यान दें जब आपने अच्छा खेला था और यह पता लगाएँ कि वहाँ फिर से कैसे पहुँचा जाए।"

यह पेपर दिखाता है कि यह विधि गणितीय रूप से सुदृढ़ है। लेखक सिद्ध करते हैं कि ENQ सिस्टम स्थिर है और अंततः एक विश्वसनीय रणनीति पर टिक जाएगा, भले ही वह भविष्य में बहुत दूर तक देख रहा हो। वे यह भी प्रदर्शित करते हैं कि कुछ शर्तों के तहत, यह विधि सबसे अच्छी संभव रणनीति को पूरी तरह से रिकवर कर सकती है यदि डेटा में कम से कम एक अच्छा रास्ता मौजूद हो। वास्तविक दुनिया में, उन्होंने ENQ का परीक्षण 27 अलग-अलग कार्यों पर किया, जिसमें क्यूब्स को स्टैक करने वाले रोबोटिक आर्म्स से लेकर विशाल भूलभुलैया में नेविगेट करने वाले ह्यूमनॉइड रोबोट तक शामिल थे। उन्होंने पाया कि ENQ वर्तमान शीर्ष विधि (जिसे LQL कहा जाता है) के प्रतिस्पर्धी है, और अक्सर उससे बेहतर है, विशेष रूप से जब निर्णय लेने के लिए "क्रिटिक्स" (कई AI मॉडल मिलकर काम कर रहे हैं) की एक बड़ी टीम का उपयोग किया जाता है।

सबसे दिलचस्प निष्कर्षों में से एक गति के बारे में है। क्योंकि ENQ सरल है और इसे अन्य विधियों की तरह एक लंबे पथ के प्रत्येक कदम की जाँच करने की आवश्यकता नहीं होती है, यह तेज़ी से चलता है। अपने परीक्षणों में, ENQ ने प्रतिस्पर्धा की तुलना में लगभग 1.27 से 1.77 गुना तेज़ी से ट्रेनिंग स्टेप्स प्रोसेस किए, जो इस बात पर निर्भर करता है कि टीम में कितने AI मॉडल थे। यह सुझाव देता है कि पिछले डेटा के किन हिस्सों पर ध्यान केंद्रित करना है, इसके बारे में स्मार्ट होकर, रोबोट तेज़ी से और अधिक प्रभावी ढंग से सीखता है।

लेखकों ने यह भी पता लगाया कि विधि कितनी "आशावादी" (optimistic) होनी चाहिए। उन्होंने एक सेटिंग का परीक्षण किया जहाँ विधि सबसे अच्छे परिणामों को देखती है (एक उच्च "एक्सपेक्टाइल" स्तर) बनाम एक अधिक संतुलित दृष्टिकोण। उन्होंने पाया कि जबकि बहुत अधिक आशावादी होना कुछ कार्यों के लिए अच्छा काम करता है, यह अन्य कार्यों के लिए जोखिम भरा हो सकता है यदि डेटा शोर (noisy) वाला हो। हालाँकि, एक मध्यम मार्ग वाली सेटिंग (विशेष रूप से 0.8 का एक्सपेक्टाइल स्तर) लगभग सभी कार्यों में लगातार अच्छा काम करती है, जिसके लिए प्रत्येक विशिष्ट भूलभुलैया या रोबोट के लिए बदलाव करने की आवश्यकता नहीं होती है।

संक्षेप में, यह पेपर पुराने लॉग्स से सीखने के लिए एक चतुर तरीका पेश करता है जो सबसे खराब परिदृश्यों को अनदेखा करता है और उन सर्वश्रेष्ठ परिणामों पर ध्यान केंद्रित करता है जो वास्तव में घटित हुए थे। यह एक ऐसी विधि है जो गणितीय रूप से स्थिर, चलाने में तेज़ और जटिल वातावरण में रोबोट को सिखाने में अत्यधिक प्रभावी है, जो दोषपूर्ण पिछले अनुभवों से कुशलतापूर्वक सीखने वाले AI एजेंट बनाने के लिए एक उज्ज्वल भविष्य का मार्ग प्रशस्त करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →