← नवीनतम पेपर
📊 statistics

Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions

यह शोध पत्र वितरण रूप से सुदृढ़ (distributionally robust) औसत-पुरस्कार मार्कोव निर्णय प्रक्रियाओं में ε\varepsilon-इष्टतम नीतियों को सीखने के लिए मिनिमैक्स-इष्टतम नमूना जटिलता (minimax-optimal sample complexity) स्थापित करता है, जो एक शासन-निर्भर (regime-dependent) जटिलता सीमा को प्रकट करता है जो विक्षोभ पैमाने (perturbation scale) σH0\sigma H_0 के आधार पर नाममात्र (nominal) से सुदृढ़ व्यवहार में परिवर्तित होती है, और इन दरों को नवीन स्पैन-सूचित (span-informed) और स्पैन-अज्ञेय (span-agnostic) प्लग-इन रिडक्शन प्रक्रियाओं के माध्यम से प्राप्त करता है।

मूल लेखक: Yuepeng Yang, Yuxin Chen, Yuejie Chi

प्रकाशित 2026-08-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yuepeng Yang, Yuxin Chen, Yuejie Chi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया (maze) में नेविगेट करने के लिए प्रशिक्षित कर रहे हैं। एक वीडियो गेम की आदर्श दुनिया में, दीवारें अपनी जगह पर टिकी रहती हैं, फर्श हमेशा सूखा रहता है, और रोबोट को पता होता है कि उसका हर कदम कहाँ लैंड करेगा। लेकिन वास्तविक दुनिया में, चीजें अव्यवस्थित होती हैं। फर्श फिसलन भरा हो सकता है, कोई दरवाजा थोड़ा अटका हुआ हो सकता है, या हवा का एक झोंका रोबोट को रास्ते से भटका सकता है। यदि आप अपने रोबोट को केवल "आदर्श" मानचित्र पर प्रशिक्षित करते हैं, तो वास्तविक दुनिया की थोड़ी सी भी अस्थिरता मिलते ही वह टकरा सकता है। यह रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) नामक एक क्षेत्र का मूल है, जहाँ एजेंट परीक्षण और त्रुटि (trial and error) के माध्यम से सर्वोत्तम निर्णय लेना सीखते हैं।

आमतौर पर, ये एजेंट लंबे समय तक अपने कुल स्कोर को अधिकतम करने की कोशिश करते हैं, जैसे कि एक मैराथन धावक जो औसत गति को बेहतर बनाने का लक्ष्य रखता है। लेकिन यहाँ एक पेंच है: क्या होगा अगर जिस मानचित्र से उन्होंने सीखा है, वह वही मानचित्र नहीं है जिस पर वे दौड़ रहे हैं? यहीं पर डिस्ट्रीबशनल रूप से मजबूत (Distributionally Robust) सोच काम आती है। यह मानते हुए कि दुनिया बिल्कुल वैसी ही है जैसी वह दिखती है, एजेंट एक उचित त्रुटि सीमा के भीतर "सबसे खराब स्थिति" (worst-case scenario) के लिए तैयारी करता है। वह पूछता है, "क्या होगा अगर फर्श थोड़ा फिसलन भरा हो? क्या होगा अगर दरवाजा थोड़ा भारी हो?" वह एक ऐसी रणनीति सीखता है जो तब भी अच्छी तरह काम करती है जब चीजें थोड़ी गलत हो जाती हैं। वैज्ञानिक मुख्य सवाल यह पूछ रहे हैं कि: एक रोबोट को इस तरह की "सुरक्षित" रणनीति सीखने के लिए वास्तव में कितने अभ्यास (डेटा) की आवश्यकता होती है? क्या यह थोड़ा अतिरिक्त अभ्यास है, या वास्तव में मजबूत होने के लिए इसे भारी मात्रा में डेटा की आवश्यकता है?

यह शोध पत्र, जिसका शीर्षक "Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions" है, इसी प्रश्न की गहराई में जाता है। लेखक, जो येल और पेन से शोधकर्ता हैं, जासूसों की तरह यह पता लगाने की कोशिश कर रहे हैं कि सुरक्षा की सटीक "कीमत" क्या है। उन्होंने पाया कि आवश्यक डेटा दो मुख्य चीजों पर निर्भर करता है: वातावरण कितना "अनिश्चित" या अप्रत्याशित है (अनिश्चितता), और रोबोट का प्रदर्शन कहाँ से शुरू होने पर कितना भिन्न होता है (बायस स्पैन/bias span)।

उन्होंने सीखने के दो अलग-अलग "क्षेत्रों" (zones) की खोज की। हाई-टॉलरेंस ज़ोन (High-Tolerance Zone) में, रोबोट को थोड़ा अपूर्ण होने की अनुमति है। यहाँ, आवश्यक डेटा अपेक्षाकृत कम है, जैसा कि आपको एक सामान्य, गैर-मजबूत रणनीति सीखने के लिए चाहिए होता है। यह एक शांत दिन पर साइकिल चलाना सीखने जैसा है; आपको हवा की बहुत चिंता करने की आवश्यकता नहीं है। हालाँकि, लो-टॉलरेंस ज़ोन (Low-Tolerance Zone) में, रोबोट को तब भी पूर्ण होना चाहिए जब हवा तेज़ चल रही हो। यहाँ, डेटा की आवश्यकता काफी बढ़ जाती है। लेखकों ने सिद्ध किया कि इतना सुरक्षित होने के लिए, रोबोट को अतिरिक्त डेटा की आवश्यकता होती है जो अनिश्चितता के वर्ग (square) के साथ बढ़ता है। पूर्ण सुरक्षा के लिए यह एक बड़ी कीमत है, लेकिन उन्होंने यह भी सिद्ध किया कि यह न्यूनतम आवश्यक लागत है—आप गणित को दरकिनार नहीं कर सकते।

यह शोध पत्र एक चतुर "प्लग-इन" विधि भी पेश करता है। कल्पना कीजिए कि आपके पास केक बनाने की एक रेसिपी है। कभी-कभी, आपको बस रेसिपी के अनुसार केक बनाना होता है (नॉमिनल दृष्टिकोण)। अन्य समय में, आपको अतिरिक्त स्टेबलाइजर्स जोड़ने की आवश्यकता होती है ताकि यह सुनिश्चित हो सके कि यदि ओवन का तापमान बदलता है तो केक ढह न जाए (रोबस्ट दृष्टिकोण)। लेखकों ने एक स्मार्ट सिस्टम बनाया है जो स्थिति को देखता है और निर्णय लेता है: "क्या मुझे बस रेसिपी का पालन करना चाहिए, या मुझे स्टेबलाइजर्स की आवश्यकता है?" यदि रोबोट को "स्पैन" (कैसे उसका प्रदर्शन भिन्न होता है) का पता है, तो वह सबसे कुशल रास्ता चुन सकता है। यदि उसे स्पैन का पता नहीं है, तो सिस्टम के पास एक बैकअप प्लान है जो सही चुनाव करने के लिए डेटा से खुद सीखता है।

संक्षेप में, यह शोध पत्र केवल अनुमान नहीं लगाता; यह गणितीय प्रमाण प्रदान करता है कि एक मजबूत नीति (robust policy) सीखने के लिए वास्तव में कितने नमूनों (samples) की आवश्यकता होती है। उन्होंने दिखाया कि पिछले तरीके या तो बहुत अधिक डेटा का उपयोग कर रहे थे या बहुत कम, और उन्होंने "गोल्डिलॉक्स" (Goldilocks) समाधान प्रदान किया: काम के लिए बिल्कुल सही मात्रा में डेटा, चाहे वातावरण शांत हो या अराजक। उनके निष्कर्षों का समर्थन कठोर गणितीय प्रमाणों और कंप्यूटर सिमुलेशन दोनों द्वारा किया गया था, जिन्होंने पुष्टि की कि उनके सिद्धांत व्यवहार में भी सही साबित होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →