← नवीनतम पेपर
🤖 machine learning

Quotient-Categorical Representations for Bellman-Compatible Average-Reward Distributional Reinforcement Learning

यह शोधपत्र एक कोटिएंट-कैटेगोरिकल (quotient-categorical) ढांचे को औसत-इनाम वितरण संबंधी सुदृढीकरण शिक्षण (average-reward distributional reinforcement learning) के लिए प्रस्तुत करता है जो अनुवाद (translation) तक अवस्था-सूचकांक कानूनों (state-indexed laws) की पहचान करके पूर्वाग्रह अनुमान (bias estimation) की दुर्बल प्रकृति को हल करता है, जिससे सुस्पष्ट, गैर-विस्तारकारी ऑपरेटरों (non-expansive operators) को सक्षम बनाया जा सके और ऑनलाइन गेन अनुमान (online gain estimation) के साथ आदर्श और व्यावहारिक नमूनाकृत एल्गोरिदम दोनों के लिए अभिसरण (convergence) सिद्ध किया जा सके।

मूल लेखक: Ege C. Kaya, Aliasghar Pourghani, Vijay Gupta, Abolfazl Hashemi

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ege C. Kaya, Aliasghar Pourghani, Vijay Gupta, Abolfazl Hashemi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: बिना किसी शुरुआती रेखा के "अच्छाई" को मापना

कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ अंत में आपको कोई अंतिम स्कोर नहीं मिलता। इसके बजाय, आप हमेशा के लिए खेलते रहते हैं, और हर सेकंड अंक एकत्र करते हैं। आपका लक्ष्य लंबे समय में प्रति सेकंड अर्जित अंकों की औसत (average) संख्या का पता लगाना है।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे एवरेज-रिवॉर्ड रिइन्फोर्समेंट लर्निंग (Average-Reward Reinforcement Learning) कहा जाता है। AI को दो चीजें सीखनी होती हैं:

  1. लाभ (The Gain): अंक अर्जित करने की दीर्घकालिक औसत गति (जैसे, 5 अंक प्रति सेकंड)।
  2. बायस (The Bias): एक विशिष्ट स्थिति औसत की तुलना में कितनी बेहतर या बदतर है। उदाहरण के लिए, एक "सुरक्षित क्षेत्र" में होना +10 अंक जैसा महसूस हो सकता है, जबकि "खतरे वाले क्षेत्र" में होना -10 अंक जैसा महसूस हो सकता है, भले ही दीर्घकालिक औसत केवल 5 हो।

समस्या:
"बायस" का एक अजीब सा गुण है। यह समुद्र तल के सापेक्ष ऊंचाई मापने जैसा है। यदि आप तय करते हैं कि "समुद्र तल" पहले की तुलना में 100 फीट ऊंचा है, तो प्रत्येक एकल माप 100 फीट बढ़ जाएगा। पहाड़ों और घाटियों के बीच का अंतर समान रहता है, लेकिन संख्याएं बदल जाती हैं।

गणितीय शब्दों में, बायस केवल "एक योज्य स्थिरांक (additive constant) तक" परिभाषित है। यदि आप प्रत्येक संख्या को समान मात्रा में बदलते हैं, तो AI अभी भी बिल्कुल वही चीज़ सीख रहा है। यह डिस्ट्रीब्यूशनल रिइन्फोर्समेंट लर्निंग (DRL) नामक एक विशिष्ट प्रकार के AI के लिए सिरदर्द पैदा करता है। DRL केवल बायस के लिए एक संख्या का अनुमान नहीं लगाता; यह अधिक सटीक होने के लिए एक पूरा वितरण (distribution) (संभावनाओं का एक बादल) का अनुमान लगाता है। लेकिन यदि आप यह तय नहीं कर सकते कि "शून्य" कहाँ है, तो आप उस बादल को मानचित्र पर कैसे खींच सकते हैं? यदि आप मानचित्र को खिसकाते हैं, तो बादल भी खिसक जाता है, और गणित टूट जाता है।

समाधान: "कोशिएंट" (Quotient) मानचित्र

लेखकों, एगे सी. काया और पर्ड्यू यूनिवर्सिटी की उनकी टीम ने इसे ठीक करने के लिए एक चतुर तरीका निकाला। उन्होंने AI को एक एकल "शून्य" बिंदु चुनने के लिए मजबूर करने की कोशिश नहीं की। इसके बजाय, उन्होंने इस समस्या को एक स्लाइडिंग पहेली (sliding puzzle) की तरह माना।

उपमा: स्लाइडिंग ट्रेन कार
कल्पना कीजिए कि बायस के बारे में AI का अनुमान यात्रियों से भरी एक ट्रेन कार (प्रायिकता वितरण) है।

  • पुराना तरीका: आपने ट्रेन कार को ट्रैक पर एक विशिष्ट निर्देशांक (coordinate) पर पार्क करने की कोशिश की (जैसे, "मील मार्कर 50 पर रुकें")। लेकिन चूंकि "शून्य" बिंदु लगातार बदलता रहता है, इसलिए कार ट्रैक से फिसलती रहती है।
  • नया तरीका (Quotient-Categorical): लेखक कहते हैं, "इस बात से क्या फर्क पड़ता है कि ट्रेन कहाँ पार्क है? हमें केवल ट्रेन के आकार और यात्रियों के बीच की दूरी से मतलब है।"

उन्होंने एक नया गणितीय स्थान बनाया जिसे कोशिएंट स्पेस (Quotient Space) कहा जाता है। इस स्थान में, दो ट्रेन कारएं "एक समान" मानी जाती हैं यदि एक दूसरी की प्रतिलिपि है जिसे केवल समान मात्रा में बाएं या दाएं खिसकाया गया है। वे इसे "एक सामान्य अनुवाद (common translation) तक पहचानना" कहते हैं।

ऐसा करके, उन्होंने "शून्य कहाँ है" के भ्रम को दूर कर दिया। AI अब एक पूर्ण संख्या का अनुमान नहीं लगाता; वह बायस के बादल के आकार का अनुमान लगाता है, चाहे वह संख्या रेखा पर कहीं भी स्थित हो।

इंजन: "नॉन-एक्सपेंसिव" (Non-Expansive) ऑपरेटर

एक बार जब उन्होंने मानचित्र को ठीक कर लिया, तो उन्हें एक नियम (एक एल्गोरिदम) की आवश्यकता थी जो खेल खेलते समय AI के अनुमान को अपडेट करे।

मानक AI लर्निंग में, हम आमतौर पर एक "कॉन्ट्रैक्शन" (contraction) गुण पर भरोसा करते हैं। कल्पना कीजिए कि एक रबर बैंड है जो हर बार खींचने पर सिकुड़ जाता है, और अंततः एक एकल बिंदु पर आकर रुक जाता है। यह गारंटी देता है कि AI उत्तर सीख जाएगा।

हालाँकि, इस नए सिस्टम में बायस की "स्लाइडिंग" प्रकृति के कारण, रबर बैंड सिकुड़ता नहीं है। इसके बजाय, यह एक नॉन-एक्सपेंसिव (non-expansive) वस्तु की तरह व्यवहार करता है। कल्पना कीजिए कि यह एक कठोर धातु की छड़ है। यदि आप एक सिरे को धकेलते हैं, तो दूसरा सिरा भी उतनी ही मात्रा में हिलता है, लेकिन छड़ छोटी या लंबी नहीं होती है। यह स्वाभाविक रूप से एक एकल बिंदु पर नहीं सिमटती; यह बस एक-दूसरे से समान दूरी बनाए रखती है।

लेखकों ने सिद्ध किया कि भले ही यह "धातु की छड़" सिकुड़ती नहीं है, फिर भी उनका नया एल्गोरिदम काम करता है। उन्होंने दिखाया कि:

  1. एल्गोरिदम वेल-डिफाइंड (well-defined) है (यह गणितीय रूप से तर्कसंगत है)।
  2. यह नॉन-एक्सपेंसिव (non-expansive) है (यह त्रुटियों को बढ़ने नहीं देता)।
  3. यह अभी भी एक फिक्स्ड पॉइंट (fixed point) (एक स्थिर समाधान) पाता है जहाँ AI अपना विचार बदलना बंद कर देता है।

व्यावहारिक ट्रिक: "गेन" को चलते-चलते सीखना

एक अंतिम बाधा थी। अपने परफेक्ट "स्लाइडिंग मैप" एल्गोरिदम का उपयोग करने के लिए, AI को पुरस्कारों में से घटाने के लिए सटीक "गेन" (औसत गति) जानने की आवश्यकता है। लेकिन वास्तविक दुनिया में, AI को अभी तक औसत गति का पता नहीं है; वह तो इसे सीखने की कोशिश कर रहा है!

समाधान: कप्ल्ड रिकर्सन (Coupled Recursion)
लेखकों ने मुख्य प्रक्रिया के साथ चलने वाली एक दूसरी, सरल लर्निंग प्रक्रिया जोड़ी।

  • मुख्य मस्तिष्क (The Main Brain): बायस वितरण के आकार (ट्रेन कार) को सीखता है।
  • साइडकिक (The Sidekick): एक सरल कैलकुलेटर जो नवीनतम प्राप्त अंकों के आधार पर औसत गति (Gain) के अपने अनुमान को लगातार अपडेट करता है।

उन्होंने सिद्ध किया कि ये दोनों मस्तिष्क एक-दूसरे से बात कर सकते हैं। साइडकिक औसत गति का अनुमान लगाने में बेहतर होता जाता है, जो मुख्य मस्तिष्क को अपनी ट्रेन कार को सही ढंग से केंद्रित करने में मदद करता है। भले ही साइडकिक केवल अनुमान लगा रहा हो, पूरा सिस्टम स्थिर रहता है और सही उत्तर तक पहुँचता है।

उन्होंने क्या परीक्षण किया

यह सिद्ध करने के लिए कि यह काम करता है, उन्होंने प्रयोग किए:

  1. एक सरल 5-स्टेट गेम: उन्होंने एक बहुत ही छोटा, सरल संसार बनाया। उन्होंने दिखाया कि उनकी नई विधि सही उत्तर तक पहुँचती है, जबकि पुराने तरीके जो "शून्य" बिंदु को जबरदस्ती थोपने की कोशिश करते थे, वे विफल हो गए या अटक गए।
  2. पेंडुलम सिमुलेशन: उन्होंने न्यूरल नेटवर्क का उपयोग करके एक अधिक जटिल, निरंतर कार्य (पेंडुलम को संतुलित करना) पर इसका परीक्षण किया। बढ़ी हुई जटिलता के बावजूद, उनकी विधि ने "स्लाइडिंग" समस्या को अनदेखा करने वाले साधारण दृष्टिकोण की तुलना में बायस वितरण को बहुत बेहतर तरीके से सीखा।

एक वाक्य में सारांश

लेखकों ने AI के लिए दीर्घकालिक पुरस्कारों को सीखने का एक नया तरीका आविष्कार किया, जिसमें "शून्य की अनिश्चितता" को एक बग के बजाय एक विशेषता के रूप में इस्तेमाल किया गया है; उन्होंने एक "स्लाइडिंग मैप" दृष्टिकोण का उपयोग किया जो AI को सटीक शुरुआती बिंदु जाने बिना बायस के आकार को सीखने की अनुमति देता है, और यह सब करते हुए वह खेल की औसत गति को भी साथ-साथ सीखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →