← नवीनतम पेपर
🤖 machine learning

K-Score: Kalman Filter as a Principled Alternative to Reward Normalization in Reinforcement Learning

यह शोध पत्र "K-Score" का प्रस्ताव करता है, जो पारंपरिक रिवॉर्ड नॉर्मलाइजेशन (reward normalization) के स्थान पर पॉलिसी ग्रेडिएंट सुदृढीकरण शिक्षण (policy gradient reinforcement learning) में 1D कलमन फ़िल्टर (1D Kalman filter) का उपयोग करके रिवॉर्ड माध्य (reward means) का पुनरावर्ती अनुमान लगाता है, जिससे गैर-स्थिर वातावरण (non-stationary environments) में विचरण (variance) कम होता है और अभिसरण (convergence) में तेजी आती है।

मूल लेखक: Zixuan Xia, Quanxi Li

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zixuan Xia, Quanxi Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पिल्ले को "बैठना" सिखा रहे हैं।

आर्टिफिशियल इंटेलिजेंस की दुनिया में (विशेष रूप से "रीइन्फोर्समेंट लर्निंग" में), हम "एजेंट्स" (डिजिटल पिल्लों) को पुरस्कार देकर सिखाते हैं। यदि वे कुछ सही करते हैं, तो उन्हें एक "ट्रीट" (एक सकारात्मक संख्या) मिलती है; यदि वे कुछ गलत करते हैं, तो उन्हें कुछ नहीं मिलता या दंड मिलता है।

समस्या: "मूड स्विंग" का प्रभाव

समस्या यह है कि AI ट्रेनिंग में "ट्रीट्स" अक्सर बहुत असंगत होते हैं। एक पल में एजेंट को बहुत बड़ा इनाम मिलता है, और अगले ही पल उसे शून्य मिल जाता है। यह एक ऐसे पिल्ले के ट्रेनर की तरह है जो एक सेकंड के लिए अविश्वसनीय रूप से उत्साहित होता है और अगले ही पल अचानक पूरी तरह से शांत हो जाता है।

क्योंकि रिवॉर्ड्स इतने उछल-कूद करने वाले (jumpy) होते हैं, AI "भ्रमित" हो जाता है। उसे समझ नहीं आता कि उसने कुछ महान किया या वह सिर्फ भाग्यशाली था। यह भ्रम सीखने की प्रक्रिया को धीमा, अस्थिर और "क्रैश" होने के प्रति संवेदनशील बना देता है—जहाँ AI अचानक वह सब कुछ भूल जाता है जो उसने सीखा था और फिर से एक पिल्ले की तरह व्यवहार करने लगता है।

इसे ठीक करने के लिए, इंजीनियर आमतौर पर "रिवॉर्ड नॉर्मलाइजेशन" का उपयोग करते हैं। इसे एक ऐसे ट्रेनर के रूप में सोचें जो अब तक दिए गए सभी ट्रीट्स का एक नोटबुक रखता है और उन्हें औसत निकालने की कोशिश करता है। यह ठीक-ठाक काम करता है, लेकिन यह थोड़ा "बेवकूफी भरा" है—यह हर ट्रीट के साथ एक जैसा व्यवहार करता है और जब पिल्ले का व्यवहार (या ट्रेनर की शैली) अचानक बदल जाता है, तो संघर्ष करता है।

समाधान: "K-Score" (स्मार्ट ट्रेनर)

इस पेपर के लेखक K-Score नामक कुछ बहुत अधिक स्मार्ट प्रस्ताव देते हैं, जो एक कलमन फ़िल्टर (Kalman Filter) नामक गणितीय उपकरण का उपयोग करता है।

एक साधारण नोटबुक जो केवल औसत निकालती है, उसके बजाय, कल्पना करें कि ट्रेनर के पास अब एक "स्मार्ट अंतर्ज्ञान" (Smart Intuition) है। यह ट्रेनर केवल औसत नहीं देखता; वह लगातार खुद से दो सवाल पूछता है:

  1. "मुझे इस विशिष्ट ट्रीट पर कितना भरोसा करना चाहिए?" (क्या यह एक इत्तेफाक है, या पिल्ला वास्तव में सीख रहा है?)
  2. "वातावरण कितना बदल रहा है?" (क्या पिल्ला बड़ा हो रहा है, या मेरा बस एक अजीब दिन है?)

कलमन फ़िल्टर एक कैमरे के "हाई-टेक स्टेबलाइज़र" की तरह है। जब आप एक हिलता हुआ (shaky) वीडियो शूट कर रहे होते हैं, तो स्टेबलाइज़र केवल कैमरे को वापस केंद्र में लाने की कोशिश नहीं करता; यह अनुमान लगाता है कि हलचल किस दिशा में जा रही है और उसे वास्तविक समय में सुचारू बनाता है, जिससे वह एक उद्देश्यपूर्ण पैन (pan) और एक रैंडम शेक (shake) के बीच अंतर कर पाता है।

यह कैसे काम करता है (रूपक/Metaphor)

K-Score AI के मस्तिष्क के लिए एक "सिग्नल फ़िल्टर" की तरह कार्य करता है:

  • शोर (The Noise): रैंडम, उछल-कूद करने वाले रिवॉर्ड्स (वह "हिलता हुआ कैमरा")।
  • सिग्नल (The Signal): वह वास्तविक प्रगति जो AI कर रहा है (वह "सुचारू वीडियो")।

कलमन फ़िल्टर इन उछल-कूद करने वाले रिवॉर्ड्स को देखता है और कहता है: "रुको, वह बड़ा रिवॉर्ड शायद सिर्फ एक किस्मत वाला उछाल था। हमें इस पर अत्यधिक प्रतिक्रिया देने की ज़रूरत नहीं है। लेकिन रिवॉर्ड्स में यह निरंतर वृद्धि? यह वास्तविक प्रगति लग रही है। आइए अपनी अपेक्षाओं को उसी के अनुसार समायोजित करें।"

यह क्यों मायने रखता है?

इस "स्मार्ट अंतर्ज्ञान" का उपयोग करके, शोधकर्ताओं ने पाया कि:

  1. AI बहुत तेज़ी से सीखता है: यह "नकली" रिवॉर्ड्स के पीछे भागने या "शोर वाले" असफलताओं से हतोत्साहित होने में समय बर्बाद नहीं करता है।
  2. सीखना अधिक सुचारू है: इसमें "मेल्टडाउन" की घटनाएं कम होती हैं जहाँ AI का प्रदर्शन अचानक गिर जाता है।
  3. यह "प्लग-एंड-प्ले" है: आपको AI के मस्तिष्क को फिर से बनाने की आवश्यकता नहीं है; आप बस उसे अपने रिवॉर्ड्स को समझने का एक स्मार्ट तरीका दे देते हैं।

संक्षेप में: K-Score एक अराजक, उछल-कूद करने वाले ट्रेनिंग सत्र को एक सुचारू, स्थिर बातचीत में बदल देता है, जिससे AI को "शोर" और "वास्तविक प्रगति" के बीच अंतर करने में मदद मिलती है और वह अधिक कुशलता से सीख पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →