← नवीनतम पेपर
💬 NLP

Online Causal Kalman Filtering for Stable and Effective Policy Optimization

यह शोध पत्र पॉलिसी ऑप्टिमाइज़ेशन के लिए ऑनलाइन कॉज़ल कलमन फ़िल्टरिंग (KPO) का प्रस्ताव करता है, जो एक नवीन विधि है जो टोकन-स्तरीय ऑफ-पॉलिसी लर्निंग में उच्च-विचलन शोर और संरचनात्मक विसंगतियों को कम करने के लिए इम्पॉर्टेंस सैंपलिंग रेश्यो को कलमन फ़िल्टरिंग के माध्यम से अपडेट किए गए विकसित होने वाले लेटेंट स्टेट्स के रूप में मॉडल करती है, जिससे बड़े भाषा मॉडलों के लिए अधिक स्थिर और प्रभावी सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) प्राप्त होता है।

मूल लेखक: Shuo He, Lang Feng, Xin Cheng, Lei Feng, Bo An

प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuo He, Lang Feng, Xin Cheng, Lei Feng, Bo An

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े अराजक (chaotic) छात्र (एक Large Language Model) को जटिल गणित की समस्याएं हल करना सिखा रहे हैं। आप उसे एक समस्या देते हैं, वह इसे चरण-दर-चरण हल करने की कोशिश करता है, और फिर आप उसे फीडबैक देते हैं: "अच्छा काम किया!" या "वह चरण गलत था।"

लक्ष्य छात्र के मस्तिष्क को इस तरह से ढालना है कि वह अगली बार कम गलतियाँ करे। इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है।

समस्या: "नॉइजी फीडबैक" (Noisy Feedback) लूप

अतीत में, जब छात्र गलती करता था, तो शिक्षक पूरे उत्तर को देखता था और कहता था, "पूरा उत्तर 80% अच्छा था।" यह एक पूरे निबंध के लिए एक एकल ग्रेड देने जैसा है। यह स्थिर है, लेकिन यह बहुत सटीक नहीं है।

अधिक सटीक होने के लिए, आधुनिक शिक्षकों ने छात्र द्वारा लिखे गए प्रत्येक शब्द को देखना शुरू किया। वे कहते थे, "शब्द 'इसलिए' (therefore) एकदम सही था, लेकिन शब्द 'गणना करें' (calculate) थोड़ा गलत था।"

यहाँ एक पेंच है: क्योंकि छात्र चलते-चलते सीख रहा है, उसकी "आंतरिक आवाज़" (पुरानी पॉलिसी) हर उस शब्द के साथ बदल जाती है जो वह लिखता है। जब शिक्षक एक शब्द-दर-शब्द नए उत्तर की तुलना पुराने से करने की कोशिश करता है, तो फीडबैक अविश्वसनीय रूप से अस्थिर और शोर भरा (jittery and noisy) हो जाता है।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक रस्सी पर चल रहे हैं (tightrope walking) जबकि कोई व्यक्ति हर सेकंड आपको यादृच्छिक (random) नंबर चिल्लाकर सुना रहा है। कभी वे चिल्लाते हैं "बाएं!", कभी "दाएं!", कभी "ऊपर!", तो कभी "नीचे!"—एक ही कदम के भीतर। यदि आप हर एक चिल्लाहट के आधार पर अपना संतुलन बदलने की कोशिश करते हैं, तो आप गिर जाएंगे। छात्र भ्रमित हो जाता है, प्रशिक्षण क्रैश हो जाता है, और मॉडल सीखना बंद कर देता है।

पुराने समाधान: बहुत अस्पष्ट या बहुत अव्यवस्थित

  1. "पूरा निबंध" वाला दृष्टिकोण: कुछ शिक्षकों ने व्यक्तिगत शब्दों को देखना बंद कर दिया और बस पूरे उत्तर के लिए एक स्कोर दे दिया। यह स्थिर है, लेकिन यह एक छात्र को यह बताने जैसा है कि, "आपका निबंध अच्छा है," बिना यह बताए कि कौन सा पैराग्राफ खराब था। आप सूक्ष्म विवरणों को खो देते हैं।
  2. "कच्चा शब्द" (Raw Word) वाला दृष्टिकोण: अन्य लोगों ने हर एक शब्द को व्यक्तिगत रूप से ठीक करने की कोशिश की। लेकिन जैसा कि हमने देखा, फीडबैक बहुत शोर भरा है। छात्र को विरोधाभासी सुधारों से चक्कर आ जाता है।

नया समाधान: KPO (द "स्मार्ट फ़िल्टर")

लेखकों ने एक नई विधि प्रस्तावित की है जिसे KPO (कलमन पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। उन्होंने महसूस किया कि हालांकि व्यक्तिगत शब्दों के लिए फीडबैक शोर भरा है, लेकिन छात्र के आत्मविश्वास का अंतर्निहित रुझान (underlying trend) सुचारू होना चाहिए।

उपमा: मौसम का पूर्वानुमान बनाम हवा का झोंका

कल्पना कीजिए कि आप तापमान का अनुमान लगाने की कोशिश कर रहे हैं।

  • कच्चा डेटा (Raw Data): एक हवा का झोंका आपके थर्मामीटर से टकराता है, और एक सेकंड के लिए यह 100°F पढ़ता है। फिर एक बादल गुजर जाता है, और यह 40°F पढ़ता है। फिर सूरज निकल आता है, और यह 90°F पढ़ता है। यदि आप इस डेटा के हर एक सेकंड के आधार पर कपड़े पहनने का निर्णय लेते, तो आप एक ही समय में ठंड और गर्मी दोनों महसूस कर रहे होते।
  • कलमन फ़िल्टर (Kalman Filter): यह एक गणितीय उपकरण है (मूल रूप से रॉकेट और मिसाइलों को निर्देशित करने के लिए उपयोग किया जाता है) जो एक स्मार्ट मौसम पूर्वानुमानकर्ता की तरह कार्य करता है। यह शोर भरे डेटा को देखता है लेकिन जानता है कि, "हे, तापमान वास्तव में एक सेकंड में 40 से 100 नहीं हो सकता। यह सिर्फ एक गड़बड़ी (glitch) है।"

कलमन फ़िल्टर कहता है: "पागलपन भरे उछालों को अनदेखा करें। पिछले कुछ सेकंड को देखें। तापमान संभवतः धीरे-धीरे बढ़ रहा है। आइए शोर को कम करें और रुझान (trend) का अनुसरण करें।"

KPO सरल शब्दों में कैसे काम करता है

  1. यह प्रवाह को देखता है: प्रत्येक शब्द के फीडबैक को एक अलग घटना के रूप में मानने के बजाय, KPO शब्दों के अनुक्रम को एक निरंतर कहानी के रूप में देखता है।
  2. यह शोर को सुचारू बनाता है: जब किसी विशिष्ट शब्द के लिए फीडबैक अजीब दिखता है (जैसे कि "महत्व" में अचानक उछाल), तो KPO पूछता है, "क्या पिछले शब्द ने इसका संकेत दिया था? क्या यह छात्र की रणनीति में वास्तविक बदलाव है, या सिर्फ एक गड़बड़ी है?"
  3. यह संरचना को बनाए रखता है: यह केवल सब कुछ औसत (average) नहीं कर देता (जिससे विवरण खो सकते हैं)। यह लर्निंग सिग्नल के आकार को सुरक्षित रखता है। यदि छात्र वास्तव में वाक्य के एक विशिष्ट भाग में बेहतर हो रहा है, तो KPO उस सिग्नल को मजबूत रखता है। यदि यह केवल यादृच्छिक शोर है, तो KPO उसे कम कर देता है।

परिणाम: एक स्थिर शिक्षार्थी

इस "स्मार्ट फ़िल्टर" का उपयोग करके, छात्र (AI) को ऐसा फीडबैक मिलता है जो है:

  • सुचारू (Smooth): विरोधाभासी निर्देशों से अब कोई चक्कर नहीं आता।
  • सटीक (Precise): इसे अभी भी पता चलता है कि उत्तर के किन हिस्सों पर काम करने की आवश्यकता है, लेकिन बिना शोर के।
  • स्थिर (Stable): प्रशिक्षण क्रैश नहीं होता। मॉडल जटिल गणितीय तर्क को पहले की तुलना में बहुत तेज़ी से और बेहतर तरीके से सीखता है।

सारांश

KPO को AI की सीखने की प्रक्रिया के लिए "नॉइज़-कैंसलिंग हेडफ़ोन" के रूप में समझें।

  • इसके बिना: AI हर शब्द के लिए "अच्छा काम किया!" और "बुरा काम किया!" के एक अराजक मिश्रण को सुनता है, जिससे वह घबरा जाता है और विफल हो जाता है।
  • इसके साथ: AI एक स्पष्ट, स्थिर आवाज़ सुनता है जो कहती है, "आप यहाँ बहुत अच्छा कर रहे हैं, और आपको वहां इस विशिष्ट भाग को ठीक करने की आवश्यकता है," जिससे उसे शोर (static) पर प्रतिक्रिया देने के बजाय सीखने पर ध्यान केंद्रित करने की अनुमति मिलती है।

यह शोध सिद्ध करता है कि इस "स्मार्ट स्मूथिंग" तकनीक को लागू करके, AI मॉडल सीखने की प्रक्रिया के दौरान टूटे बिना बहुत कठिन गणित की समस्याओं को हल कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →