← नवीनतम पेपर
🤖 machine learning

Reinforcement Learning with Conditional Expectation Reward

यह शोध पत्र कंडीशनल एक्सपेक्टेशन रिवॉर्ड (CER) का प्रस्ताव करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो सॉफ्ट, ग्रेडेड रिवॉर्ड सिग्नल प्रदान करने के लिए स्वयं लार्ज लैंग्वेज मॉडल का उपयोग एक निहित विवेरिफायर (implicit verifier) के रूप में करती है, जिससे नियम-आधारित सत्यापन की सीमाओं को दूर किया जा सके और गणितीय एवं सामान्य मुक्त-रूप उत्तर डोमेन दोनों में प्रभावी तर्क प्रशिक्षण को सक्षम बनाया जा सके।

मूल लेखक: Changyi Xiao, Caijun Xu, Yixin Cao

प्रकाशित 2026-03-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Changyi Xiao, Caijun Xu, Yixin Cao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली लेकिन बहुत ही शाब्दिक (literal) छात्र (एक Large Language Model) को जटिल समस्याओं को हल करना सिखा रहे हैं, चाहे वह गणित के समीकरण हों या यह समझाना कि आकाश नीला क्यों है।

पुराना तरीका: "सख्त ग्रेडर" (The Strict Grader)

परंपरागत रूप से, हमने RLVR (Verifiable Rewards के साथ Reinforcement Learning) नामक एक विधि का उपयोग किया। इसे एक सख्त ग्रेडर के रूप में सोचें जो केवल तभी उत्तर स्वीकार करता है जब वे बिल्कुल सही हों।

  • यह कैसे काम करता है: यदि प्रश्न "2+2 क्या है?" है, तो ग्रेडर केवल तभी गोल्ड स्टार देता है जब छात्र "4" लिखता है।
  • समस्या: यह गणित या कोडिंग के लिए बहुत अच्छा काम करता है, जहाँ एक स्पष्ट सही उत्तर होता है। लेकिन "क्या क्वांटम भौतिकी नियतिवादी (deterministic) है?" जैसे सामान्य प्रश्नों के लिए, उत्तर "नहीं," "वास्तव में नहीं," या "यह संभाव्य (probabilistic) है" हो सकता है।
  • विफलता: सख्त ग्रेडर कठोर है। यदि छात्र "वास्तव में नहीं" लिखता है, तो ग्रेडर शून्य देता है, और इसे पूरी तरह से गलत उत्तर (जैसे, "हाँ, यह एक टोस्टर है") के समान मानता है। छात्र को यह समझने में कोई मदद नहीं मिलती कि कैसे सुधार किया जाए, उसे केवल कठोर "गलत" मिलता है। यह खुले अंत वाले (open-ended) प्रश्नों के लिए सीखना कठिन बना देता है।

नया तरीका: "आत्म-चिंतनशील मेंटर" (The Self-Reflective Mentor - CER)

लेखक इस पेपर में Conditional Expectation Reward (CER) नामक एक नई विधि प्रस्तावित करते हैं। एक बाहरी ग्रेडर को काम पर रखने के बजाय, वे छात्र को स्वयं को ग्रेड करने की एक चतुर तकनीक सिखाते हैं।

CER को एक आत्म-चिंतनशील मेंटर के रूप में सोचें। यह इस प्रकार काम करता है:

  1. परिदृश्य: छात्र एक उत्तर उत्पन्न करता है (मान लीजिए, "क्वांटम भौतिकी नियतिवादी नहीं है")।
  2. प्रश्न: मेंटर छात्र से पूछता है: "यदि आपको अपना वर्तमान उत्तर जानकर, फिर से एक 'परफेक्ट' संदर्भ उत्तर (reference answer) बनाना पड़े, तो इसकी कितनी संभावना है कि आप परफेक्ट वाला लिखेंगे?"
  3. तर्क:
    • यदि छात्र का उत्तर परफेक्टली अलाइन (aligned) था, तो मॉडल सोचता है, "ओह, मैं इस पर बहुत आश्वस्त हूँ। यदि मैं फिर से प्रयास करूँगा, तो मैं निश्चित रूप से सही उत्तर दूँगा।" -> उच्च रिवॉर्ड (High Reward)।
    • यदि छात्र का उत्तर करीब है लेकिन थोड़ा सा गलत है, तो मॉडल सोचता है, "हम्म, मुझे यकीन है, लेकिन शायद मैं एक शब्द बदल दूँ।" -> मध्यम रिवॉर्ड (Medium Reward)।
    • यदि उत्तर पूरी तरह से गलत है, तो मॉडल सोचता है, "बिल्कुल नहीं। यदि मैं फिर से प्रयास करूँगा, तो मैं इस शुरुआती बिंदु से सही उत्तर नहीं पा सकूँगा।" -> कम रिवॉर्ड (Low Reward)।

यह गेम-चेंजर क्यों है?

1. "ग्रे के शेड्स" बनाम "ब्लैक एंड व्हाइट"
पुराना तरीका ब्लैक एंड व्हाइट (सही या गलत) था। CER एक ग्रेडिएंट (gradient) है। यह आंशिक क्रेडिट देता है।

  • उपमा: एक डार्टबोर्ड की कल्पना करें। पुराना तरीका केवल तभी अंक देता है जब आप बुल्सआई (bullseye) पर हिट करते हैं। यदि आप एक इंच भी चूक जाते हैं, तो आपको शून्य मिलता है। CER आपको बुल्सआई के करीब होने के लिए अंक देता है, जिससे आपको अगली बार बेहतर निशाना लगाने के लिए प्रोत्साहित किया जाता है।

2. किसी बाहरी टूल की आवश्यकता नहीं
आमतौर पर, यह जांचने के लिए कि एक सामान्य उत्तर अच्छा है या नहीं, आपको एक मानव या एक विशेष AI टूल (एक "वेरिफायर") की आवश्यकता होती है जो इसे पढ़े। यह महंगा और धीमा है।

  • उपमा: CER एक संगीतकार की तरह है जो एक नोट सुन सकता है और बिना किसी ट्यूनर ऐप की आवश्यकता के तुरंत जान सकता है कि वह सुर में है या नहीं। मॉडल अपने स्वयं के काम को परखने के लिए अपने आंतरिक "कान" का उपयोग करता है।

3. यह विविधता को संभालता है
वास्तविक दुनिया में, एक ही बात कहने के कई तरीके होते हैं।

  • उपमा: यदि उत्तर "आकाश नीला है" है, तो पुराना ग्रेडर "आकाश आसमानी (azure) है" या "यह नीला है" को अस्वीकार कर सकता है। CER समझता है कि ये सभी अर्थपूर्ण रूप से सही (semantically correct) हैं और छात्र को पुरस्कृत करता है, भले ही शब्द अलग हों।

परिणाम

शोधकर्ताओं ने गणितीय समस्याओं और सामान्य ज्ञान (जैसे भौतिकी और वित्त) दोनों पर इसका परीक्षण किया।

  • गणित पर: इसने सख्त, नियम-आधारित विधियों के समान प्रदर्शन किया।
  • सामान्य विषयों पर: इसने प्रतियोगिता को पछाड़ दिया। इसने तेजी से और बेहतर तरीके से सीखा क्योंकि इसे "लगभग सही" उत्तरों से हतोत्साहित नहीं किया गया।

सारांश

CER AI को प्रशिक्षित करने का एक स्मार्ट तरीका है। एक कठोर शिक्षक के बजाय जो केवल पूर्ण उत्तर स्वीकार करता है, यह एक आत्म-चिंतनशील मेंटर का उपयोग करता है जो क्रमिक फीडबैक (graded feedback) देता है। यह AI को बताता है, "आप करीब पहुँच रहे हैं," बजाय इसके कि केवल "आप गलत हैं।" यह AI को अधिक प्रभावी ढंग से जटिल, खुले अंत वाले तर्क कार्यों को सीखने की अनुमति देता है, और इसके लिए अपने काम की जांच करने हेतु महंगे बाहरी उपकरणों की आवश्यकता नहीं होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →