← नवीनतम पेपर
💬 NLP

ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

ReDiPPO एक नवीन PPO फ्रेमवर्क है जो गणितीय तर्क (mathematical reasoning) के लिए संदर्भ-निर्देशित मूल्य अनुमान (reference-guided value estimation) का लाभ उठाकर और संदर्भ-निर्देशित एवं मानक मूल्य अनुमानों के बीच विसंगति के आधार पर लाभों (advantages) को पुन: भारित करके टोकन-स्तरीय क्रेडिट असाइनमेंट को बढ़ाता है, ताकि स्पार्स रिवॉर्ड्स (sparse rewards) और शोर वाले मूल्यांकन (noisy evaluations) की चुनौतियों का समाधान किया जा सके।

मूल लेखक: Zhenrong Zhang, Fei Wu, Jun Du, Jianshu Zhang, Si Wei

प्रकाशित 2026-07-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenrong Zhang, Fei Wu, Jun Du, Jianshu Zhang, Si Wei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बेहद बुद्धिमान लेकिन थोड़े अनाड़ी रोबोट को जटिल गणितीय पहेलियाँ हल करना सिखा रहे हैं। आपके पास कोई ऐसा शिक्षक नहीं है जो उसके हर एक कदम पर खड़े होकर उसे सुधार सके; इसके बजाय, आप उसे केवल अंत में एक "गोल्ड स्टार" देते हैं यदि अंतिम उत्तर सही है, और गलत होने पर "थम्स डाउन" देते हैं। यह रिनफोर्समेंट लर्निंग विद वेरिएबल रिवार्ड्स (RLVR) की दुनिया है। यह एक वीडियो गेम खेलने जैसा है जहाँ आपको केवल अंतिम बॉस को हराने पर ही अंक मिलते हैं, न कि उन शानदार मूव्स के लिए जो आपने रास्ते में दिखाए थे।

रोबोट को यह सीखने में मदद करने के लिए कि कौन से मूव्स अच्छे थे, वैज्ञानिक एक "क्रिटिक" (Critic) का उपयोग करते हैं—जो एक तरह का आंतरिक कोच है जो यह अनुमान लगाने की कोशिश करता है कि रोबोट जीतने के कितने करीब है। समस्या यह है कि, अंतिम उत्तर देखे बिना, यह कोच अक्सर भ्रमित हो जाता है। इसे लग सकता है कि एक कदम बहुत आशाजनक दिख रहा है जबकि वह वास्तव में एक डेड एंड (बंद रास्ता) है, या यह एक ऐसे कदम को लेकर घबरा सकता है जो वास्तव में एकदम सटीक था। यह भ्रम रोबोट की सीख को अव्यवस्थित और धीमा बना देता है। आप जिस शोध पत्र को पढ़ने जा रहे हैं, वह इसी सिरदर्द का समाधान करता है: हम रोबोट के कोच को दिशा का बेहतर बोध कैसे दे सकते हैं, बिना रोबोट को खेल के दौरान ही उत्तर कुंजी (answer key) देखने की अनुमति दिए?


शोध पत्र: ReDiPPO – द "प्रिविलेज्ड कोच" (विशेषाधिकार प्राप्त कोच)

इस शोध पत्र के पीछे के शोधकर्ताओं, जेनिंगरोंग झांग और उनकी टीम ने ReDiPPO नामक एक चतुर नई प्रशिक्षण विधि प्रस्तावित की है। इसे रोबोट के आंतरिक कोच को एक "चीट शीट" (नकल के लिए संकेत) के माध्यम से प्रशिक्षित करने का एक तरीका समझें, जिसे रोबोट स्वयं कभी नहीं देख पाता।

यहाँ सेटअप है: रोबोट (जिसे एक्टर कहा जाता है) एक गणितीय समस्या को हल करने के लिए तर्क की एक लंबी श्रृंखला लिखने का प्रयास करता है, एक बार में एक शब्द या "टोकन"। अंत में, एक सत्यापनकर्ता (verifier) जाँच करता है कि अंतिम उत्तर सही है या नहीं। यदि उत्तर सही है, तो रोबोट को इनाम मिलता है।

मानक प्रशिक्षण में, कोच (जिसे क्रिटिक कहा जाता है) को रोबोट द्वारा उठाए गए हर कदम का मूल्य अनुमानित करना होता है, लेकिन वह केवल प्रॉम्प्ट और रोबोट के आंशिक उत्तर को देखता है। यह केवल पहले अध्याय को पढ़कर रहस्यमयी उपन्यास के अंत की भविष्यवाणी करने जैसा है, बिना यह जाने कि कहानी में क्या मोड़ आने वाले हैं। कोच अक्सर गलत अनुमान लगाता है, जिससे रोबोट के लिए भ्रामक और शोर भरे निर्देश उत्पन्न होते हैं।

ReDiPPO खेल बदल देता है क्योंकि यह कोच को एक गुप्त लाभ देता है।

दो-कोच प्रणाली (The Two-Coach System)

ReDiPPO एक दोहरी-कोच प्रणाली पेश करता है:

  1. स्टैंडर्ड कोच (Standard Coach): यह सामान्य कोच है। यह प्रॉम्प्ट और रोबोट के आंशिक उत्तर को देखता है, लेकिन अंतिम सही उत्तर को नहीं देख पाता। यह देख पा रहे डेटा के आधार पर वर्तमान कदम का मूल्य अनुमान लगाने की कोशिश करता है।
  2. रेफरेंस-गाइडेड कोच (Reference-Guided Coach): यह "प्रिविलेज्ड" (विशेषाधिकार प्राप्त) कोच है। यह प्रॉम्प्ट, रोबोट का आंशिक उत्तर और सही अंतिम उत्तर (रेफरेंस) तीनों को देखता है। क्योंकि यह गंतव्य को जानता है, इसलिए यह बहुत अधिक सटीकता से यह निर्णय ले सकता है कि रोबोट सही रास्ते पर है या नहीं।

महत्वपूर्ण बात यह है कि रोबोट स्वयं सही उत्तर कभी नहीं देख पाता। उसे इसे खुद ही सुलझाना होता है। केवल कोचों को ही गुप्त जानकारी मिलती है।

"डिस्क्रिपेंसी" (विसंगति) डिटेक्टर

जादू तब होता है जब दोनों कोच आपस में तुलना करते हैं।

  • यदि दोनों कोच सहमत हैं कि एक कदम अच्छा है, तो बहुत बढ़िया! रोबलेट को एक मानक थम्स-अप मिलता है।
  • लेकिन क्या होगा यदि स्टैंडर्ड कोच को लगता है कि एक कदम ठीक है, जबकि रेफरेंस-गाइडेड कोच (जो उत्तर जानता है) को लगता है कि यह एक आपदा है? या इसके विपरीत?

इस अंतर को डिस्क्रिपेंसी (विसंगति) कहा जाता है। शोध पत्र सुझाव देता है कि एक बड़ी विसंगति एक बड़े खतरे का संकेत है। इसका मतलब है कि स्टैंडर्ड कोच उस विशिष्ट क्षण में भ्रमित या अविश्वसनीय है। यह एक जीपीएस की तरह है जो कहता है "बाएँ मुड़ें" जबकि आपका दोस्त (जो रास्ता जानता है) चिल्लाकर कहता है "नहीं, वह एक बंद रास्ता है!"

ReDiPPO इस असहमति का उपयोग रोबोट की सीख को रीवेट (reweight) करने के लिए करता है। जब कोचों के बीच असहमति होती है, तो सिस्टम उस कदम के फीडबैक के महत्व को बढ़ा देता है। यह रोबोट को बताता है: "अरे, यहाँ विशेष ध्यान दो! मानक अनुमान संदिग्ध था, लेकिन विशेषज्ञ जो उत्तर जानता है, उसका मानना है कि यह कदम महत्वपूर्ण है।"

परिणाम: एक स्मार्ट रोबोट

टीम ने तीन अलग-अलग प्रकार के AI मॉडलों का उपयोग करके AIME और OlympiadBench जैसी कठिन प्रतियोगिताओं सहित छह विभिन्न गणितीय बेंचमार्क पर इस नई विधि का परीक्षण किया।

परिणाम उत्साहजनक थे:

  • बेहतर सटीकता: ReDiPPO ने लगातार मानक विधियों को पछाड़ दिया। औसतन, इसने मानक PPO पद्धति की तुलना में रोबोट के प्रदर्शन में 1.19 से 2.37 प्रतिशत अंक का सुधार किया।
  • बेहतर अनुमान: "रेफरेंस-गाइडेड कोच" परिणामों के निष्कर्ष को बताने में मानक कोच की तुलना में बहुत बेहतर था। इसने परिणामों के अधिक उतार-चढ़ाव को समझाया (एक मीट्रिक जिसे "एक्सप्लेन्ड वेरिएंस" कहा जाता है) और कई विकल्पों में से सही पथ चुनने में बेहतर प्रदर्शन किया।
  • सही संतुलन (The Sweet Spot): विश्लेषण से पता चला कि यह "गुप्त कोच" तर्क प्रक्रिया के बाद के चरणों में सबसे अधिक सहायक था। जब रोबोट एक लंबे, जटिल व्युत्पत्ति (derivation) के बीच में होता है, तो यह जानने वाला कोच कि अंतिम उत्तर क्या है, यह स्पष्ट करने में मदद करता है कि क्या रास्ता अभी भी वैध है।

शोधकर्ताओं ने यह भी पाया कि "डिस्क्रिपेंसी" सिग्नल कठिनाई का एक बेहतरीन संकेतक था। जब दोनों कोचों के बीच बहुत अधिक असहमति होती थी, तो इसका मतलब आमतौर पर यह था कि रोबोट एक बहुत कठिन समस्या पर काम कर रहा था, जिसके परिणामस्वरूप अक्सर लंबे और त्रुटिपूर्ण उत्तर मिलते थे। इन क्षणों पर अतिरिक्त ध्यान केंद्रित करके, ReDiPPO ने रोबोट को गणितीय भूलभुलैया के सबसे कठिन हिस्सों को अधिक प्रभावी ढंग से पार करने में मदद की।

संक्षेप में, ReDiPPO रोबोट को नकल नहीं करने देता, लेकिन यह रोबोट के शिक्षक को एक सुपरपावर देता है: दौड़ के दौरान फिनिश लाइन को देखने की क्षमता। यह शिक्षक को अधिक सटीक और बेहतर सलाह देने की अनुमति देता है, जिससे एक स्मार्ट और अधिक विश्वसनीय गणित समाधान प्राप्त होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →