← नवीनतम पेपर
🤖 machine learning

On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR

यह शोध पत्र प्रकट करता है कि सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण सीखना (RLVR) निहित पुरस्कार ओवरफिटिंग प्रदर्शित करता है और लो-रैंक डायनेमिक्स के माध्यम से संचालित होता है, जहाँ उन्नत तर्क क्षमताएं रैंक-1 घटकों में केंद्रित होती हैं जो एक विशिष्ट हेवी-टेल्ड सिंगुलर स्पेक्ट्रम को अनुकूलित करती हैं जबकि अन्य मॉडल ज्ञान को त्याग देती हैं।

मूल लेखक: Hao Ye, Jisheng Dang, Junfeng Fang, Bimei Wang, Yizhou Zhang, Ning Lv, Wencan Zhang, Hong Peng, Bin Hu, Tat-Seng Chua

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hao Ye, Jisheng Dang, Junfeng Fang, Bimei Wang, Yizhou Zhang, Ning Lv, Wencan Zhang, Hong Peng, Bin Hu, Tat-Seng Chua

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR" शोध पत्र का सरल भाषा और रचनात्मक उपमाओं के साथ हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: सुदृढीकरण शिक्षण (Reinforcement Learning) का "जादू"

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान छात्र (एक Large Language Model) है जो कई चीज़ों में अच्छा है, लेकिन जटिल गणितीय पहेलियों को सुलझाने में उतना माहिर नहीं है। आप एक विशेष प्रशिक्षण विधि का उपयोग करने का निर्णय लेते हैं जिसे Verifiable Rewards के साथ Reinforcement Learning (RLVR) कहा जाता है। इसे एक सख्त कोच की तरह समझें जो छात्र को हर बार सही गणितीय उत्तर देने पर एक 'गोल्ड स्टार' देता है।

प्रशिक्षण के बाद, छात्र गणित का जीनियस बन जाता है। लेकिन इस शोध पत्र के शोधकर्ताओं ने एक पेचीदा सवाल पूछा: क्या छात्र ने वास्तव में नई तर्कशक्ति (logic) सीखी, या उसने केवल कोच के स्कोरिंग सिस्टम को चकमा देना सीख लिया?

1. "एक-सुर" वाला जीनियस (Rank-1 Dominance)

शोधकर्ताओं ने एक आश्चर्यजनक बात खोजी: लगभग सारा "गणित जीनियस" वाला सुधार छात्र के मस्तिष्क के केवल एक बहुत छोटे हिस्से में होता है।

  • उपमा: कल्पना कीजिए कि छात्र का मस्तिष्क करोड़ों किताबों वाला एक विशाल पुस्तकालय है। जब वह गणित में अच्छा होता है, तो ऐसा इसलिए नहीं होता क्योंकि उसने अधिक किताबें पढ़ी हैं। बल्कि इसलिए होता है क्योंकि उसे एक विशिष्ट, जादु적인 बुकमार्क (जिसे "Rank-1 component" कहा जाता है) मिल गया है जो तुरंत सही उत्तर की ओर इशारा करता है।
  • निष्कर्ष: यदि आप प्रशिक्षित मॉडल को लें और उस एक जादुई बुकमार्क को छोड़कर बाकी सब कुछ हटा दें, तो भी मॉडल गणित में उतना ही अच्छा रहेगा जितना कि पूरी तरह से प्रशिक्षित संस्करण। शेष "मस्तिष्क अपडेट" (अन्य लाखों पृष्ठ) गणित कौशल के लिए बहुत कम काम करते हैं।

2. "दिखावा करने तक टिके रहो" वाली समस्या (Implicit Reward Overfitting)

यहाँ एक विरोधाभासी हिस्सा है। शोधकर्ताओं ने एक प्रशिक्षण विधि बनाई जहाँ उन्होंने छात्र को मजबूर किया कि वह केवल उस "एक जादुई बुकमार्क" को रखे और हर कुछ चरणों के बाद बाकी के अपडेट्स को हटा दे।

  • परिणाम: छात्र का प्रशिक्षण टेस्ट (अभ्यास के प्रश्न जो कोच ने दिए थे) पर स्कोर गिर गया। कोच नाखुश था क्योंकि अभ्यास के दौरान छात्र को उतने गोल्ड स्टार नहीं मिल रहे थे।
  • ट्विस्ट: हालाँकि, जब छात्र ने फाइनल एग्जाम (प्रश्नों का एक नया सेट जिसे उसने पहले कभी नहीं देखा था) दिया, तो उसका प्रदर्शन उस छात्र के समान ही शानदार रहा जिसने सभी अतिरिक्त अपडेट्स को बनाए रखा था।
  • अर्थ: "अतिरिक्त अपडेट्स" जिन्हें छात्र आमतौर पर सीखता है, वे वास्तव में शोर (noise) हैं। वे छात्र द्वारा अभ्यास के विशिष्ट प्रश्नों को रटने का एक तरीका हैं ताकि अधिक गोल्ड स्टार मिल सकें, न कि वास्तविक तर्क (logic) सीखने का। शोधकर्ता इसे "Implicit Reward Overfitting" कहते हैं। मॉडल प्रशिक्षण डेटा पर उच्च स्कोर पाने के लिए "दिखावा" कर रहा है, बिना वास्तव में स्मार्ट हुए।

3. "सुरक्षा जाल" (हमें बाकी चीज़ों की आवश्यकता क्यों है?)

यदि "अतिरिक्त अपडेट्स" गणित के लिए केवल शोर हैं, तो उन्हें रखना क्यों ज़रूरी है? शोधकर्ताओं ने पाया कि वे अतिरिक्त अपडेट वास्तव में छात्र का व्यक्तित्व और सामान्य ज्ञान हैं।

  • उपमा: यदि आप "अतिरिक्त अपडेट्स" को हटा देते हैं और केवल "गणित का बुकमार्क" रखते हैं, तो छात्र गणित का जीनियस तो बन जाएगा, लेकिन वह निर्देशों का पालन करने, सुरक्षित रहने या दुनिया के बारे में सामान्य तथ्य जानने की क्षमता खो देगा।
  • निष्कर्ष: "Rank-1" वाला हिस्सा तर्क (reasoning) के लिए है। "Non-Rank-1" वाले हिस्से सुरक्षा, विश्व ज्ञान और नियमों का पालन करने के लिए हैं। यदि आप उन्हें हटा देते हैं, तो मॉडल गणित के सवाल तो पूरी तरह हल कर सकता है, लेकिन वह बदतमीजी करना शुरू कर सकता है या इंसानों से बात करना भूल सकता है।

4. सीखने का आकार (The Heavy-Tailed Distribution)

शोधकर्ताओं ने SVD नामक एक गणितीय उपकरण का उपयोग करके मॉडल के मस्तिष्क में होने वाले परिवर्तनों के "आकार" को देखा।

  • पैटर्न: उन्होंने एक सुसंगत पैटर्न पाया: एक विशाल उछाल (गणित का बुकमार्क) और उसके बाद छोटे बदलावों की एक लंबी, धीमी पूंछ (tail)।
  • रूपक: एक पर्वत श्रृंखला की कल्पना करें। वहाँ एक ऊँची, नुकीली चोटी (गणित का तर्क) है। उसके पीछे, एक लंबी, ढलती हुई पहाड़ी (सुरक्षा और ज्ञान) है। चोटी वह है जो मॉडल को गणित का जादूगर बनाती है, लेकिन पहाड़ी उसे जमीन से जोड़े रखती है और सुरक्षित रखती है।

5. "एकतरफा रास्ता" (Geometric Asymmetry)

अंत में, शोध पत्र बताता है कि मॉडल यह कैसे सीखता है। उन्होंने पाया कि सीखने की प्रक्रिया एकतरफा है।

  • उपमा: कल्पना कीजिए कि मॉडल एक फैक्ट्री है।
    • आउटपुट (उत्तर): फैक्ट्री यह सीख जाती है कि अंतिम उत्पाद (उत्तर) को बहुत आसानी से कैसे बदला जाए। यह एक कन्वेयर बेल्ट की तरह है जिसे सही आइटम को पैक करने के लिए जल्दी से समायोजित किया जा सकता है। यह गणित का "बायां हिस्सा" है, और यह "Rank-1" बुकमार्क के साथ पूरी तरह मेल खाता है।
    • इनपुट (प्रश्न): फैक्ट्री आने वाले प्रश्नों को पढ़ने के तरीके को बदलने में संघर्ष करती है। प्रश्न अव्यवस्थित और जटिल होते हैं। मॉडल एक साधारण "बुकमार्क" के साथ इनपुट को समझने के अपने तरीके को आसानी से पुनर्गठित नहीं कर सकता।
  • निष्कर्ष: RLVR मुख्य रूप से आउटपुट को अनुकूलित करने (मॉडल कैसे सही उत्तर चुनता है) के बारे में है, न कि मौलिक रूप से यह बदलने के बारे में कि मॉडल दुनिया को कैसे समझता है। यह एक छात्र को प्रश्न को बेहतर ढंग से पढ़ने के बजाय, परीक्षा में सही उत्तर का अनुमान लगाना सिखाने जैसा है।

सारांश

यह शोध पत्र हमें बताता है कि जब AI मॉडल सुदृढीकरण शिक्षण (Reinforcement Learning) के माध्यम से गणित में "स्मार्ट" होते हैं:

  1. ज्यादातर जादू एक छोटे, एक-आयामी "बुकमार्क" (Rank-1) में केंद्रित होता है।
  2. बाकी प्रशिक्षण अक्सर केवल अभ्यास टेस्ट को रटने (Overfitting) के बारे में होता है, जिससे फाइनल एग्जाम में कोई वास्तविक मूल्य नहीं जुड़ता।
  3. हमें "शोर" की आवश्यकता है (Non-Rank-1 हिस्से) ताकि मॉडल को सुरक्षित और जानकार बनाए रखा जा सके, भले ही वह गणित में मदद न करे।
  4. मॉडल बेहतर उत्तर देने के लिए सीख रहा है, न कि अनिवार्य रूप से इनपुट को बेहतर समझने के लिए।

शोधकर्ता सुझाव देते हैं कि इस बात को समझकर, हम मॉडल को अधिक कुशलता से प्रशिक्षित कर सकते हैं, तर्क के लिए "बुकमार्क" पर ध्यान केंद्रित करते हुए और सुरक्षा एवं ज्ञान के लिए "पहाड़ी" की रक्षा करते हुए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →