← नवीनतम पेपर
🤖 AI

Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards

यह शोध पत्र ACOER का प्रस्ताव करता है, जो एक नवीन रिवॉर्ड मैकेनिज्म है जो सही उत्तरों के लिए लेंथ पेनल्टी को अलग करके और डायनेमिक बजट नॉर्मलाइजेशन का उपयोग करके बड़े रीजनिंग मॉडल्स में एफिशिएंसी ट्रेनिंग को स्थिर करता है, जिससे रिवॉर्ड कोलैप्स को रोका जा सकता है और साथ ही सटीकता में उल्लेखनीय सुधार और टोकन जनरेशन में कमी आती है।

मूल लेखक: Jungseob Lee, Seungyoon Lee, Seongtae Hong, Minhyuk Kim, Chanjun Park, Heuiseok Lim

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jungseob Lee, Seungyoon Lee, Seongtae Hong, Minhyuk Kim, Chanjun Park, Heuiseok Lim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards" का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: "बहुत अधिक सोचने वाला" छात्र

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र (AI मॉडल) है जो गणित की समस्याओं को हल करने में बहुत अच्छा है। हालाँकि, इस छात्र की एक बुरी आदत है: वह बहुत अधिक बोलता है। "2 + 2" जैसी सरल समस्या के लिए भी, वह संख्याओं को जोड़ने के हर संभव तरीके को समझाने के लिए 5,000 शब्दों का निबंध लिख सकता है, इससे पहले कि वह अंत में "4" कहे।

इसे verbosity (वाचालता) कहा जाता है। यह समय और कंप्यूटर की शक्ति को बर्बाद करता है। शोधकर्ता इस छात्र को संक्षिप्त होने के लिए सिखाना चाहते हैं—यानी 5,000 शब्दों के निबंध के बजाय सीधे "4" कहना।

असफल प्रयास: "कठोर शिक्षक"

इसे ठीक करने के लिए, शोधकर्ताओं ने GRPO (Group Relative Policy Optimization) नामक एक विधि का उपयोग किया। उन्होंने एक नियम जोड़ा: "यदि आप बहुत अधिक शब्द लिखते हैं, तो आपको दंड (penalty) दिया जाएगा।"

हालाँकि, उन्होंने इस नियम को लागू करने के तरीके में एक महत्वपूर्ण गलती की। उन्होंने दोनों स्थितियों में दंडित किया: बहुत लंबे सही उत्तरों के लिए और बहुत लंबे गलत उत्तरों के लिए।

उपमा: कल्पना कीजिए कि एक शिक्षक छात्र से कहता है:

"यदि तुम्हारा उत्तर गलत आता है, तो मैं तुम्हारे स्पष्टीकरण की लंबाई के लिए अंक काट लूँगा। यदि तुम्हारा उत्तर सही आता है, तो भी यदि तुमने बहुत अधिक लिखा, तो मैं अंक काट लूँगा।"

क्या हुआ? छात्र घबरा गया। उसे समझ आया कि यदि उसने एक लंबा, जटिल स्पष्टीकरण लिखा और गलत हुआ, तो उसे दो बार दंड मिलेगा। इसलिए, उसने कुछ भी न लिखना शुरू कर दिया। उसने सोचना ही छोड़ दिया। वह बस तुरंत "4" कह देता, भले ही उत्तर "5" हो।

इसे Reward Collapse (पुरस्कार पतन) कहा जाता है। मॉडल "लंबे और गलत" होने के दंड से इतना डर गया कि उसने तर्क करना ही बंद कर दिया, जिससे वह छोटा लेकिन बेकार बन गया।

खोज: "कठोर शिक्षक" क्यों विफल रहा

लेखकों ने जांच की कि ऐसा क्यों हुआ। उन्होंने इसके दो कारण पाए:

  1. "गलत उत्तर" का जाल: जब आप लंबे गलत उत्तरों को दंडित करते हैं, तो AI के मस्तिष्क के अंदर की गणित बिगड़ जाती है। यह एक फीडबैक लूप बनाता है जहाँ AI सोचता है, "सबसे सुरक्षित दांव यह है कि कुछ भी न बोला जाए।" गलत उत्तरों के लिए लंबा होने पर दिया गया एक छोटा सा दंड भी सिस्टम को तोड़ने के लिए काफी था।
  2. "अत्यधिक संपीड़न" (Over-Compression) का जाल: भले ही आप केवल लंबे सही उत्तरों को दंडित करते हैं (एक "Correct-Only" दृष्टिकोण), AI फिर भी ढह सकता है। कभी-कभी, AI को इतना विश्वास हो जाता है कि "छोटा होना अच्छा है" कि वह अपने सोचने की प्रक्रिया को इतना अधिक सिकोड़ देता है कि वह कठिन समस्याओं के लिए समाधान भी खो देता है। यह एक ऐसे छात्र की तरह है जो गणित सीखता नहीं है, बल्कि केवल उत्तर कुंजी (answer key) रट लेता है।

समाधान: ACOER (एक "स्मार्ट कोच")

लेखक एक नई विधि प्रस्तावित करते हैं जिसे ACOER (Adaptive Correct-Only Efficiency Reward) कहा जाता है। ACOER को एक स्मार्ट कोच के रूप में सोचें जो छात्र को बिना तोड़े प्रशिक्षित करने के लिए तीन विशिष्ट नियमों का उपयोग करता है:

1. "गलत अनुमान के लिए कोई दंड नहीं" का नियम

  • यह कैसे काम करता है: कोच कहता है, "यदि तुम्हारा उत्तर गलत आता है, तो मुझे इस बात से फर्क नहीं पड़ता कि तुम्हारा स्पष्टीकरण कितना लंबा था। तुम्हें शून्य अंक मिलेंगे, लेकिन लंबा होने के लिए कोई अतिरिक्त दंड नहीं मिलेगा।"
  • यह कैसे मदद करता है: यह घबराहट को रोकता है। छात्र जानता है कि वह गहराई से सोच सकता है और गलतियाँ कर सकता है, बिना अपनी विचार प्रक्रिया की लंबाई के लिए दंडित हुए। उसे संक्षिप्त होने के लिए पुरस्कार केवल तभी मिलता है जब वह सही होता है।

2. "बदलते लक्ष्य" का नियम (Adaptive Budget)

  • यह कैसे काम करता है: कोच यह नहीं कहता कि "आपको 500 शब्दों से कम लिखना चाहिए," बल्कि कोच छात्र पर नज़र रखता है। यदि छात्र 200 शब्द लिखने लगता है, तो कोच लक्ष्य को घटाकर 150 कर देता है। यदि वे 100 पर गिरते हैं, तो लक्ष्य 80 हो जाता है।
  • यह कैसे मदद करता है: यह छात्र को उस लूप में फंसने से रोकता है जहाँ वह सोचता है कि "छोटा होना हमेशा बेहतर है।" यह लक्ष्य को गतिशील रखता है ताकि छात्र अचानक हार मानने के बजाय धीरे-धीरे सुधार करता रहे।

3. "सेफ्टी ब्रेक" का नियम (Control-Loop)

  • यह कैसे काम करता है: कोच लगातार टेस्ट स्कोर की जाँच करता है। यदि छात्र बहुत कम लिखने के कारण गलत उत्तर देने लगता है, तो कोच तुरंत कहता है, "रुको! धीमे हो जाओ। अब तुम फिर से अधिक शब्द लिख सकते हो।"
  • यह कैसे मदद करता है: यह "Over-Compression" के जाल को रोकता है। यह सुनिश्चित करता है कि AI गति के चक्कर में सटीकता (accuracy) से समझौता न करे। यदि सटीकता गिरती है, तो छोटा होने का दबाव कम कर दिया जाता है।

परिणाम: तेज़ और सटीक

जब उन्होंने कठिन गणितीय समस्याओं पर इस नए "स्मार्ट कोच" (ACOER) का परीक्षण किया:

  • गति: AI ने लिखे गए शब्दों की संख्या में 62% की कमी की (हजारों शब्दों से घटकर एक प्रबंधनीय मात्रा तक)।
  • सटीकता: AI ने अपने गणित कौशल को पहले जैसा ही बनाए रखा। वह बेतरतीब ढंग से अनुमान लगाने नहीं लगा।
  • अनुकूलन क्षमता: AI ने आसान समस्याओं (जैसे "2+2") पर छोटा होना सीखा, लेकिन यदि ज़रूरत पड़ी, तो वह बहुत कठिन समस्याओं के लिए अभी भी विस्तृत स्पष्टीकरण लिख सकता था।

सारांश

यह शोध पत्र हमें सिखाता है कि AI को कुशल बनाने के लिए, आप इसे केवल लंबे होने के लिए दंडित नहीं कर सकते, विशेष रूप से तब जब वह गलत हो। ऐसा करने से वह सोचना बंद कर देता है। इसके बजाय, आपको उसे संक्षिप्त होने के लिए पुरस्कृत करना चाहिए केवल तभी जब वह सही हो, और एक सुरक्षा प्रणाली होनी चाहिए जो उसे बहुत छोटा होने से रोके यदि वह गलतियाँ करने लगे। यह एक स्थिर, कुशल और स्मार्ट AI बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →