2. कार्यप्रणाली: CalibAdv
लेखक CalibAdv का प्रस्ताव करते हैं, जो एक तीन-स्तरीय एडवांटेज कैलिब्रेशन फ्रेमवर्क है जिसे गलत दंड (mis-penalization) को कम करने और प्रशिक्षण संकेतों को संतुलित करने के लिए डिज़ाइन किया गया है।
A. मध्यवर्ती चरणों के लिए सॉफ्ट एडवांटेज पेनलाइजेशन (Soft Advantage Penalization for Intermediate Steps)
दंडों के गलत आरोपण (misattribution) को संबोधित करने के लिए, CalibAdv सही मध्यवर्ती रिट्रीवल चरणों की शुद्धता के आधार पर नकारात्मक एडवांटेज को समायोजित करने के लिए एक सूक्ष्म तंत्र पेश करता है।
- सिल्वर डॉक्यूमेंट्स (Silver Documents): किसी दिए गए प्रश्न के लिए, सही रोलआउट्स द्वारा रिट्रीव किए गए दस्तावेज़ों को "सिल्वर डॉक्यूमेंट्स" (ग्राउंड ट्रुथ प्रॉक्सी) माना जाता है।
- शुद्धता स्कोर (cs): एक गलत रोलआउट में एक मध्यवर्ती चरण के लिए, शुद्धता स्कोर उन सिल्वर डॉक्यूमेंट्स के अनुपात के रूप में गणना किया जाता है जो रिट्रीव किए गए दस्तावेज़ों के साथ ओवरलैप करते हैं।
- क्षीणन (Attenuation): यदि किसी मध्यवर्ती चरण का एडवांटेज नकारात्मक (A<0) है लेकिन शुद्धता स्कोर उच्च है, तो दंड के परिमाण को कम कर दिया जाता है:
A~s=As⋅(1−cs)
यह सुनिश्चित करता है कि उपयोगी खोज कार्यों को केवल इसलिए भारी दंड न दिया जाए क्योंकि अंतिम उत्तर गलत था।
B. अंतिम उत्तर चरण के लिए एडवांटेज रीबैलेंसिंग (Advantage Rebalancing for Final Answer Step)
नेगेटिव सिग्नल के प्रभुत्व के कारण होने वाले ट्रेनिंग कोलैप्स (training collapse) से निपटने के लिए, यह विधि विशेष रूप से अंतिम उत्तर चरण पर सकारात्मक और नकारात्मक एडवांटेज के अनुपात को पुनर्संतुलित करती है।
- अनुपात की गणना: प्रत्येक रोलआउट समूह के लिए, नकारात्मक एडवांटेज के निरपेक्ष मान (absolute value) और सकारात्मक एडवांटेज के अनुपात (rg) की गणना की जाती है।
- स्केलिंग: संतुलन बहाल करने के लिए सकारात्मक एडवांटेज को इस अनुपात (एक हाइपरपैरामीटर λ द्वारा नियंत्रित) से बढ़ाया जाता है:
A~g+=λ⋅rg⋅Ag+
यह मॉडल को नकारात्मक संकेतों से अभिभूत होने से रोकता है, जो एंट्रॉपी कोलैप्स (entropy collapse) का कारण बनता है।
C. स्पेशल टोकन्स का डिकपलिंग (Decoupling Special Tokens)
लेखक देखते हैं कि <think> टोकन (जो रीजनिंग को सीमित करने के लिए उपयोग किया जाता है) अक्सर एडवांटेज असंतुलन का शिकार होता है, जिससे फॉर्मेट कोलैप्स होता है।
- रणनीति: मॉडल को
<think> जेनरेट करने के लिए कहने के बजाय, इसे एक फिक्स्ड प्रीफिक्स के रूप में प्रॉम्प्ट में पूर्व-संलग्न (prepend) किया जाता है।
- प्रभाव: चूंकि मॉडल इस टोकन को जेनरेट नहीं करता है, इसलिए इसे कोई एडवांटेज सिग्नल असाइन नहीं किया जाता है, जिससे फॉर्मेट डिग्रेडेशन को ट्रिगर करने वाले संभाव्यता उतार-चढ़ाव (probability fluctuations) रुक जाते हैं।
3. मुख्य योगदान
- GRPO विफलताओं का निदान: यह पेपर डीप सर्च में ट्रेनिंग कोलैप्स को नकारात्मक एडवांटेज के प्रभुत्व और सही मध्यवर्ती चरणों के मोटे तौर पर दंडित (coarse-grained penalization) किए जाने से जोड़ने वाले अनुभवजन्य साक्ष्य प्रदान करता है।
- CalibAdv फ्रेमवर्क: एक नवीन, एनोटेशन-मुक्त विधि जो बाहरी LLM लेबलिंग या सब-क्वेश्चन एनोटेशन की आवश्यकता के बिना, आंतरिक संकेतों (सही रोलआउट्स से प्राप्त सिल्वर डॉक्यूमेंट्स) का उपयोग करके एडवांटेज को कैलिब्रेट करती है।
- स्थिरता और प्रदर्शन: यह विधि विविध मॉडल आकारों और आर्किटेक्चरों में प्रश्न-उत्तर प्रदर्शन में उल्लेखनीय सुधार करते हुए सफलतापूर्वक ट्रेनिंग कोलैप्स को रोकती है।
4. प्रयोगात्मक परिणाम
लेखकों ने तीन मॉडल्स (Qwen2.5-3B, Qwen2.5-7B, Llama-3.2-3B) पर सात बेंचमार्क्स (HotpotQA, 2WikiMultiHopQA, Natural Questions, आदि सहित) पर CalibAdv का मूल्यांकन किया।
- प्रदर्शन में सुधार: CalibAdv ने मानक GRPO (Search-R1) की तुलना में F1 स्कोर में औसतन 11.80% सापेक्ष सुधार प्राप्त किया।
- ट्रेनिंग स्थिरता:
- मानक GRPO और बेसलाइन्स (जैसे SimpleTIR, LLD) अक्सर 50-200 स्टेप्स के भीतर ट्रेनिंग कोलैप्स (परफॉरमेंस में भारी गिरावट या उच्च Perplexity द्वारा संकेतित) का शिकार होते हैं।
- CalibAdv सभी मॉडल्स और डेटासेट्स पर सफलतापूर्वक पूर्णता तक प्रशिक्षित हुआ ("No collapse")।
- इसने "High PPL Ratio" (ऐसे आउटपुट जिनकी Perplexity > 50 है, जो निरर्थक सामग्री का संकेत देते हैं) को 0.00% तक कम कर दिया।
- एब्लेशन स्टडीज (Ablation Studies):
- सॉफ्ट पेनलाइजेशन (Soft Penalization) को हटाने से F1 स्कोर में गिरावट आई और गलत दंडित (mis-penalized) चरणों की दर बढ़ गई।
- एडवांटेज रीबैलेंसिंग (Advantage Rebalancing) को हटाने से ट्रेनिंग कोलैप्स और उच्च PPL रेश्यो की वापसी हुई।
- डिकपल्ड टोकन (Decoupled Token) को हटाने से फॉर्मेट अस्थिरता उत्पन्न हुई।
- दक्षता: शुद्धता स्कोरिंग के लिए उपयोग किए गए "सिल्वर डॉक्यूमेंट" प्रॉक्सी को अत्यधिक विश्वसनीय (89% मानव सत्यापन) पाया गया और यह स्टेप इवैल्यूएशन के लिए बाहरी LLM (DeepSeek-V3.2) का उपयोग करने की तुलना में काफी अधिक लागत प्रभावी था, जिससे ~67% वॉल-क्लॉक समय और 200% GPU लागत की बचत हुई।
5. महत्व
यह कार्य इस बात को रेखांकित करता है कि जबकि RLVR के लिए नेगेटिव एडवांटेज महत्वपूर्ण हैं, वे मल्टी-टर्न कार्यों में एक "दोधारी तलवार" के रूप में कार्य करते हैं। यदि सावधानीपूर्वक कैलिब्रेट नहीं किया गया, तो वे मॉडल की प्राकृतिक भाषा क्षमताओं को नष्ट कर सकते हैं।
- व्यावहारिक प्रभाव: CalibAdv महंगी मध्यवर्ती एनोटेशन या जटिल ट्री-स्ट्रक्चर्ड सैंपलिंग की आवश्यकता के बिना रोबस्ट डीप सर्च एजेंटों के प्रशिक्षण को सक्षम बनाता है।
- सामान्यीकरण (Generalizability): यह दृष्टिकोण मॉडल-अज्ञेय (model-agnostic) है और विभिन्न पैरामीटर आकारों में प्रभावी है, जो यह सुझाव देता है कि जटिल, बहु-चरणीय तर्क कार्यों के लिए RL को स्केल करने हेतु एडवांटेज कैलिब्रेशन एक मौलिक आवश्यकता है।
- भविष्य की दिशा: यह प्रतिमान को केवल "गलत उत्तरों को दंडित करने" से बदलकर "लर्निंग सिग्नल को कैलिब्रेट करने" की ओर ले जाता है ताकि यह सुनिश्चित हो सके कि अंतिम त्रुटियों की उपस्थिति में भी सही मध्यवर्ती व्यवहारों को सुदृढ़ किया जाए।