Group Entropy-Controlled Policy Optimization
यह शोध पत्र ग्रुप एंट्रॉपी-कंट्रोल्ड पॉलिसी ऑप्टिमाइज़ेशन (GEPO) प्रस्तुत करता है, जो GRPO का एक हल्का विस्तार है जो समूह-स्तरीय एंट्रॉपी अनुमानों का उपयोग करके एसिमेट्रिक एडवांटेज शेपिंग करने के माध्यम से विषम (heterogeneous) RL कार्यों में वैश्विक एंट्रॉपी विनियमन की सीमाओं को संबोधित करता है, जिससे बेहतर क्रॉस-टास्क प्रदर्शन प्राप्त करने के लिए अन्वेषण (exploration) और दोहन (exploitation) को संतुलित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: ग्रुप एंट्रॉपी-नियंत्रित पॉलिसी ऑप्टिमाइज़ेशन (GEPO)
1. समस्या विवरण
रीइन्फोर्समेंट लर्निंग (RL), पोस्ट-ट्रेनिंग लार्ज लैंग्वेज मॉडल्स (LLMs) को अलाइनमेंट और रीजनिंग को बेहतर बनाने के लिए एक प्रमुख प्रतिमान (paradigm) बन गया है। हालांकि, एक्सप्लोरेशन-एक्सप्लोइटेशन ट्रेड-ऑफ (exploration-exploitation trade-off) को संतुलित करना एक महत्वपूर्ण चुनौती बनी हुई है, विशेष रूप से हेटेरोजेनियस टास्क मिक्सचर (heterogeneous task mixtures) (जैसे कि गणित, कोडिंग, भौतिकी और इंस्ट्रक्शन फॉलोइंग को मिलाना) पर प्रशिक्षण के दौरान।
वर्तमान एंट्रॉपी-नियंत्रित RL विधियाँ मुख्य रूप से दो स्तरों पर कार्य करती हैं:
- पॉलिसी-स्तर (Policy-level): पूरे बैच पर एंट्रॉपी की गणना करना और एक समान रेगुलेशन सिग्नल लागू करना (चित्र 1a)।
- टोकन-स्तर (Token-level): टोकन कोवेरियेंस (covariance) की गणना करना और व्यक्तिगत टोकन को रेगुलेट करना (चित्र 1b)।
यह शोध पत्र GRPO पर लागू होने पर इन दृष्टिकोणों में एक मौलिक दोष की पहचान करता है: एंट्रॉपी हेटेरोजेनिटी (Entropy Heterogeneity)। विभिन्न टास्क डोमेन एक ही पॉलिसी के तहत अलग-अलग एंट्रॉपी रिजीम (entropy regimes) प्रदर्शित करते हैं। उदाहरण के लिए, भौतिकी (physics) के प्रॉम्प्ट स्वाभाविक रूप से लो-एंट्रॉपी के आसपास केंद्रित हो सकते हैं, जबकि इंस्ट्रक्शन-फॉलोइंग प्रॉम्प्ट हाई-एंट्रॉपी प्रदर्शित कर सकते हैं।
यह हेटेरोजेनिटी मानक GRPO में दो विशिष्ट विकृतियों (pathologies) को जन्म देती है:
- एंट्रॉपी-डिपेंडेंट बायस (Entropy-Dependent Bias): समूहों के भीतर एडवांटेज का नॉर्मलाइजेशन उन समूहों के बीच सांख्यिकीय रूप से गैर-तुलनीय सिग्नल बनाता है जिनमें अलग-अलग एंट्रॉपी स्तर होते हैं। लो-एंट्रॉपी वाले समूह (जो अक्सर उच्च-सटीकता वाले कार्य होते हैं) मजबूत, सुसंगत ग्रेडिएंट सिग्नल उत्पन्न करते हैं, जबकि हाई-एंट्रॉपी वाले समूह (जो अक्सर कम-सटीकता वाले कार्य होते हैं) कमजोर, शोर वाले (noisy) सिग्नल उत्पन्न करते हैं।
- ऑप्टिमाइज़ेशन इम्बैलेंस (Optimization Imbalance): बैच-लेवल ऑप्टिमाइज़ेशन लो-एंट्रॉपी वाले कार्यों द्वारा हावी हो जाता है, जिससे हाई-एंट्रॉपी वाले कार्यों को घटते हुए लर्निंग सिग्नल प्राप्त होते हैं। यह एक स्व-सुदृढ़ चक्र (self-reinforcing cycle) की ओर ले जाता है जहाँ लो-एंट्रॉपी कार्य समय से पहले अभिसरण (converge) कर जाते हैं, जबकि हाई-एंट्रॉपी कार्य प्रभावी ढंग से एक्सप्लोर करने में विफल रहते हैं या "रनवे एंट्रॉपी" (runaway entropy) के कारण डिजेनरेट आउटपुट का शिकार हो जाते हैं।
2. कार्यप्रणाली: GEPO
लेखक ग्रुप एंट्रॉपी-नियंत्रित पॉलिसी ऑप्टिमाइज़ेशन (GEPO) का प्रस्ताव करते हैं, जो GRPO का एक हल्का, मॉडल-एग्नोस्टिक विस्तार है जो ग्रुप स्तर पर एंट्रॉपी-कंडीशनड एसिमेट्रिक एडवांटेज शेपिंग (entropy-conditioned asymmetric advantage shaping) करता है।
मुख्य तंत्र
GEPO मौजूदा प्रॉम्प्ट के ग्रुप सैंपल्स से अनुमानित ग्रुप एंट्रॉपी () का उपयोग एक डायग्नोस्टिक सिग्नल के रूप में करता है। एक वैश्विक एंट्रॉपी लक्ष्य लागू करने के बजाय, GEPO प्रत्येक रिस्पॉन्स के लिए ग्रुप की एंट्रॉपी स्थिति के आधार पर एडवांटेज सिग्नल () को आकार देता है:
शेपिंग फंक्शन एसिमेट्रिक स्केलिंग गुणांक () लागू करता है:
- लो-एंट्रॉपी ग्रुप्स (): पॉजिटिव एडवांटेज को द्वारा कम (attenuate) किया जाता है। यह उन कार्यों में ओवर-एक्सप्लोइटेशन और समय से पहले अभिसरण को रोकता है जहाँ मॉडल पहले से ही आत्मविश्वासी है।
- हाई-एंट्रॉपी ग्रुप्स (): नेगेटिव एडवांटेज को द्वारा कम किया जाता है। यह उन कार्यों में एक्सप्लोरेशन के समय से पहले दमन को रोकता है जहाँ मॉडल अनिश्चित है, जिससे पॉलिसी को सही रीजनिंग पाथ खोजने की अनुमति मिलती है।
- अन्यथा: एडवांटेज अपरिवर्तित रहता है।
प्रमुख डिज़ाइन विकल्प
- एसिमेट्रिक शेपिंग (): लेखक अनुभवजन्य रूप से देखते हैं कि लो-एंट्रॉपी वाले समूह अधिक नाजुक होते हैं; इन समूहों में नेगेटिव एडवांटेज का आक्रामक दंड (penalization) "लेंथ कोलैप्स" (जहाँ मॉडल अनिश्चितता को कम करने के लिए रिस्पॉन्स को छोटा कर देता है) को ट्रिगर कर सकता है। इसलिए, GEPO लो-एंट्रॉपी समूहों के लिए एक कोमल धक्का ( अधिक है) देता है, जबकि हाई-एंट्रॉपी समूहों पर लगाए गए मजबूत क्षीणन ( कम है) की तुलना में।
- एडाप्टिव थ्रेशोल्ड्स (Adaptive Thresholds): अलग-अलग बेस मॉडल्स और ट्रेनिंग स्टेज के लिए फिक्स्ड एंट्रॉपी थ्रेशोल्ड नाजुक (brittle) होते हैं। GEPO बैच के एंट्रॉपी वितरण (मीन और स्टैंडर्ड डेविएशन) से थ्रेशोल्ड्स () को गतिशील रूप से प्राप्त करता है और उन्हें एक्सपोनेंशियल मूविंग एवरेज (EMA) का उपयोग करके स्मूथ करता है। यह विधि को बिना टास्क-विशिष्ट ट्यूनिंग के बेस मॉडल के विशिष्ट एंट्रॉपी स्केल के अनुरूप स्वचालित रूप से कैलिब्रेट करने की अनुमति देता है।
3. मुख्य योगदान
- सैद्धांतिक अंतर्दृष्टि: पेपर एक सैद्धांतिक विश्लेषण (प्रपोजिशन 2.1 और 2.2) प्रदान करता है जो दर्शाता है कि GRPO में नॉर्मलाइज्ड एडवांटेज, ग्रुप एंट्रॉपी द्वारा संरचनात्मक रूप से बायस्ड होते हैं। यह सिद्ध करता है कि पॉलिसी-वेटेड और रेफरेंस रिवॉर्ड डिस्ट्रिब्यूशन के बीच का अंतर एंट्रॉपी-डिपेंडेंट है, जिससे हेटेरोजेनियस टास्क के बीच गैर-तुलनीय एडवांटेज सिग्नल मिलते हैं।
- एल्गोरिद्मिक नवाचार: GEPO पहला ग्रुप-लेवल एंट्रॉपी कंट्रोल मैकेनिज्म पेश करता है जो एसिमेट्रिक एडवांटेज शेपिंग करता है। पिछले तरीकों के विपरीत, जो एंट्रॉपी को ग्लोबल या टोकन-लेवल प्रॉपर्टी मानते हैं, GEPO इसे ऑप्टिमाइज़ेशन प्रेशर को रीबैलेंस करने के लिए एक प्रॉम्प्ट-ग्रुप डायग्नोस्टिक के रूप में मानता है।
- जीरो-कॉस्ट इम्प्लीमेंटेशन: इस विधि के लिए किसी अतिरिक्त सैंपलिंग या वैल्यू फंक्शन एस्टीमेशन की आवश्यकता नहीं है। यह GRPO में मौजूद ग्रुप सैंपल्स का लाभ उठाता है, जिससे नगण्य कंप्यूटेशनल ओवरहेड जुड़ता है।
4. प्रयोगात्मक परिणाम
लेखकों ने दो बेस मॉडल्स (Intern-S1-mini और Qwen3.5-9B) पर तेरह बेंचमार्क (गणित, भौतिकी, विज्ञान, कोड जनरेशन और इंस्ट्रक्शन फॉलोइंग को कवर करते हुए) पर GEPO का मूल्यांकन किया।
- प्रदर्शन: GEPO ने लगातार GRPO और हालिया एंट्रॉपी-नियंत्रित बेसलाइन्स (AEPO, Clip-Cov, KL-Cov) को पछाड़ दिया।
- Intern-S1-mini पर, GEPO ने सर्वश्रेष्ठ औसत स्कोर (54.2) प्राप्त किया और AIME25, IMO-Bench, और GPQA सहित 13 में से 7 बेंचमार्क पर जीत हासिल की।
- Qwen3.5-9B पर, GEPO ने उच्चतम औसत स्कोर (71.2) प्राप्त किया, जिसने मजबूत बेसलाइन्स जैसे Clip-Cov (70.9) और KL-Cov (69.9) को भी पीछे छोड़ दिया।
- स्थिरता: GEPO ने बेहतर ट्रेनिंग स्थिरता प्रदर्शित की। जहाँ GR_PO अनबाउंडेड एंट्रॉपी ग्रोथ के कारण विनाशकारी प्रदर्शन गिरावट (जैसे, Qwen3.5-9B पर स्टेप 170 के आसपास) से ग्रस्त था, और AEPO निरंतर ऑसिलेशन प्रदर्शित कर रहा था, वहीं GEPO ने स्मूथ, मोनोटोनिकली सुधरते हुए वैलिडेशन कर्व्स बनाए रखे।
- एंट्रॉपी डायनेमिक्स: ट्रेनिंग डायनेमिक्स के विश्लेषण ने दिखाया कि GEPO कार्यों के बीच विभेदित एक्सप्लोरेशन स्तरों (differentiated exploration levels) को सुरक्षित रखता है। AEPO के विपरीत, जो एक यूनिफॉर्म एंट्रॉपी पैटर्न को मजबूर करता है, GEPO व्यापक एक्सप्लोरेशन की आवश्यकता वाले कार्यों को उच्च एंट्रॉपी बनाए रखने की अनुमति देता है, जबकि डिटर्मिनिस्टिक कार्य लो-एंट्रॉपी पर सेटल हो जाते हैं, जिससे समय से पहले कोलैप्स और रनवे एंट्रॉपी दोनों को रोका जा सके।
5. महत्व और दावे
पेपर का दावा है कि GEPO मल्टी-टास्क RL पोस्ट-ट्रेनिंग में एक महत्वपूर्ण अंतर को संबोधित करता है: विविध कार्यों के बीच एंट्रॉपी हेटेरोजेनिटी द्वारा उत्पन्न स्ट्रक्चरल बायस को संभालने में वर्तमान विधियों की अक्षमता।
लेखक तर्क देते हैं कि:
- टास्क-विशिष्ट रेगुलेशन आवश्यक है: हेटेरोजेनियस कार्यों को एक समान एंट्रॉपी पैटर्न की ओर ले जाना उप-इष्टतम (suboptimal) है। प्रभावी मल्टी-टास्क लर्निंग के लिए टास्क-विशिष्ट एक्सप्लोरेशन रिजीम को बनाए रखना आवश्यक है।
- एसिमेट्री (Asymmetry) महत्वपूर्ण है: लो-एंट्रॉपी समूहों की नाजुकता के लिए लेंथ कोलैप्स से बचने के लिए एडवांटेज शेपिंग के एसिमेट्रिक दृष्टिकोण की आवश्यकता होती है, फिर भी एक्सप्लोरेशन को प्रोत्साहित करती है।
- स्केलेबिलिटी: मौजूदा रोलआउट्स से अनुमानित ग्रुप एंट्रॉपी और एडेप्टिव थ्रेशोल्ड्स पर निर्भर करके, GEPO एक स्केलेबल, मॉडल-एग्नोस्टिक समाधान प्रदान करता है जो बिना किसी स्पष्ट टास्क एनोटेशन या अतिरिक्त सैंपलिंग लागत के औसत प्रदर्शन और इंटर-टास्क बैलेंस दोनों में सुधार करता है।
निष्कर्षतः, यह पेपर GEPO को जटिल, मल्टी-डोमेन LLM पोस्ट-ट्रेनिंग परिदृश्यों में RL ट्रेनिंग को स्थिर करने के लिए एक मजबूत फ्रेमवर्क के रूप में स्थापित करता है, यह सुनिश्चित करता है कि ऑप्टिमाइज़ेशन प्रक्रिया विभिन्न प्रकार के कार्यों की अंतर्निहित अनिश्चितता और विविधता का सम्मान करे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।