Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective
यह शोध पत्र STEER को प्रस्तुत करता है, जो सत्यापन योग्य पुरस्कारों (RLVR) के साथ सुदृढीकरण शिक्षण (Reinforcement Learning) के लिए एक सिद्धांतगत एंट्रॉपी-मॉड्यूलेशन विधि है, जो टोकन-स्तरीय एंट्रॉपी परिवर्तनों के लिए एक सैद्धांतिक ढांचा व्युत्पन्न करके और गणितीय एवं कोडिंग बेंचमार्क में मौजूदा ह्यूरिस्टिक हस्तक्षेपों से बेहतर प्रदर्शन करने के लिए टोकन को अनुकूल रूप से पुन: भारित (reweighting) करके एंट्रॉपी पतन (entropy collapse) को संबोधित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को जटिल गणित की समस्याओं को हल करने या कोड लिखने के लिए प्रशिक्षित कर रहे हैं। आप एक तकनीक का उपयोग करते हैं जिसे Reinforcement Learning with Verifiable Rewards (RLVR) कहा जाता है। इसे एक खेल की तरह समझें जहाँ रोबोट अलग-अलग समाधान आज़माता है, और यदि उसे सही उत्तर मिलता है, तो उसे एक "गोल्ड स्टार" (इनाम) मिलता है। यदि वह गलत होता है, तो उसे कुछ नहीं मिलता। समय के साथ, रोबोट अधिक गोल्ड स्टार पाने के लिए सीखता है।
समस्या: रोबोट बहुत अधिक आत्मविश्वासी (और अटक) जाता है
"एन्ट्रॉपी" (Entropy) को समझने के लिए, कल्पना करें कि रोबोट का मस्तिष्क संभावित उत्तरों का एक विशाल पुस्तकालय है।
- उच्च एन्ट्रॉपी (High Entropy): पुस्तकालय विविध, अलग-अलग विचारों से भरा है। रोबोट खोज कर रहा है, कई अलग-अलग रास्तों को आज़मा रहा है, और नई संभावनाओं के लिए खुला है।
- निम्न एन्ट्रॉपी (Low Entropy/Collapse): पुस्तकालय अचानक छोटा हो जाता है। रोबोट नए प्रयोग करना बंद कर देता है और केवल उस एक रास्ते को चुनता है जिसे वह सबसे अच्छा मानता है। वह कठोर और दोहराव वाला बन जाता है।
RLVR में, रोबोट अक्सर बहुत जल्दी इस "लो-एन्ट्रॉपी" अवस्था में फंस जाता है। वह नई चीजें आज़माना बंद कर देता है क्योंकि उसे गलतियाँ करने से डर लगता है। वह एक ही "तर्क" (reasoning) को बार-बार दोहराने लगता है। यदि वह एक रास्ता गलत है, तो रोबोट विफल हो जाता है, और प्रशिक्षण रुक जाता है क्योंकि वह बेहतर समाधान खोजने में असमर्थ होता है।
पुराने समाधान: अनुमान लगाना और जांचना
इस शोध पत्र से पहले, वैज्ञानिक इसे ठीक करने के लिए "ह्यूरिस्टिक" (heuristic) विधियों का उपयोग करते थे—मूल रूप से वे अनुमान लगा रहे थे कि क्या काम कर सकता है।
- "क्लिप-हाई" (Clip-High) विधि: उन्होंने रोबोट के आत्मविश्वास में बड़े बदलावों को सीमित करने के नियमों को ढीला करने की कोशिश की, इस उम्मीद में कि यह रोबोट को अधिक चीजें आज़माने के लिए मजबूर करेगा।
- "रीवेटिंग" (Reweighting) विधि: उन्होंने दुर्लभ उत्तरों को अतिरिक्त अंक देने या सामान्य उत्तरों से अंक वापस लेने की कोशिश की।
पुराने तरीकों के साथ समस्या यह थी कि वे एक लीक होती नाव को केवल एक छेद बंद करके ठीक करने की कोशिश करने जैसे थे, जबकि अन्य छेदों को अनदेखा किया जा रहा था। वे पूरी तरह से यह नहीं समझ पाए थे कि रोबोट क्यों "कोलैप्स" हो रहा था, इसलिए उनके सुधार केवल तुक्के या अनिश्चित थे।
नया अंतर्दृष्टि: एक गणितीय मानचित्र
इस शोध पत्र के लेखकों ने इसके पीछे के कारणों को गहराई से समझने का निर्णय लिया। उन्होंने एक सटीक गणितीय सूत्र (एक "टाइट एनालिटिकल एप्रोक्सिमेशन") बनाया जो ठीक से ट्रैक करता है कि हर एक चरण के साथ रोबोट की "विविधता" (एन्ट्रॉपी) कैसे बदलती है।
उन्होंने पाया कि विविधता में परिवर्तन चार विशिष्ट कारकों द्वारा नियंत्रित होता है:
- क्लिपिंग नियम (The Clipping Rule): प्रशिक्षण एल्गोरिदम कितना बड़ा बदलाव सीमित करता है।
- एडवांटेज स्कोर (The Advantage Score): एक विशिष्ट उत्तर औसत से कितना बेहतर है।
- संभावना (The Probability): रोबोट के उस उत्तर को चुनने की संभावना कितनी थी।
- वर्तमान एन्ट्रॉपी (The Current Entropy): उस सटीक क्षण में रोबोट का दिमाग कितना विविध था।
उन्होंने इसे एक चार-चतुर्थक मानचित्र (four-quadrant map) के रूप में देखा। इस आधार पर कि कोई उत्तर "सही/गलत" था और "संभावित/असंभावित" था, रोबोट या तो अधिक विविध बनेगा या कम विविध। उन्होंने महसूस किया कि पिछले तरीके केवल इनमें से एक या दो चतुर्थांशों को देख रहे थे, जिससे वे बड़ी तस्वीर को समझने में चूक गए।
समाधान: STEER
इस मानचित्र के आधार पर, उन्होंने STEER (Stabilizing Token-level Entropy-changE via Reweighting) नामक एक नया उपकरण बनाया।
STEER को रोबोट की सीखने की प्रक्रिया के लिए एक स्मार्ट ट्रैफिक कंट्रोलर के रूप में सोचें।
- अनुमान लगाने के बजाय, STEER गणना करता है कि रोबोट द्वारा उत्पन्न होने वाले प्रत्येक शब्द (टोकन) के लिए विविधता कितनी बदल रही है।
- यदि रोबोट एक ऐसा कदम उठाने वाला है जिससे उसकी विविधता बहुत तेज़ी से गिर जाएगी (एन्ट्रॉपी कोलैप्स), तो STEER उस विशिष्ट कदम पर धीरे से ब्रेक लगा देता है।
- यह रोबोट को सीखने से नहीं रोकता है; यह केवल सीखने के उन हिस्सों को धीमा करता है जो बहुत आक्रामक हैं, जिससे रोबोट का दिमाग खुला और विविध बना रहता है।
परिणाम
टीम ने छह अलग-अलग गणितीय बेंचमार्क और तीन कोडिंग चुनौतियों पर STEER का परीक्षण किया।
- परिणाम: STEER ने पूरे प्रशिक्षण के दौरान रोबोट के "मन" को विविध और खोजी बनाए रखा।
- स्कोर: इसने लगातार अन्य सभी शीर्ष विधियों को पछाड़ दिया, अधिक गणितीय समस्याओं को हल किया और बेहतर कोड लिखा।
- बहुमुखी प्रतिभा: यह विभिन्न आकार के रोबोटों (छोटे से लेकर बड़े मॉडल तक) और विभिन्न प्रकार के प्रशिक्षण एल्गोरिदम पर अच्छी तरह से काम करता है।
सारांश में
यह शोध पत्र तर्क देता है कि AI को बेहतर ढंग से सोचने के लिए सिखाने हेतु, हम केवल यह अनुमान नहीं लगा सकते कि उसकी रचनात्मकता को कैसे बनाए रखा जाए। हमें यह समझने की आवश्यकता है कि वह अपनी रचनात्मकता को कैसे खोता है। इन परिवर्तनों का एक सटीक मानचित्र बनाकर, उन्होंने STEER बनाया, जो एक सूक्ष्म-नियंत्रक (fine-tuned regulator) के रूप में कार्य करता है, यह सुनिश्चित करता है कि AI जिज्ञासु और खोजी बना रहे, न कि एक कठोर लूप में फंस जाए। इससे अधिक स्मार्ट और सक्षम AI मॉडल विकसित होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।