← नवीनतम पेपर
🤖 machine learning

Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective

यह शोध पत्र STEER को प्रस्तुत करता है, जो सत्यापन योग्य पुरस्कारों (RLVR) के साथ सुदृढीकरण शिक्षण (Reinforcement Learning) के लिए एक सिद्धांतगत एंट्रॉपी-मॉड्यूलेशन विधि है, जो टोकन-स्तरीय एंट्रॉपी परिवर्तनों के लिए एक सैद्धांतिक ढांचा व्युत्पन्न करके और गणितीय एवं कोडिंग बेंचमार्क में मौजूदा ह्यूरिस्टिक हस्तक्षेपों से बेहतर प्रदर्शन करने के लिए टोकन को अनुकूल रूप से पुन: भारित (reweighting) करके एंट्रॉपी पतन (entropy collapse) को संबोधित करता है।

मूल लेखक: Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को जटिल गणित की समस्याओं को हल करने या कोड लिखने के लिए प्रशिक्षित कर रहे हैं। आप एक तकनीक का उपयोग करते हैं जिसे Reinforcement Learning with Verifiable Rewards (RLVR) कहा जाता है। इसे एक खेल की तरह समझें जहाँ रोबोट अलग-अलग समाधान आज़माता है, और यदि उसे सही उत्तर मिलता है, तो उसे एक "गोल्ड स्टार" (इनाम) मिलता है। यदि वह गलत होता है, तो उसे कुछ नहीं मिलता। समय के साथ, रोबोट अधिक गोल्ड स्टार पाने के लिए सीखता है।

समस्या: रोबोट बहुत अधिक आत्मविश्वासी (और अटक) जाता है

"एन्ट्रॉपी" (Entropy) को समझने के लिए, कल्पना करें कि रोबोट का मस्तिष्क संभावित उत्तरों का एक विशाल पुस्तकालय है।

  • उच्च एन्ट्रॉपी (High Entropy): पुस्तकालय विविध, अलग-अलग विचारों से भरा है। रोबोट खोज कर रहा है, कई अलग-अलग रास्तों को आज़मा रहा है, और नई संभावनाओं के लिए खुला है।
  • निम्न एन्ट्रॉपी (Low Entropy/Collapse): पुस्तकालय अचानक छोटा हो जाता है। रोबोट नए प्रयोग करना बंद कर देता है और केवल उस एक रास्ते को चुनता है जिसे वह सबसे अच्छा मानता है। वह कठोर और दोहराव वाला बन जाता है।

RLVR में, रोबोट अक्सर बहुत जल्दी इस "लो-एन्ट्रॉपी" अवस्था में फंस जाता है। वह नई चीजें आज़माना बंद कर देता है क्योंकि उसे गलतियाँ करने से डर लगता है। वह एक ही "तर्क" (reasoning) को बार-बार दोहराने लगता है। यदि वह एक रास्ता गलत है, तो रोबोट विफल हो जाता है, और प्रशिक्षण रुक जाता है क्योंकि वह बेहतर समाधान खोजने में असमर्थ होता है।

पुराने समाधान: अनुमान लगाना और जांचना

इस शोध पत्र से पहले, वैज्ञानिक इसे ठीक करने के लिए "ह्यूरिस्टिक" (heuristic) विधियों का उपयोग करते थे—मूल रूप से वे अनुमान लगा रहे थे कि क्या काम कर सकता है।

  • "क्लिप-हाई" (Clip-High) विधि: उन्होंने रोबोट के आत्मविश्वास में बड़े बदलावों को सीमित करने के नियमों को ढीला करने की कोशिश की, इस उम्मीद में कि यह रोबोट को अधिक चीजें आज़माने के लिए मजबूर करेगा।
  • "रीवेटिंग" (Reweighting) विधि: उन्होंने दुर्लभ उत्तरों को अतिरिक्त अंक देने या सामान्य उत्तरों से अंक वापस लेने की कोशिश की।

पुराने तरीकों के साथ समस्या यह थी कि वे एक लीक होती नाव को केवल एक छेद बंद करके ठीक करने की कोशिश करने जैसे थे, जबकि अन्य छेदों को अनदेखा किया जा रहा था। वे पूरी तरह से यह नहीं समझ पाए थे कि रोबोट क्यों "कोलैप्स" हो रहा था, इसलिए उनके सुधार केवल तुक्के या अनिश्चित थे।

नया अंतर्दृष्टि: एक गणितीय मानचित्र

इस शोध पत्र के लेखकों ने इसके पीछे के कारणों को गहराई से समझने का निर्णय लिया। उन्होंने एक सटीक गणितीय सूत्र (एक "टाइट एनालिटिकल एप्रोक्सिमेशन") बनाया जो ठीक से ट्रैक करता है कि हर एक चरण के साथ रोबोट की "विविधता" (एन्ट्रॉपी) कैसे बदलती है।

उन्होंने पाया कि विविधता में परिवर्तन चार विशिष्ट कारकों द्वारा नियंत्रित होता है:

  1. क्लिपिंग नियम (The Clipping Rule): प्रशिक्षण एल्गोरिदम कितना बड़ा बदलाव सीमित करता है।
  2. एडवांटेज स्कोर (The Advantage Score): एक विशिष्ट उत्तर औसत से कितना बेहतर है।
  3. संभावना (The Probability): रोबोट के उस उत्तर को चुनने की संभावना कितनी थी।
  4. वर्तमान एन्ट्रॉपी (The Current Entropy): उस सटीक क्षण में रोबोट का दिमाग कितना विविध था।

उन्होंने इसे एक चार-चतुर्थक मानचित्र (four-quadrant map) के रूप में देखा। इस आधार पर कि कोई उत्तर "सही/गलत" था और "संभावित/असंभावित" था, रोबोट या तो अधिक विविध बनेगा या कम विविध। उन्होंने महसूस किया कि पिछले तरीके केवल इनमें से एक या दो चतुर्थांशों को देख रहे थे, जिससे वे बड़ी तस्वीर को समझने में चूक गए।

समाधान: STEER

इस मानचित्र के आधार पर, उन्होंने STEER (Stabilizing Token-level Entropy-changE via Reweighting) नामक एक नया उपकरण बनाया।

STEER को रोबोट की सीखने की प्रक्रिया के लिए एक स्मार्ट ट्रैफिक कंट्रोलर के रूप में सोचें।

  • अनुमान लगाने के बजाय, STEER गणना करता है कि रोबोट द्वारा उत्पन्न होने वाले प्रत्येक शब्द (टोकन) के लिए विविधता कितनी बदल रही है।
  • यदि रोबोट एक ऐसा कदम उठाने वाला है जिससे उसकी विविधता बहुत तेज़ी से गिर जाएगी (एन्ट्रॉपी कोलैप्स), तो STEER उस विशिष्ट कदम पर धीरे से ब्रेक लगा देता है।
  • यह रोबोट को सीखने से नहीं रोकता है; यह केवल सीखने के उन हिस्सों को धीमा करता है जो बहुत आक्रामक हैं, जिससे रोबोट का दिमाग खुला और विविध बना रहता है।

परिणाम

टीम ने छह अलग-अलग गणितीय बेंचमार्क और तीन कोडिंग चुनौतियों पर STEER का परीक्षण किया।

  • परिणाम: STEER ने पूरे प्रशिक्षण के दौरान रोबोट के "मन" को विविध और खोजी बनाए रखा।
  • स्कोर: इसने लगातार अन्य सभी शीर्ष विधियों को पछाड़ दिया, अधिक गणितीय समस्याओं को हल किया और बेहतर कोड लिखा।
  • बहुमुखी प्रतिभा: यह विभिन्न आकार के रोबोटों (छोटे से लेकर बड़े मॉडल तक) और विभिन्न प्रकार के प्रशिक्षण एल्गोरिदम पर अच्छी तरह से काम करता है।

सारांश में

यह शोध पत्र तर्क देता है कि AI को बेहतर ढंग से सोचने के लिए सिखाने हेतु, हम केवल यह अनुमान नहीं लगा सकते कि उसकी रचनात्मकता को कैसे बनाए रखा जाए। हमें यह समझने की आवश्यकता है कि वह अपनी रचनात्मकता को कैसे खोता है। इन परिवर्तनों का एक सटीक मानचित्र बनाकर, उन्होंने STEER बनाया, जो एक सूक्ष्म-नियंत्रक (fine-tuned regulator) के रूप में कार्य करता है, यह सुनिश्चित करता है कि AI जिज्ञासु और खोजी बना रहे, न कि एक कठोर लूप में फंस जाए। इससे अधिक स्मार्ट और सक्षम AI मॉडल विकसित होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →