← नवीनतम पेपर
💻 computer science

Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals

यह शोध पत्र रिइन्फोर्समेंट लर्निंग विद वेरिफिएबल रिवार्ड्स (RLVR) में रिजिड हार्ड क्लिपिंग को एक प्रमुख बाधा के रूप में पहचानता है जो सूचनात्मक सीमा-निकट संकेतों (near-boundary signals) को त्याग देता है, और नियर-बाउंड्री स्टोकेस्टिक रेस्क्यू (NSR) का प्रस्ताव करता है, जो इन संकेतों को पुनः प्राप्त करने के लिए एक सरल स्टोकेस्टिक तंत्र है जो विभिन्न मॉडल आर्किटेक्चर में प्रशिक्षण स्थिरता और प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Shuo Yang, Jinda Lu, Chiyu Ma, Kexin Huang, Haoming Meng, Qihui Zhang, Yuyang Liu, Bolin Ding, Guoyin Wang, Li Yuan, Jingren Zhou

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuo Yang, Jinda Lu, Chiyu Ma, Kexin Huang, Haoming Meng, Qihui Zhang, Yuyang Liu, Bolin Ding, Guoyin Wang, Li Yuan, Jingren Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल) को जटिल गणितीय समस्याओं को हल करना सिखा रहे हैं। इसे करने के लिए, आप रिनफोर्समेंट लर्निंग विद वेरिफिएबल रिवार्ड्स (RLVR) नामक एक विधि का उपयोग करते हैं। इसे एक खेल की तरह समझें जहाँ रोबोट विभिन्न समाधानों को आज़माता है और एक सख्त रेफरी (एक वेरिफायर) तुरंत उसे बताता है कि उत्तर सही है या गलत।

यह शोध पत्र पहचानता है कि वर्तमान में यह खेल कैसे खेला जा रहा है जिसमें एक विशिष्ट समस्या है और यह एक चतुर, सरल समाधान पेश करता है।

समस्या: "हार्ड स्टॉप" साइन

वर्तमान में, प्रशिक्षण एल्गोरिदम एक सुरक्षा नियम का उपयोग करता है जिसे हार्ड क्लिपिंग (Hard Clipping) कहा जाता है। कल्पना कीजिए कि रोबक एक ट्रैक पर दौड़ रहा है, और वहाँ एक "ट्रस्ट ज़ोन" (एक सुरक्षित क्षेत्र जहाँ रोबोट को बड़े बदलाव करने की अनुमति है) है।

  • नियम: यदि रोबोट ज़ोन के अंदर रहता है, तो उसे सीखते रहने दिया जाता है। यदि वह रेखा से एक छोटा सा कदम भी बाहर निकलता है, तो रेफरी तुरंत ब्रेक लगा देता है। रोबोट के प्रयास को खारिज कर दिया जाता है, और उसे उस कदम के लिए शून्य क्रेडिट मिलता है, भले ही वह रेखा से केवल एक मिलीमीटर ही क्यों न बाहर निकला हो।
  • समस्या: शोधकर्ताओं ने पाया कि यह "सब कुछ या कुछ नहीं" वाला नियम बहुत कठोर है। कभी-कभी, रोबोट रेखा से थोड़ा सा बाहर कदम लेता है जिसमें वास्तव में एक बहुत मूल्यवान सबक होता है। लेकिन, इस कठोर नियम के कारण, उस मूल्यवान सबक को फेंक दिया जाता है। यह एक शिक्षक द्वारा छात्र के निबंध को फेल करने जैसा है क्योंकि उसने एक अतिरिक्त शब्द का उपयोग किया, भले ही निबंध शानदार था।

शोध पत्र इसे "क्लिपिंग बॉटलनैक" (Clipping Bottleneck) कहता है। प्रशिक्षण अस्थिर हो जाता है क्योंकि रोबोट इन छोटे, उपयोगी संकेतों को खोता रहता है, जिससे वह डगमगाने लगता है या प्रभावी ढंग से सीखना बंद कर देता है।

निदान: यह आकार के बारे में नहीं है, यह निर्णय के बारे में है

शोधकर्ताओं ने दो सिद्धांतों का परीक्षण किया ताकि मूल कारण का पता लगाया जा सके:

  1. क्या समस्या यह है कि रोबोट बहुत अधिक बदलाव करने की कोशिश कर रहा है? (ग्रेडिएंट मैग्नीट्यूड)
    • परीक्षण: उन्होंने नंबरों को बड़ा या छोटा करने के लिए उनमें हलचल पैदा की।
    • परिणाम: रोबोट को इससे कोई फर्क नहीं पड़ा। उसने आकार के बदलावों को ठीक से संभाला।
  2. क्या समस्या यह है कि रेफरी इस बात के बारे में बहुत सख्त है कि किसे बोलने दिया जाए? (द बाइनरी डिसीजन)
    • परीक्षण: उन्होंने कदम के आकार को बदले बिना, यह तय करने के "हाँ/नहीं" निर्णय के साथ छेड़छाड़ की कि किसी कदम को स्वीकार किया जाए या नहीं।
    • परिणाम: अराजकता! जब "हाँ/नहीं" का निर्णय शोर भरा या रैंडम हो गया, तो रोबोट पूरी तरह विफल हो गया।

निष्कर्ष: समस्या यह नहीं है कि बदलाव कितना बड़ा है; बल्कि यह कठोर हाँ/नहीं का निर्णय है जो उन कदमों को फेंक देता है जो सुरक्षित ज़ोन के लगभग भीतर थे।

समाधान: "नियर-बाउंड्री स्टोकेस्टिक रेस्क्यू" (NSR)

टीम ने एक नया नियम प्रस्तावित किया जिसे NSR कहा जाता है। हार्ड "स्टॉप" साइन के बजाय, एक क्लब के फ्लेक्सिबल बाउंसर की कल्पना करें।

  • यह कैसे काम करता है: यदि रोबोट रेखा से थोड़ा सा बाहर कदम रखता है, तो बाउंसर उसे तुरंत बाहर नहीं निकालता। इसके बजाय, बाउंसर एक सिक्का उछालता है (स्टोकेस्टिक सैंपलिंग)।
    • हेड्स: "ठीक है, तुम काफी करीब हो। वापस अंदर आओ और इससे सीखो।"
    • टेल्स: "क्षमा करें, तुम बहुत दूर निकल गए। फिर से प्रयास करो।"
  • जादू: यह सिक्का उछालना केवल उन कदमों के लिए होता है जो किनारे के पास होते हैं। यदि रोबलेट सीमा से बहुत दूर है, तो उसे फिर भी बाहर निकाल दिया जाएगा। लेकिन उन "नियर-मिस" (लगभग छूटे हुए) कदमों के लिए, उनके बचने की एक संभावना होती है।

यह कठोर "हार्ड स्टॉप" को एक "सॉफ्ट मे बी" (Soft Maybe) में बदल देता है। यह उन मूल्यवान पाठों को वापस लाता है जिन्हें पहले फेंक दिया जाता था।

यह केवल नियम को "सॉफ्ट" बनाने से बेहतर क्यों है?

शोधकर्ताओं ने सोचा: "हम नियम को सभी के लिए नरम क्यों नहीं बना देते?" (जैसे एक ढलान के बजाय एक हल्की ढलान)।

उन्होंने इसका परीक्षण किया और पाया कि एक रैंडम कॉइन फ्लिप (स्टोकेस्टिक) एक फिक्स्ड, जेंटल स्लोप (डिटरमिनिस्टिक) की तुलना में बेहतर काम करता है।

  • उपमा: कल्पना कीजिए कि एक शोर वाला कमरा है।
    • डिटरमिनिस्टिक सॉफ्टनिंग: आप हर आवाज़ को थोड़ा कम कर देते हैं। आप अभी भी खराब आवाज़ें सुनते हैं, बस वे धीमी होती हैं।
    • स्टोकेस्टिक रेस्क्यू (NSR): आप रैंडम तरीके से खराब आवाजों को पूरी तरह से म्यूट कर देते हैं, लेकिन पास की अच्छी आवाजों को आने देते हैं। यह रैंडमनेस रोबोट को गलत दिशाओं के "शोर" को अनदेखा करने में मदद करती है जबकि उपयोगी संकेतों को बनाए रखती है।

परिणाम

शोधकर्ताओं ने विभिन्न आकार के रोबोटों (7-बिलियन पैरामीटर वाले छोटे मॉडल से लेकर 30-बिलियन पैरामीटर वाले विशाल मॉडल तक) और विभिन्न आर्किटेक्चर पर इस "NSR" फिक्स का परीक्षण किया।

  • स्थिरता: रोबोट बिना क्रैश हुए या भ्रमित हुए बहुत सुचारू रूप से प्रशिक्षित हुए।
  • प्रदर्शन: मानक तरीकों की तुलना में रोबोट गणित की समस्याओं (जैसे AIME प्रतियोगिता) को हल करने में काफी बेहतर हो गए।
  • सरलता: यह एक "प्लग-एंड-प्ले" फिक्स है। आपको पूरा रोबोट फिर से बनाने की आवश्यकता नहीं है; आपको बस इस एक विशिष्ट नियम को बदलना है।

सारांश

शोध पत्र का तर्क है कि वर्तमान AI प्रशिक्षण बहुत सख्त है, जो केवल इसलिए सीखने के अवसरों को फेंक देता है क्योंकि वे थोड़े से "सीमा से बाहर" हैं। नियमों के किनारे पर थोड़ी सी नियंत्रित रैंडमनेस (अनिश्चितता) पेश करके, AI उन खोए हुए संकेतों को वापस पा सकता है, जिससे अधिक स्मार्ट, स्थिर और बेहतर प्रदर्शन करने वाले मॉडल बनते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →