← नवीनतम पेपर
🤖 machine learning

Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

यह शोध पत्र एंट्रोक्राफ्ट (Entrocraft) को प्रस्तुत करता है, जो एक सरल, रेगुलाइजेशन-मुक्त रिजेक्शन-सैंपलिंग विधि है जो एलएलएम (LLM) सुदृढीकरण शिक्षण में प्रदर्शन संतृप्ति को रोकने के लिए एंट्रोपी शेड्यूल्स को सटीक रूप से नियंत्रित करती है, जिससे प्रशिक्षण की दीर्घायु काफी बढ़ जाती है और सामान्यीकरण एवं आउटपुट विविधता में सुधार होता है।

मूल लेखक: Bolian Li, Yifan Wang, Yi Ding, Anamika Lochab, Ananth Grama, Ruqi Zhang

प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bolian Li, Yifan Wang, Yi Ding, Anamika Lochab, Ananth Grama, Ruqi Zhang

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ पेपर "Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control" (Entrocraft) का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ स्पष्टीकरण दिया गया है।

बड़ी समस्या: "एक ही धुन का" जीनियस

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान छात्र (एक Large Language Model) को इनाम और दंड की प्रणाली (Reinforcement Learning) का उपयोग करके गणित के सवाल हल करने के लिए प्रशिक्षित कर रहे हैं।

शुरुआत में, छात्र किसी समस्या को हल करने के कई अलग-अलग तरीके आज़माता है। वे एक लंबा, घुमावदार रास्ता, एक शॉर्टकट, या एक रचनात्मक अनुमान लगा सकते हैं। इसे एक्सप्लोरेशन (Exploration) कहा जाता है।

हालाँकि, जैसे-जैसे प्रशिक्षण जारी रहता है, छात्र "फँस" जाता है। उन्हें एक उच्च स्कोर प्राप्त करने का एक विशिष्ट तरीका मिल जाता है, और वे केवल वही करने लगते हैं। वे नई चीज़ें आज़माना बंद कर देते हैं। वे एक "एक ही धुन के" जीनियस बन जाते हैं जो ठीक उसी सवाल को पूरी तरह से हल कर सकते हैं, लेकिन यदि आप सवाल को थोड़ा सा भी बदल दें, तो वे विफल हो जाते हैं।

तकनीकी शब्दों में, इसे परफॉरमेंस सैचुरेशन (Performance Saturation) कहा जाता है। छात्र स्मार्ट होना बंद कर देता है क्योंकि उसने एक्सप्लोर करना बंद कर दिया है। पेपर इसके मूल कारण को एंट्रॉपी कोलैप्स (Entropy Collapse) के रूप में पहचानता है। "एंट्रॉपी" को छात्र की "जिज्ञासा" या "नई चीज़ें आज़माने की इच्छा" के माप के रूप में समझें। जब एंट्रॉपी कोलैप्स होती है, तो जिज्ञासा मर जाती है, और छात्र बार-बार एक ही सुरक्षित उत्तर दोहराता रहता है।

विफल समाधान: जिज्ञासा को जबरदस्ती थोपना

पिछले तरीकों ने छात्र को जिज्ञासु रहने के लिए मजबूर करने के लिए "रेगुलराइजेशन" (जैसे एक हल्का धक्का) या "क्लिपिंग" (जैसे एक गति सीमा) जोड़ने की कोशिश की।

लेखक इसकी तुलना एक कार की गति को स्थिर रखने के लिए बार-बार एक्सीलरेटर और ब्रेक दबाने से करते हैं। यह कुछ समय के लिए काम करता है, लेकिन अंततः कार हिलने लगती है, बहुत तेज़ हो जाती है, या बहुत धीमी हो जाती है। "जिज्ञासा" का वक्र अस्थिर हो जाता है, और छात्र का प्रदर्शन सुधरना बंद हो जाता है।

समाधान: एंट्रोक्राफ्ट (The "Smart Filter")

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे Entrocraft कहा जाता है। छात्र को धकेलने के बजाय, वे एक फ़िल्टर (Rejection Sampling) का उपयोग करते हैं ताकि यह तय किया जा सके कि छात्र किन उत्तरों से सीख सकता है।

उपमा: सख्त संपादक (The Strict Editor)
कल्पना कीजिए कि छात्र गणित के एक सवाल के 10 अलग-अलग उत्तर लिखता है।

  • मानक प्रशिक्षण (Standard Training): शिक्षक उन सभी 10 को देखता है और कहता है, "उन पर बहुत अच्छा काम किया जिन्होंने सही उत्तर दिया! अब, आइए सुनिश्चित करें कि अगली बार आप केवल वही एक करें।" यह रचनात्मकता को खत्म कर देता है।
  • Entrocraft: शिक्षक एक विशिष्ट लक्ष्य के साथ एक सख्त संपादक की तरह कार्य करता है।
    • यदि छात्र बहुत अधिक आत्मविश्वासी है (कम एंट्रॉपी, एक ही चीज़ कर रहा है), तो संपादक "परफेक्ट" उत्तरों को फेंक देता है और कहता है, "नहीं, अपनी गलतियों या अपने अजीब अनुमानों से सीखो।" यह छात्र को एक्सप्लोर करने के लिए मजबूर करता है।
    • यदि छात्र बहुत अधिक अराजक है (उच्च एंट्रॉपी, बेतरतीब ढंग से अनुमान लगाना), तो संपादक "अजीब" अनुमानों को फेंक देता है और कहता है, "नहीं, अपने सर्वश्रेष्ठ प्रयासों से सीखो।" यह छात्र को ध्यान केंद्रित करने के लिए मजबूर करता है।

उत्तरों को चुनिंदा रूप से चुनकर, Entrocraft सटीक रूप से नियंत्रित कर सकता है कि छात्र चरण-दर-चरण कितना जिज्ञासु बना रहता है।

गुप्त मंत्र: "एनीलिंग" शेड्यूल (The "Annealing" Schedule)

पेपर ने पाया कि आप छात्र की जिज्ञासा को हमेशा के लिए एक निश्चित स्तर पर नहीं रख सकते। यदि आप उन्हें हमेशा 100% जिज्ञासु रखने की कोशिश करते हैं, तो वे भ्रमित हो जाते हैं। यदि आप उन्हें 0% जिज्ञासु रखते हैं, तो वे फंस जाते हैं।

सबसे अच्छी रणनीति एक लीनियर एनीलिंग शेड्यूल (Linear Annealing Schedule) है (एक योजनाबद्ध, क्रमिक परिवर्तन का एक फैंसी तरीका)।

  • शुरुआत: उच्च जिज्ञासा। छात्र को सब कुछ आज़माने दें।
  • मध्य: जिज्ञासा को धीरे-धीरे कम करें। उन्हें सर्वश्रेष्ठ समाधानों पर ध्यान केंद्रित करने दें।
  • अंत: एक थोड़ा कम, लेकिन स्थिर स्तर की जिज्ञासा।

लेखकों ने पाया कि यह "योजनाबद्ध गिरावट" जिज्ञासा के स्तर को स्थिर रखने की तुलना में बहुत बेहतर काम करती है। यह एक डाइट की तरह है: आप अपने लक्ष्य के करीब पहुँचते समय हर दिन भोजन की समान मात्रा नहीं खाते; आप अपने सेवन को समायोजित करते हैं।

परिणाम: बड़े मॉडलों को हराते छोटे मॉडल

पेपर ने गणितीय तर्क कार्यों पर इसका परीक्षण किया। परिणाम प्रभावशाली थे:

  1. छत को तोड़ना (Breaking the Ceiling): मानक प्रशिक्षण एक निश्चित बिंदु के बाद बेहतर होना बंद हो जाता है (सैचुरेशन)। Entrocraft ने 4 गुना अधिक समय तक सुधार जारी रखा।
  2. आकार मायने नहीं रखता: Entrocraft के साथ प्रशिक्षित एक छोटा मॉडल (4 बिलियन पैरामीटर्स) मानक तरीकों से प्रशिक्षित बहुत बड़े मॉडल (8 बिलियन पैरामीटर्स) से बेहतर प्रदर्शन करता है।
  3. विविध उत्तर: मॉडल ने केवल एक सही उत्तर नहीं ढूँढा; इसने कई अलग-अलग सही उत्तर ढूँढे (जिससे "pass@K" स्कोर में 50% की वृद्धि हुई)। इसका मतलब है कि जब आप कई विकल्प उत्पन्न करने के लिए कहते हैं, तो यह अधिक विश्वसनीय है।

सारांश

Entrocraft एक सरल उपकरण है जो AI के लिए "जिज्ञासा थर्मोस्टेट" के रूप में कार्य करता है। AI को एक ही उत्तर दोहराने के लूप में फंसने देने के बजाय, यह उन उत्तरों को फ़िल्टर करता है जो AI को बहुत आत्मविश्वासी या बहुत अराजक बनाते हैं। प्रशिक्षण के प्रत्येक चरण में AI को कितनी "जिज्ञासा" होनी चाहिए, इसकी सावधानीपूर्वक योजना बनाकर, यह AI को प्रदर्शन की दीवार (performance wall) से टकराने से रोकता है, जिससे छोटे मॉडल भी बड़े मॉडलों से बेहतर प्रदर्शन करने में सक्षम होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →