← नवीनतम पेपर
🤖 machine learning

On the Nonlinearity of Learning Rate Scaling for LLM Training

यह शोध पत्र LLM प्रशिक्षण में लॉग-लीनियर लर्निंग रेट स्केलिंग की धारणा को चुनौती देता है, यह प्रदर्शित करते हुए कि इष्टतम लर्निंग रेट बड़े पैमानों पर ऊपर की ओर वक्रता (upward curvature) प्रदर्शित करते हैं, एक ऐसी गैर-रैखिकता जिसे प्रभावी लर्निंग रेट और डेटा-आधारित एक्सट्रपलेशन का उपयोग करके हल किया जाता है, जिससे अधिक सटीक और लागत-कुशल ट्रांसफर लर्निंग सक्षम होती है।

मूल लेखक: Zaiwen Yang, Huaqing Zhang, Jing Xu, Jingzhao Zhang

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zaiwen Yang, Huaqing Zhang, Jing Xu, Jingzhao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल रोबोट को कविता लिखना सिखाने की कोशिश कर रहे हैं। ऐसा करने के लिए, आपको एक आदर्श "शिक्षण गति" (जिसे लर्निंग रेट कहा जाता है) ढूंढनी होगी। यदि आप बहुत तेज़ी से सिखाते हैं, तो रोबोट भ्रमित हो जाएगा; यदि बहुत धीरे सिखाते हैं, तो वह कभी सीख नहीं पाएगा।

आमतौर पर, एक विशाल रोबोट के लिए इस सटीक गति को खोजना अविश्वसनीय रूप से महंगा और समय लेने वाला होता है। इसलिए, वैज्ञानिक एक शॉर्टकट अपनाते हैं: वे पहले एक छोटे रोबोट को सिखाते हैं, उसके लिए सबसे अच्छी गति का पता लगाते हैं, और फिर अनुमान लगाते हैं कि विशाल रोबोट के लिए वह गति क्या होनी चाहिए। वे यह मान लेते हैं कि उनके बीच का संबंध सरल और सीधा है, जैसे एक स्केल (रूलर): "यदि रोबोट दोगुना बड़ा है, तो हम गति को इस निश्चित मात्रा से समायोजित करेंगे।"

यह शोध पत्र, जो त्सिंगहुआ विश्वविद्यालय के शोधकर्ताओं द्वारा लिखा गया है, कहता है: "वह स्केल वास्तव में मुड़ा हुआ है।"

यहाँ उनकी खोज का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. मुड़ा हुआ स्केल (समस्या)

शोधकर्ताओं ने विभिन्न आकारों के रोबोटों (AI मॉडल्स) को प्रशिक्षित करके इस "शॉर्टकट" का परीक्षण किया, जो छोटे से लेकर बहुत बड़े तक थे। उन्होंने पाया कि जब आप छोटे मॉडल्स के आधार पर एक विशाल रोबोट के लिए सटीक गति का अनुमान लगाने की कोशिश करते हैं, तो आपका सीधा-लाइन वाला अनुमान विफल हो जाता है।

  • उपमा: कल्पना कीजिए कि आप कार चला रहे हैं। आप जानते हैं कि यदि आप 10 मील चलते हैं, तो आप 1 गैलन ईंधन का उपयोग करते हैं। आप अनुमान लगा सकते हैं कि 100 मील चलने में 10 गैलन ईंधन लगेगा। लेकिन क्या होगा यदि कार बड़ी और भारी होने के साथ, इंजन कम कुशल हो जाता है? आपको वास्तव में 10 गैलन से अधिक ईंधन की आवश्यकता हो सकती है।
  • निष्कर्ष: "लर्निंग रेट" एक सीधी रेखा का पालन नहीं करता है। जैसे-जैसे मॉडल विशाल होता जाता है, इष्टतम गति (optimal speed) ऊपर की ओर मुड़ती जाती है। यदि आप पुराने सीधे-लाइन वाले अनुमान का उपयोग करते हैं, तो आप ऐसी गति चुन लेंगे जो बहुत धीमी होगी, और विशाल रोबोट ठीक से सीख नहीं पाएगा।

2. गुप्त दिशा-सूचक: "प्रभावी लर्निंग रेट" (Effective Learning Rate)

शोधकर्ताओं को एहसास हुआ कि समस्या गति के साथ नहीं थी, बल्कि इस बात से थी कि हम इसे कैसे मापते हैं। उन्होंने एक नई अवधारणा पेश की जिसे "प्रभावी लर्निंग रेट" (Effective Learning Rate) कहा जाता है।

  • उपमा: "लर्निंग रेट" को अपनी कार के डैशबोर्ड पर स्पीडोमीटर की तरह समझें। लेकिन "प्रभावी लर्निंग रेट" वह वास्तविक दूरी है जो आपकी कार आगे बढ़ती है।
    • कभी-कभी, आप एक्सीलेटर दबा सकते हैं (उच्च लर्निंग रेट सेट कर सकते हैं), लेकिन यदि कार भारी है या पहिए फिसल रहे हैं (AI के आंतरिक भार/weights के कारण), तो कार उतनी दूर नहीं जाएगी जितना स्पीडोमीटर बताता है।
    • शोधकर्ताओं ने पाया कि यदि आप केवल स्पीडोमीटर की रीडिंग के बजाय वास्तविक तय की गई दूरी (प्रभावी दर) को मापते हैं, तो संबंध फिर से एक पूर्ण, सीधी रेखा बन जाता है। यह टूटे हुए स्पीडोमीटर के बजाय एक GPS पर स्विच करने जैसा है जो आपको बताता है कि आपने वास्तव में कितनी दूरी तय की है।

3. सबसे अच्छा शॉर्टकट: डेटा देखें, आकार नहीं

पेपर ने भविष्यवाणी करने के दो तरीकों का भी परीक्षण किया:

  1. मॉडल-साइज स्केलिंग (Model-Size Scaling): मॉडल कितना बड़ा है इसके आधार पर गति का अनुमान लगाना।
  2. डेटा-स्केलिंग (Data-Scaling): मॉडल ने कितना "टेक्स्ट" (डेटा) पढ़ा है इसके आधार पर गति का अनुमान लगाना।
  • निष्कर्ष: "डेटा-स्केलिंग" विधि बहुत बेहतर है।
  • उपमा: कल्पना कीजिए कि आप एक छात्र को पढ़ा रहे हैं।
    • विधि A (आकार): आप उनकी लंबाई के आधार पर उन्हें पढ़ाने की गति का अनुमान लगाते हैं। (यह अविश्वसनीय है; एक लंबा छात्र भी एक छोटे छात्र की तरह ही तेज़ सीख सकता है)।
    • विधि B (डेटा): आप उन्हें पढ़ाने की गति का अनुमान इस आधार पर लगाते हैं कि उन्हें पाठ्यपुस्तक के कितने पन्ने पढ़ने हैं। (यह बहुत अधिक सटीक है)।
    • पेपर दिखाता है कि मॉडल के आकार के बजाय डेटा की मात्रा के आधार पर भविष्यवाणी करना कहीं अधिक विश्वसनीय है।

4. वक्र (Curve) क्यों होता है? ("सेटलिंग इन" चरण)

लेखक समझाते हैं कि सीधी रेखा क्यों मुड़ जाती है। उन्होंने पाया कि जब आप बहुत धीमी लर्निंग रेट का उपयोग करते हैं, तो रोबोट की आंतरिक "मांसपेशियां" (वेट नॉर्म्स/weight norms) आराम करने और एक आरामदायक स्थिति में सेटल होने में लंबा समय लेती हैं।

  • उपमा: एक स्प्रिंग वाले भारी दरवाजे की कल्पना करें।
    • यदि आप उसे ज़ोर से धक्का देते हैं (तेज़ लर्निंग रेट), तो वह जल्दी से खुल जाता है और स्थिर हो जाता है।
    • यदि आप बहुत धीरे से धक्का देते हैं (धीमी लर्निंग रेट), तो उसे शुरू होने में ही बहुत समय लगता है। वह एक "ट्रांजिएंट" (अस्थायी) चरण में फंस जाता है जहाँ वह डगमगा रहा होता है लेकिन वास्तव में कहीं जा नहीं रहा होता।
    • जब आप धीरे से धक्का दे रहे हों, तो दरवाजे को प्रभावी ढंग से चलाने के लिए, आपको उस शुरुआती डगमगाहट को दूर करने के लिए सरल गणित की भविष्यवाणी से अधिक ज़ोर से धक्का देने की आवश्यकता होती है। यही "अतिरिक्त धक्का" कारण है कि बड़े मॉडल्स के लिए वक्र ऊपर की ओर मुड़ जाता है।

मुख्य निष्कर्ष (The Bottom Line)

पेपर निष्कर्ष निकालता है कि विशाल AI को प्रशिक्षित करते समय पैसा और समय बचाने के लिए:

  1. लर्निंग रेट के लिए पुराने "सीधी रेखा" वाले गणित पर भरोसा न करें; यह बड़े मॉडल्स के लिए आवश्यक गति को कम आंकता है।
  2. अपना ध्यान प्रभावी लर्निंग रेट (वास्तविक गति, न कि केवल सेटिंग) पर केंद्रित करें।
  3. गति की भविष्यवाणी इस आधार पर करें कि मॉडल कितना डेटा देखता है, न कि केवल इस आधार पर कि मॉडल कितना बड़ा है।

ऐसा करके, आप बहुत अधिक सटीकता के साथ प्रशिक्षण की सटीक गति का अनुमान लगा सकते हैं, जिससे कंप्यूटर की शक्ति (कंप्यूटिंग पावर) की भारी बचत होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →