← नवीनतम पेपर
🤖 machine learning

How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size

यह शोध पत्र एक "तीन-पद" (three-term) स्केलिंग लॉ का प्रस्ताव करता है जो प्रशिक्षण डेटा को चरणों (steps) और बैच आकार (batch size) में स्पष्ट रूप से विभाजित करता है, जिससे इष्टतम बैच आकार स्केलिंग की सुदृढ़ रिकवरी और काफी कम प्रशिक्षण रन का उपयोग करके उप-इष्टतम सेटिंग्स के लिए नियमों का व्युत्पन्न संभव हो पाता है।

मूल लेखक: Fabian Schaipp

प्रकाशित 2026-07-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fabian Schaipp

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप ब्रेड का एक आदर्श लोफ (loaf) बनाने की कोशिश कर रहे हैं (जो इस शोध पत्र में एक शक्तिशाली AI मॉडल का प्रतिनिधित्व करता है)। बेहतरीन परिणाम प्राप्त करने के लिए, आपको तीन मुख्य सामग्रियों को संतुलित करना होगा:

  1. ओवन का आकार (मॉडल का आकार/Model Size): आपकी मशीन कितनी बड़ी और जटिल है।
  2. आटे की मात्रा (प्रशिक्षण डेटा/Training Data): आप इसमें कितनी जानकारी डालते हैं।
  3. बेकिंग की रणनीति (स्टेप्स बनाम बैच साइज/Baking Strategy): यह थोड़ा पेचीदा हिस्सा है। आप या तो आटे के कई छोटे बैच एक-एक करके बना सकते हैं (कई स्टेप्स, छोटा बैच), या एक साथ कुछ बड़े बैच बना सकते हैं (कम स्टेप्स, बड़ा बैच)।

लंबे समय तक, वैज्ञानिकों के पास ओवन और आटे को संतुलित करने का एक बेहतरीन नुस्खा था। वे जानते थे कि प्रत्येक के लिए कितनी मात्रा का उपयोग करना है। लेकिन वे बेकिंग रणनीति के बारे में अस्पष्ट थे। वे बस इतना कह देते थे, "एक अच्छा बैच साइज इस्तेमाल करें," बिना यह समझाए कि बैच का आकार वास्तव में परिणाम को कैसे बदलता है या हजारों बार ब्रेड बनाकर परीक्षण किए बिना परफेक्ट साइज कैसे खोजा जाए।

यह शोध पत्र एक नया, अधिक विस्तृत नुस्खा प्रस्तावित करता है जिसे "थ्री-टर्म लॉ" (Three-Term Law) कहा जाता है।

नया नुस्खा: स्टेप्स की गिनती करना

लेखकों का सुझाव है कि केवल आटे की कुल मात्रा को देखने के बजाय, हमें यह देखना चाहिए कि उस आटे को स्टेप्स (कितनी बार ओवन में आटा डाला गया) और बैच साइज (एक बार में कितना आटा डाला गया) में कैसे विभाजित किया गया है।

इसे इस तरह समझें:

  • पुराना तरीका: "मेरे पास 100 किलो आटा है। मैं एक बड़ा मॉडल बनाऊंगा।"
  • नया तरीका: "मेरे पास 100 किलो आटा है। मैं 1 किलो के 100 छोटे बैच बना सकता हूँ, या 10 किलो के 10 बड़े बैच बना सकता हूँ। कौन सा मिश्रण मुझे सबसे अच्छी ब्रेड देगा?"

नया फॉर्मूला (थ्री-टर्म लॉ) बैच साइज और स्टेप्स की संख्या को दो अलग-अलग सामग्रियों के रूप में मानता है जो दोनों अंतिम स्वाद (मॉडल के प्रदर्शन) को प्रभावित करते हैं।

यह एक बड़ी बात क्यों है?

1. यह भारी मात्रा में समय बचाता है ("सैंपलिंग" का तरीका)
आमतौर पर, परफेक्ट बैच साइज खोजने के लिए, आपको ब्रेड की एक पूरी रेंज बनानी पड़ती है: एक बहुत छोटे बैच के साथ, एक मध्यम बैच के साथ, एक बहुत बड़े बैच के साथ, और इसी तरह। यह अविश्वसनीय रूप से महंगा और धीमा है (जैसे कि लाखों GPU घंटों की आवश्यकता होना)।

लेखकों ने पाया कि उनका नया फॉर्मूला इतना स्मार्ट है कि वह केवल दो या तीन अलग-अलग बैच साइज को देखकर सटीक रूप से परफेक्ट साइज की भविष्यवाणी कर सकता है।

  • उपमा: कल्पना कीजिए कि आप अपने ओवन के लिए सही तापमान खोजना चाहते हैं। 100 अलग-अलग तापमानों का परीक्षण करने के बजाय, आप केवल तीन का परीक्षण करते हैं। क्योंकि आप गर्मी के भौतिकी (फॉर्मूला) को समझते हैं, इसलिए आप अन्य 97 सेटिंग्स को बदले बिना गणितीय रूप से सटीक तापमान की गणना कर सकते हैं।
  • परिणाम: यह प्रशिक्षण रन (training runs) की संख्या को लगभग 72% कम कर देता है। आप काम के एक अंश के साथ वही उत्तर प्राप्त करते हैं।

2. यह "अपूर्ण" बैचों को संभालता है
वास्तविक दुनिया में, हो सकता है कि आपके पास परफेक्ट बैच साइज का उपयोग करने के लिए आवश्यक हार्डवेयर न हो। शायद आपका ओवन बहुत छोटा है, या आपके पास केवल एक मध्यम बैच के लिए समय है।
पुराने नुस्खे केवल यह बताते थे कि क्या होता है यदि आप परफेक्ट सेटिंग्स का उपयोग करते हैं। यह नया नुस्खा बताता है कि क्या होता है यदि आप एक सब-ऑप्टिमल (अपूर्ण) बैच साइज का उपयोग करते हैं। यह अनुमान लगा सकता है कि यदि आप एक छोटे बैच का उपयोग करने के लिए मजबूर हैं, तो आपकी ब्रेड का स्वाद कितना "खराब" होगा, जिससे आपको अपनी सीमाओं के भीतर सर्वोत्तम निर्णय लेने में मदद मिलती है।

3. यह "क्रिटिकल बैच साइज" के रहस्य को सुलझाता है
वैज्ञानिकों ने "क्रिटिकल बैच साइज" नामक एक घटना देखी है। यह एक स्पीड लिमिट की तरह है। यदि आप अपने बैच बहुत बड़े बनाते हैं, तो आप तेज़ परिणाम प्राप्त करना बंद कर देते हैं; आप बस ऊर्जा बर्बाद करते हैं।

  • पुराने सिद्धांत: कुछ पुराने सिद्धांतों ने सुझाव दिया था कि सबसे अच्छा बैच साइज बहुत छोटा (साइज 1) होना चाहिए, जो वास्तविक जीवन में जो हम देखते हैं उसके विपरीत है।
  • इस पेपर की खोज: नया फॉर्मूला सही ढंग से दिखाता है कि "स्पीड लिमिट" (क्रिटिकल बैच साइज) इस बात पर निर्भर करती है कि आपके पास कितना डेटा है, लेकिन आश्चर्यजनक रूप से, यह इस बात से ज्यादा नहीं बदलता कि आपका मॉडल कितना बड़ा है। यह उन प्रयोगों से मेल खाता है जो हम देखते हैं।

कमी (सीमाएं)

लेखक ईमानदार हैं कि उनका नुस्खा अभी कहाँ पूरी तरह सटीक नहीं है:

  • यह किनारों पर थोड़ा कच्चा है: हालांकि यह बेस्ट बैच साइज की भविष्यवाणी बहुत अच्छी तरह से करता है, लेकिन यह उस सटीक स्वाद की भविष्यवाणी करने में पूरी तरह सटीक नहीं है यदि आप बहुत छोटा या बहुत बड़ा बैच साइज उपयोग करते हैं।
  • इसे थोड़ी मदद की जरूरत है: "अपूर्ण" बैचों के बारे में सबसे सटीक विवरण प्राप्त करने के लिए, उन्हें एक दो-चरणीय प्रक्रिया (एक "टू-स्टेज फिट") का उपयोग करना पड़ा, जो केवल एक समीकरण में नंबर डालने की तुलना में थोड़ा अधिक जटिल है।
  • यह वर्तमान उपकरणों के लिए विशिष्ट है: परिणाम विशेष प्रकार के AI ट्रेनिंग (AdamW नामक ऑप्टिमाइज़र का उपयोग करके) पर आधारित हैं। यदि आप टूल्स (जैसे कि एक अलग ऑप्टिमाइज़र) बदलते हैं, तो इस नुस्खे को बदलाव की आवश्यकता हो सकती है।

सारांश

यह पेपर हमें AI ट्रेनिंग की जटिल दुनिया में नेविगेट करने के लिए एक बेहतर मानचित्र देता है। यह हमें बताता है कि हम अपने डेटा को कैसे विभाजित करते हैं (स्टेप्स बनाम बैच साइज) यह उतना ही महत्वपूर्ण है जितना कि हमारे पास कितना डेटा है। सबसे महत्वपूर्ण बात यह है कि यह हमें एक शॉर्टकट देता है: हमें अब सर्वश्रेष्ठ रणनीति खोजने के लिए हर एक संभावना का परीक्षण करने की आवश्यकता नहीं है। हम कुछ परीक्षण कर सकते हैं, इस नए गणित का उपयोग कर सकते हैं, और आत्मविश्वास के साथ विजेता की भविष्यवाणी कर सकते हैं, जिससे भारी मात्रा में समय और कंप्यूटिंग पावर की बचत होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →