How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size
यह शोध पत्र एक "तीन-पद" (three-term) स्केलिंग लॉ का प्रस्ताव करता है जो प्रशिक्षण डेटा को चरणों (steps) और बैच आकार (batch size) में स्पष्ट रूप से विभाजित करता है, जिससे इष्टतम बैच आकार स्केलिंग की सुदृढ़ रिकवरी और काफी कम प्रशिक्षण रन का उपयोग करके उप-इष्टतम सेटिंग्स के लिए नियमों का व्युत्पन्न संभव हो पाता है।