Predictable Scaling Laws of Optimal Hyperparameters for LLM Continued Pre-training
यह शोध पत्र एक मॉडल-अज्ञेय (model-agnostic) ढांचे का प्रस्ताव करता है जो छोटे पैमाने के प्रॉक्सी मॉडलों से खोजे गए पूर्वानुमेय स्केलिंग कानूनों और दिए गए चेकपॉइंट के समतुल्य प्री-ट्रेनिंग कंप्यूट का लाभ उठाता है ताकि एलएलएम (LLM) निरंतर प्री-ट्रेनिंग के लिए इष्टतम हाइपरपैरामीटर्स की मात्रात्मक भविष्यवाणी की जा सके, जिससे प्रदर्शन को बनाए रखते हुए या सुधारते हुए खोज ओवरहेड को 90% तक कम किया जा सके।