L20-Edu-135M: An Auditable Single-GPU Study of Data-Efficient Small Language Modeling
यह शोध पत्र L20-Edu-135M प्रस्तुत करता है, जो एक एकल NVIDIA L20 GPU पर 13B टोकन के साथ पूरी तरह से प्रशिक्षित 135M-पैरामीटर वाले भाषा मॉडल का एक ऑडिट करने योग्य केस स्टडी है, जो यह प्रदर्शित करता है कि हालांकि यह SmolLM2 जैसे बड़े पैमाने के मॉडलों से पीछे है, फिर भी यह अपने न्यूनतम टोकन बजट के सापेक्ष प्रतिस्पर्धी प्रदर्शन प्राप्त करता है और संसाधन-बाधित सेटिंग्स में RLVR के विशिष्ट विफलता मोड को उजागर करता है।