A Study on Hidden Layer Distillation for Large Language Model Pre-Training
यह अध्ययन लार्ज लैंग्वेज मॉडल प्री-ट्रेनिंग के लिए हिडन लेयर डिस्टिलेशन (Hidden Layer Distillation) की लॉजिट-आधारित (logit-based) विधियों के विरुद्ध बेंचमार्किंग करता है और पाता है कि जहाँ यह लगातार परप्लेक्सिटी (perplexity) में सुधार करता है, वहीं यह डाउनस्ट्रीम कार्यों पर मानक नॉलेज डिस्टिलेशन (knowledge distillation) से विश्वसनीय रूप से बेहतर प्रदर्शन नहीं करता है, जो यह संकेत देता है कि इंटरमीडिएट रिप्रेजेंटेशन सिग्नल्स का पूर्ण लाभ उठाने के लिए आगे और भी बड़ी सफलताओं की आवश्यकता है।