A Study on Hidden Layer Distillation for Large Language Model Pre-Training
تقارن هذه الدراسة بين تقنية تقطير الطبقة الخفية (Hidden Layer Distillation) والأساليب القائمة على اللوجيت (logit-based methods) في مرحلة ما قبل التدريب للنماذج اللغوية الكبيرة، وتجد أنه بينما تعمل باستمرار على تحسين مستوى الحيرة (perplexity)، إلا أنها لا تتفوق بشكل موثوق على التقطير المعرفي القياسي في المهام اللاحقة، مما يشير إلى الحاجة إلى مزيد من الاختراقات للاستفادة الكاملة من إشارات التمثيل الوسيط.