SPQ: An Ensemble Technique for Large Language Model Compression
تقدم هذه الورقة البحثية تقنية SPQ، وهي تقنية ضغط تجميعية تجمع بشكل تآزري بين تفكيك القيم المفردة (SVD)، والتقليم القائم على التنشيط، وتكميم ما بعد التدريب لتحقيق خفض كبير في الذاكرة وتحسين سرعة الاستدلال للنماذج اللغوية الكبيرة مثل LLaMA-2-7B مع الحفاظ على مستويات الارتياب ودقة المهام اللاحقة أو تعزيزها مقارنة بالنماذج المرجعية الحالية.