Mapping the Schedule x Bit-Width Boundary in Sub-100M Quantisation-Aware Training
تُثبت هذه الورقة أنه بالنسبة لنماذج اللغة من نوع "decoder" التي يقل حجمها عن 100 مليون معلمة، فإن الجدول الأمثل لخفض معدل التعلم (33%) مستقل إلى حد كبير عن عرض البت (FP16، INT8، INT6) وحجم النموذج، مع إظهار INT4 انتقالاً متميزاً من نظام يهيمن عليه الضجيج تحت 50 مليون معلمة إلى جدول أمثل حاسم عند 50 مليون معلمة وما فوقها.