MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Elastic LLMs
تقدم هذه الورقة MoBiQuant، وهو إطار عمل جديد للكمّ من نوع "خليط البتات" (Mixture-of-Bits) يعالج تحديات النشر المرن للنماذج اللغوية الكبيرة (LLMs) عبر ضبط دقة الأوزان ديناميكيًا بناءً على الحساسية على مستوى الرمز (token-level sensitivity) وموجه مدرك للرموز (token-aware router)، مما يتيح تبديل الدقة بسلاسة أثناء وقت التشغيل دون الحاجة إلى معايرة متكررة مع مطابقة أداء الكمّ بعد التدريب الخاص بكل دقة بت محددة.