MoE-nD: Per-Layer Mixture-of-Experts Routing for Multi-Axis KV Cache Compression
يقدم MoE-nD إطار عمل لتوجيه خليط الخبراء لكل طبقة يقوم بتعيين نسب طرد رموز وعروض عرض بتات تكميم فريدة لكل طبقة محول (transformer) تحت ميزانية ذاكرة عالمية، محققاً ضغطاً في ذاكرة التخزين المؤقت لـ KV يصل إلى 14 ضعفاً مع الحفاظ على دقة مماثلة للنماذج المرجعية غير المضغوطة في مهام الاستدلال ذات السياق الطويل.