FluxBin: Flexible LUT-based Ultra-low-bit LLM Inference by Algorithm-Kernel Synergy
إن FluxBin هو إطار عمل لتصميم مشترك بين الخوارزمية والنواة يجمع بين طريقة مبتكرة لتفكيك الثنائيات المنفصلة ونواة CUDA متخصصة باستخدام جداول البحث والتعيين العمودي الافتراضي لتمكين استنتاج النماذج اللغوية الكبيرة (LLM) بدقة بتّية فائقة الانخفاض مع تحقيق تسريع كبير في السرعة، وتوفير في الطاقة، وتقليل في الذاكرة مع الحفاظ على دقة عالية.