Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode
تكشف هذه الورقة أنه بينما يعتمد استنتاج النماذج اللغوية الكبيرة (LLM) في مرحلة الدفعة الأولى (batch-1) للذكاء الاصطناعي الفيزيائي على الذاكرة، فإن وحدات معالجة الرسومات الأسرع تعاني من أعباء إضافية غير متناسبة في جانب الإطلاق تمنع تحقيق مكاسب متناسبة في زمن الاستجابة، وأن طرق التكميم القياسية غالبًا ما تفشل في تحقيق تسريع السرعة المتوقع ما لم تقترن بنواة محسنة للغاية مثل GPTQ+ExLlamaV2.