Measuring and Reducing WebGPU Dispatch Overhead for LLM Inference
تكشف هذه الورقة أن عبء الإرسال في WebGPU، وليس جودة النواة، هو العائق الأساسي لاستنتاج النماذج اللغوية الكبيرة (LLM) ذات الدفعة الواحدة في المتصفحات، مما يثبت أن القياسات البسيطة تبالغ في تقدير التكاليف بسبب تداخل التزامن وتخلص إلى أن تقليل عدد عمليات الإرسال من خلال التجميع هو استراتيجية التحسين الأكثر فعالية.