Efficient, VRAM-Constrained xLM Inference on Clients
تقدم هذه الورقة تقنية "التجزئة المتسلسلة" (pipelined sharding)، وهي تقنية جدولة هجينة مبتكرة بين المعالج المركزي ومعالج الرسوميات تعمل على تحسين سرعة الاستدلال وتقليل متطلبات ذاكرة الوصول العشوائي للفيديو (VRAM) لنماذج اللغات الكبيرة والنماذج اللغوية البصرية على أنظمة العملاء بشكل كبير، محققةً مكاسب في الإنتاجية تصل إلى 30 ضعفاً وانخفاضاً في ذاكرة VRAM بمقدار 10 أضعاف مقارنة بالنماذج المرجعية الشرسة.