Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
تقترح هذه الورقة إطار عمل تشغيلي هجين يجمع بين الترجمة الفورية (JIT) وتنفيذ رسوم كودا البيانية (CUDA Graph) لتقليل زمن انتقال الاستدلال وحمل إطلاق النواة بشكل كبير لأعباء عمل نماذج اللغات الكبيرة ذات التسلسلات القصيرة.