Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
यह शोध पत्र एक हाइब्रिड रनटाइम फ्रेमवर्क प्रस्तावित करता है जो शॉर्ट-सीक्वेंस लार्ज लैंग्वेज मॉडल वर्कलोड के लिए इन्फरेंस लेटेंसी और कर्नल लॉन्च ओवरहेड को महत्वपूर्ण रूप से कम करने के लिए जस्ट-इन-टाइम (JIT) कंपाइलेशन को CUDA ग्राफ निष्पादन के साथ जोड़ता है।