ML Inference Scheduling with Predictable Latency
यह शोध पत्र मौजूदा एमएल इन्फरेंस शेड्यूलिंग दृष्टिकोणों में महत्वपूर्ण सीमाओं की पहचान करता है, विशेष रूप से उनके मोटे-स्तर (कोर्स-ग्रेन्ड) के इंटरफेरेंस प्रेडिक्शन और स्टैटिक मॉडल्स पर उनकी निर्भरता को, जो गतिशील वर्कलोड के तहत सटीक लेटेंसी पूर्वानुमान और समझौता किए गए एसएलओ (SLO) का कारण बनते हैं।