← नवीनतम पेपर
💻 computer science

Beyond Prediction: Tail-Aware Scheduling for LLM Inference

यह शोध पत्र एक वितरण-जागरूक (distribution-aware), भविष्यवाणी-मुक्त शेड्यूलिंग फ्रेमवर्क पेश करता है जो सॉफ्ट प्रायोरिटी बूस्टिंग और कैश-अवेयर प्रीएम्प्शन का उपयोग करके LLM इन्फरेंस में टेल लेटेंसी और टाइम-टू-फर्स्ट-टोकन को काफी कम करता है, जो बर्स्टी अराइवल्स और GPU मेमोरी प्रेशर जैसी चुनौतीपूर्ण स्थितियों में भी पारंपरिक भविष्यवाणी-आधारित नीतियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Yueying Li, Yuanfan Chen, Jiayang Chen, Esha Choukse, Haoran Qiu, G. Edward Suh, Rodrigo Fonseca, Ziv Scully, Udit Gupta

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yueying Li, Yuanfan Chen, Jiayang Chen, Esha Choukse, Haoran Qiu, G. Edward Suh, Rodrigo Fonseca, Ziv Scully, Udit Gupta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक व्यस्त रेस्टोरेंट किचन की कल्पना करें जहाँ शेफ (GPUs) ग्राहकों (AI अनुरोधों) के लिए भोजन बना रहे हैं। कुछ ऑर्डर सरल हैं: "बस एक गिलास पानी" (एक छोटा चैट संदेश)। अन्य जटिल हैं: "एक विस्तृत कथानक के साथ 50 पन्नों का उपन्यास डिजाइन करें" (एक लंबा रीजनिंग कार्य)।

समस्या यह है कि किचन मैनेजर को यह नहीं पता होता कि कोई ऑर्डर पूरा होने में कितना समय लेगा जब तक कि वह लगभग पूरा न हो जाए। "एक गिलास पानी" "10-कोर्स वाला टेस्टिंग मेनू" में बदल सकता है यदि ग्राहक और अधिक मांगता रहे।

पुराना तरीका: भविष्य का अनुमान लगाना

वर्तमान किचन मैनेजर कुशल होने की कोशिश करते हैं और यह अनुमान लगाते हैं कि प्रत्येक ऑर्डर में कितना समय लगेगा। वे एक रणनीति का उपयोग करते हैं जिसे "शॉर्टेस्ट जॉब फर्स्ट" (SJF) कहा जाता है।

  • तर्क: "मुझे लगता है कि यह ऑर्डर जल्दी पूरा हो जाएगा, इसलिए मैं इसे पहले बना लूँगा ताकि इसे टेबल से हटाया जा सके।"
  • दोष: यदि मैनेजर गलत अनुमान लगाता है (जो जटिल AI कार्यों के साथ अक्सर होता है), तो त्वरित ऑर्डर में देरी हो जाती है, और वह लंबा ऑर्डर जिसे "छोटा" माना जाना था, वह अनंत काल तक चूल्हे पर कब्जा जमाए रहता है।
  • परिणाम: औसत प्रतीक्षा समय ठीक दिखता है, लेकिन सबसे खराब स्थिति वाले प्रतीक्षा समय (टेल लेटेंसी) बहुत खराब होते हैं। कुछ ग्राहक घंटों इंतजार करते हैं जबकि अन्य कुछ ही सेकंडों में सेवा प्राप्त कर लेते हैं। यह उपयोगकर्ता अनुभव के लिए बुरा है।

नया तरीका: "बूस्ट" सिस्टम (UNIBOOST)

इस पेपर के लेखक एक नया मैनेजर प्रस्तावित करते हैं जो अनुमान लगाना बंद कर देता है और अवलोकन करना शुरू करता है। वे अपने सिस्टम को UNIBOOST कहते हैं।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "सॉफ्ट बूस्ट" (किसी भविष्य बताने वाले यंत्र की आवश्यकता नहीं)

भविष्य की भविष्यवाणी करने के बजाय, नया मैनेजर प्रत्येक ऑर्डर को एक "प्रायोरिटी स्कोर" देता है जो समय के साथ सुचारू रूप से बदलता है।

  • उपमा: एक सवारी के लिए लाइन में खड़े लोगों की कल्पना करें। नया मैनेजर यह नहीं पूछता, "आप कितनी दूर जा रहे हैं?" इसके बजाय, वे कहते हैं, "आप जितना अधिक इंतजार करेंगे, आपका टिकट प्राथमिकता में थोड़ा 'बूस्ट' प्राप्त करेगा।"
  • यह कैसे मदद करता है: छोटे ऑर्डर जल्दी सेवा प्राप्त करते हैं क्योंकि वे पहले आते हैं। लेकिन यदि एक लंबा ऑर्डर काफी समय से इंतजार कर रहा है, तो उसे आगे बढ़ने के लिए एक हल्का धक्का दिया जाता है ताकि वह नए, छोटे ऑर्डरों की अंतहीन धारा के पीछे फंस न जाए। यह ग्राहकों के "लंबे इंतजार" को रोकने में मदद करता है।

2. "मेमोरी गार्ड" (बर्तन बर्बाद न करें)

AI में, भोजन पकाने के लिए बहुत अधिक मेमोरी (KV कैश) की आवश्यकता होती है। यदि आप एक नया काम शुरू करने के लिए बीच में ही खाना बनाना रोक देते हैं, तो आपको उन सामग्रियों को फेंकना पड़ता है जिन्हें आपने अभी तैयार किया था और फिर से शुरुआत करनी पड़ती है। यह महंगा और धीमा है।

  • उपमा: कल्पना करें कि एक शेफ एक बड़ा केक बेक करने के बीच में है। यदि मैनेजर चिल्लाता है, "रुको! इसके बजाय एक कुकी बनाओ!" तो शेफ को पैन से केक का बैटर खुरचना होगा, पैन धोना होगा, और कुकी शुरू करनी होगी। फिर, यदि वे वापस स्विच करते हैं, तो उन्हें पैन को फिर से धोना होगा।
  • समाधान: नया मैनेजर एक "मेमोरी गार्ड" का उपयोग करता है। वे कहते हैं, "एक बार जब आप केक बनाना शुरू कर देते हैं, तो हमें स्विच करने पर विचार करने से पहले कम से कम एक 'स्लाइस' पूरा करना ही होगा।" यह किचन को लगातार कार्यों को बदलने और समय बर्बाद करने से रोकता है।

3. "एडेप्टिव थर्मोस्टेट"

किचन की स्थितियाँ बदलती रहती हैं। कभी छोटे ऑर्डरों की भीड़ होती है; कभी कुछ विशाल ऑर्डर होते हैं।

  • उपमा: मैनेजर के पास एक स्मार्ट थर्मोस्टेट है जो देखता है कि लोग वास्तव में कितना इंतजार कर रहे हैं। यदि लाइन बहुत लंबी हो जाती है, तो मैनेजर स्वचालित रूप से "बूस्ट" सेटिंग्स को समायोजित करता है ताकि उन लोगों की मदद करने के लिए अधिक आक्रामक बनाया जा सके जो सबसे लंबे समय से इंतजार कर रहे हैं। यह बिना किसी भविष्य बताने वाले यंत्र के, चलते-फिरते सीखता है।

परिणाम

इस पेपर ने वास्तविक दुनिया के डेटा (जैसे कोडिंग कार्य और चैट बातचीत) का उपयोग करके इस नए सिस्टम का पुराने "अनुमान लगाने" वाले सिस्टमों के विरुद्ध परीक्षण किया।

  • पुराने सिस्टम: जब वर्कलोड बहुत अधिक (बर्स्टी) हो गया, तो "अनुमान लगाने" वाले सिस्टम विफल हो गए। सबसे खराब प्रतीक्षा समय (P99) बहुत बढ़ गया।
  • नया सिस्टम (UNIBOOST): इसने न केवल औसत प्रतीक्षा समय में सुधार किया; बल्कि इसने सबसे खराब प्रतीक्षा समय को भी नाटकीय रूप रूप से कम कर दिया।
    • इसने "परफेक्ट प्रेडिक्शन" वाले सर्वश्रेष्ठ सिस्टमों की तुलना में सबसे खराब प्रतीक्षा समय (P99) को 35% से 50% तक कम कर दिया।
    • इसने पहले टोकन के दिखने के समय (TTFT) को 34% से 47% तक तेज कर दिया।

मुख्य बात

यह पेपर तर्क देता है कि यह अनुमान लगाना कि एक AI कार्य में कितना समय लगेगा, नाजुक है और अक्सर गलत होता है। इसके बजाय, एक ऐसा सिस्टम जो इस बात पर प्रतिक्रिया करता है कि कार्यों को प्रतीक्षा करने में कितना समय लग रहा है, और साथ ही कार्यों को बहुत अधिक बार बदलकर मेमोरी बर्बाद न करने के प्रति सावधान रहता है, सभी के लिए बहुत बेहतर और तेज़ अनुभव बनाता है। यह मंजिल का अनुमान लगाने के बारे में नहीं, बल्कि लाइन के प्रवाह को प्रबंधित करने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →