← नवीनतम पेपर
📊 statistics

Throughput-Optimal Scheduling Algorithms for LLM Inference and AI Agents

यह शोध पत्र LLM इन्फरेंस के लिए गणितीय कतारबद्धता (queueing) के मूलभूत सिद्धांतों को स्थापित करता है, यह सिद्ध करते हुए कि वर्क-कंजर्विंग शेड्यूलिंग एल्गोरिदम व्यक्तिगत और AI-एजेंट वर्कलोड दोनों के लिए अधिकतम थ्रूपुट प्राप्त करते हैं, जबकि Orca और Sarathi-Serve की इष्टतमता की पुष्टि करने के लिए वास्तविक दुनिया के सिस्टम का मूल्यांकन करता है और FasterTransformer तथा वैनिला vLLM की अस्थिरता के प्रति आगाह करता है।

मूल लेखक: J. G. Dai, Tianze Deng, Yueying Li, Tianyi Peng

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: J. G. Dai, Tianze Deng, Yueying Li, Tianyi Peng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हाई-स्पीड फैक्ट्री चलाते हैं जो कस्टम रोबोट बनाती है। इस फैक्ट्री में, हर ऑर्डर (एक "अनुरोध") दो अलग-अलग चरणों से गुजरता है:

  1. सेटअप चरण (प्रीफिल): आप ब्लूप्रिंट पढ़ते हैं और सभी आवश्यक पुर्जे इकट्ठा करते हैं। यह एक भारी काम है जिसमें बहुत अधिक दिमागी शक्ति (कंप्यूट) की आवश्यकता होती है लेकिन यह एक साथ होता है।
  2. असेंबली चरण (डिकोड): आप रोबोट बनाना शुरू करते हैं, एक बार में एक हिस्सा जोड़ते हुए, एक-एक करके। यह एक धीमा, मेमोरी-हैवी काम है जो स्टेप-दर-स्टेप होता है।

आपके पास एक विशाल, सुपर-फास्ट रोबोटिक हाथ (GPU) है जो एक साथ कई ऑर्डर्स पर काम कर सकता है। हालांकि, उसके पास एक सीमा है: वह एक बार में अपने ग्रिपर में पुर्जों का कुल वजन कितना उठा सकता है (टोकन बजट)।

यह पेपर एक गणितीय अध्ययन है कि ऑर्डर्स को कैसे व्यवस्थित किया जाए ताकि आपकी फैक्ट्री कभी रुक न जाए और बिना किसी रुकावट के अधिकतम संभव रोबोट बना सके।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. स्वर्णिम नियम: "हाथ को खाली न बैठने दें"

इस पेपर की सबसे महत्वपूर्ण खोज एक अवधारणा है जिसे "वर्क-कन्जर्विंग" (Work-Conserving) कहा जाता है।

कल्पना कीजिए कि आपका रोबोटिक हाथ पुर्जे पकड़ने के लिए तैयार है।

  • गलत तरीका: आप केवल "सेटअप" पुर्जे तभी उठाते हैं जब केवल सेटअप ऑर्डर्स ही प्रतीक्षा में हों। यदि "असेंबली" ऑर्डर्स प्रतीक्षा में हैं, तो आप उन्हें अनदेखा कर देते हैं, भले ही हाथ में खाली जगह हो। या, आप केवल "असेंबली" पुर्जे तभी उठाते हैं जब केवल असेंबली ऑर्डर्स ही हों।
    • परिणाम: हाथ आधा खाली बैठा रहता है, एक विशिष्ट प्रकार के ऑर्डर की प्रतीक्षा करता है, जबकि दूसरे प्रकार के ऑर्डर का एक बड़ा ढेर जमा होता जाता है। फैक्ट्री धीमी हो जाती है या क्रैश हो जाती है।
  • सही तरीका (वर्क-कन्जर्विंग): यदि हाथ में जगह है, तो आप जो भी उपलब्ध है उसे भर देते हैं। आप एक ही बैच में सेटअप पार्ट्स और असेंबली पार्ट्स को मिला देते हैं। आप कभी भी हाथ को खाली नहीं छोड़ते यदि काम करने के लिए कुछ उपलब्ध हो।

पेपर का दावा: जो एल्गोरिदम इस "बाल्टी भरने" के नियम का पालन करते हैं (जैसे Orca और Sarathi-Serve), वे गणितीय रूप से सबसे कुशल सिद्ध होते हैं। वे सिस्टम टूटने के बिना अधिकतम संभव काम को संभाल सकते हैं।

2. "पुराने" बनाम "नए" फैक्ट्री मैनेजर

लेखकों ने चार लोकप्रिय "मैनेजरों" (शेड्यूलिंग एल्गोरिदम) का परीक्षण किया कि कौन स्वर्णिम नियम का पालन करता है:

  • FasterTransformer और Vanilla vLLM (कठोर मैनेजर): ये मैनेजर बहुत ज्यादा चूजी (picky) हैं।
    • FasterTransformer केवल असेंबली पार्ट्स उठाता है। यदि कोई असेंबली ऑर्डर नहीं है, तो यह प्रतीक्षा में मौजूद सेटअप ऑर्डर्स को अनदेखा कर देता है, भले ही हाथ खाली हो।
    • Vanilla vLLM केवल सेटअप पार्ट्स उठाता है। यदि कोई सेटअप ऑर्डर नहीं है, तो यह प्रतीक्षा में मौजूद असेंबली ऑर्डर्स को अनदेखा कर देता है।
    • निर्णय: ये इष्टतम (optimal) नहीं हैं। भारी लोड के तहत, ये फैक्ट्री को जाम और अस्थिर कर देते हैं।
  • Orca और Sarathi-Serve (लचीले मैनेजर): ये मैनेजर दोनों प्रकार के काम को मिलाते हैं। वे हाथ को उस चीज़ से भर देते हैं जो फिट बैठती है।
    • निर्णय: ये इष्टतम (optimal) हैं। वे फैक्ट्री को अधिकतम गति पर सुचारू रूप से चलाते रहते हैं।

3. "AI एजेंट" फैक्ट्री (जटिल वर्कफ़्लो)

कभी-कभी, एक ऑर्डर केवल एक सिंगल रोबोट नहीं होता; यह रोबोट्स की एक पूरी टीम है जो मिलकर काम करती है।

  • DAG (डायरेक्टेड एसाइक्लिक ग्राफ): कल्पना करें कि एक वर्कफ़्लो है जहाँ ऑर्डर A स्टेशन 1 से स्टेशन 2, फिर स्टेशन 3 पर जाता है और कभी वापस नहीं आता।
    • निष्कर्ष: जब तक वर्कफ़्लो एक सीधी रेखा में है (कोई लूप नहीं), "हाथ को खाली न बैठने दें" वाला नियम सभी स्टेशनों पर पूरी तरह से काम करता है।
  • फोर्क-जॉइन (Fork-Join): कल्पना करें कि ऑर्डर A तीन सब-टास्क्स में विभाजित होता है जो तीन अलग-अलग स्टेशनों पर जाते हैं, और अंतिम चरण से पहले उन सभी को पूरा होना होता है।
    • निष्कर्ष: यहाँ भी, "हाथ को खाली न बैठने दें" नियम पूरी तरह से काम करता है।
  • साइकिल (द ट्रैप): कल्पना करें कि ऑर्डर A स्टेशन 1 से स्टेशन 2 जाता है, लेकिन ऑर्डर B स्टेशन 2 से वापस स्टेशन 1 पर जाता है। वे एक घेरे में एक-दूसरे का पीछा कर रहे हैं।
    • निष्कर्ष: यहाँ, "हाथ को खाली न बैठने दें" नियम विफल हो सकता है। भले ही मैनेजर अपना सर्वश्रेष्ठ प्रयास कर रहे हों, गोलाकार ट्रैफिक एक ऐसा जाम पैदा कर सकता है जो कभी साफ नहीं होता। पेपर दिखाता है कि यदि आपकी फैक्ट्री में ऐसे गोलाकार लूप हैं, तो आपको बहुत स्मार्ट और अधिक सावधान मैनेजर की आवश्यकता है, न कि केवल एक "बाल्टी भरने" वाले मैनेजर की।

4. "बाल्टी का आकार" का आश्चर्य

फैक्ट्री में एक दूसरी सीमा भी है: बैच साइज (Batch Size)। यह ऑर्डर्स की अधिकतम संख्या है जिसे हाथ पकड़ सकता है, चाहे उनका वजन कुछ भी हो।

  • आश्चर्य: लेखकों ने पाया कि कभी-कभी, हाथ को उसके पूर्ण वजन सीमा (टोकन बजट) तक भरना वास्तव में एक बुरा विचार है।
  • उपमा: कल्पना कीजिए कि आपके पास एक बाल्टी है जो 100 पाउंड पकड़ सकती है। आपके पास 100 छोटे कंकड़ (Setup) और 100 भारी ईंटें (Assembly) हैं।
    • यदि आप ईंटों के साथ बाल्टी को 100 पाउंड तक भरने की कोशिश करते हैं, तो आप शायद केवल 5 ईंटें ही रख पाएंगे। उस भारी भार को उठाने में लगने वाला समय लंबा होता है।
    • लेकिन यदि आप 50 पाउंड (एक छोटा भार) पर रुक जाते हैं, तो आप इसे बहुत तेज़ी से उठा पाएंगे, जिससे आप प्रति घंटे अधिक चक्कर लगा सकेंगे।
  • निष्कर्ष: विशिष्ट स्थितियों में, सबसे कुशल रणनीति यह है कि प्रोसेसिंग स्पीड को उच्च बनाए रखने के लिए बाल्टी को पूरी तरह भरने से पहले ही रुक जाएँ। इसका मतलब है कि भले ही "अच्छे मैनेजर" (वर्क-कन्जर्विंग) हों, यदि फैक्ट्री के नियम (बैच साइज लिमिट्स) बहुत सख्त हैं और ऑर्डर्स का मिश्रण ऐसा है कि जाम लग जाए, तो वे विफल हो सकते हैं।

सारांश

यह पेपर हमें बताता है:

  1. अपने काम को मिलाएं: सेटअप और असेंबली कार्यों को अलग न करें। GPU को व्यस्त रखने के लिए उन्हें एक ही बैच में मिलाएं।
  2. Orca और Sarathi-Serve विजेता हैं: वे "मिक्स एंड फिल" नियम का पालन करते हैं, जिससे वे अधिकांश स्थितियों में सबसे स्थिर और कुशल विकल्प बनते हैं।
  3. लूप्स (Loops) से सावधान रहें: यदि आपके AI एजेंट सर्वरों के बीच कार्यों को एक घेरे में भेज रहे हैं, तो साधारण "बाल्टी भरने" वाले नियम काम नहीं कर सकते; आपको विशेष ट्रैफिक कंट्रोल की आवश्यकता है।
  4. पूरा भरा होना हमेशा सबसे अच्छा नहीं होता: विशिष्ट स्थितियों में, अपने बैच में थोड़ी खाली जगह छोड़ना, उसे पूरी तरह भरने से अधिक समझदारी भरा हो सकता है, यह इस पर निर्भर करता है कि व्यक्तिगत कार्य कितने बड़े हैं।

इस सारी गणित का लक्ष्य इंजीनियरों को ऐसे AI सिस्टम बनाने में मदद करना है जो तब क्रैश न हों जब लाखों लोग एक साथ सवाल पूछ रहे हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →