Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics
यह स्थिति पत्र (position paper) तर्क देता है कि एलएलएम (LLM) इन्फरेंस सर्विंग अब सामान्य ह्यूरिस्टिक्स (heuristics) से आगे निकल चुकी है और इसके लिए गणितीय अनुकूलन मॉडलों और उन एल्गोरिदम की नींव विकसित करने की आवश्यकता है जो इसकी अनूठी विशेषताओं के अनुरूप हों, ताकि विविध वर्कलोड्स में प्रमाणित प्रदर्शन गारंटी सुनिश्चित की जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हाई-स्पीड रेस्टोरेंट किचन चला रहे हैं। यह किचन सिर्फ बर्गर नहीं बनाता; यह एक-एक करके आने वाले ऑर्डर्स के आधार पर जटिल, मल्टी-कोर्स मील तैयार करता है। पेच यह है कि आपको यह नहीं पता कि प्रत्येक मील बनाने में कितना समय लगेगा, और जैसे-जैसे शेफ अधिक खाना पकाता है, वह मील काउंटर पर उतनी ही अधिक जगह घेरता जाता है, जिससे अन्य ऑर्डर्स के लिए जगह कम पड़ती जाती है।
आज के दौर में लार्ज लैंग्वेज मॉडल्स (LLMs) के साथ बिल्कुल यही स्थिति है। वे "किचन" हैं जो सर्च इंजन, कोडिंग असिस्टेंट और चैटबॉट्स को शक्ति प्रदान करते हैं।
यह पेपर तर्क देता है कि अभी, ये डिजिटल किचन केवल अंदाजों और सरल नियमों (heuristics) पर चल रहे हैं। लेखक का मानना है कि इन्हें तेज़, सस्ता और अधिक विश्वसनीय बनाने के लिए अब गणितीय सटीकता और ठोस एल्गोरिदम आधारित नींव की ओर स्विच करने का समय आ गया है।
यहाँ रोजमर्रा के उपमाओं (analogies) का उपयोग करके पेपर के तर्क का विवरण दिया गया है:
1. समस्या: "काफी अच्छा" नियम विफल हो रहे हैं
वर्तमान में, vLLM और SGLang जैसे सिस्टम (वह सॉफ्टवेयर जो इन मॉडल्स को चलाता है) सामान्य कंप्यूटिंग से लिए गए पुराने-ढंग के नियमों का उपयोग करते हैं।
- कतार (The Queue): यदि आपके पास ग्राहकों की एक लाइन है, तो किचन बस उन्हें उसी क्रम में परोसता है जिस क्रम में वे आए थे (पहले आओ, पहले पाओ)।
- रूटिंग (The Routing): यदि आपके पास कई शेफ हैं, तो किचन अगले ऑर्डर को उस शेफ के पास भेज देता है जिसकी लाइन सबसे छोटी है, या बस एक चक्का घुमाकर किसी एक को चुन लेता है।
- सफाई (The Cleanup): यदि काउंटर भर जाता है, तो किचन नए ऑर्डर के लिए जगह बनाने के लिए काउंटर पर मौजूद सबसे पुरानी वस्तु को फेंक देता है।
पेपर का बिंदु: ये नियम एक साधारण बर्गर जॉइंट के लिए ठीक काम करते हैं। लेकिन LLMs अजीब हैं।
- "बढ़ता हुआ" मील: एक बर्गर के विपरीत, जो शुरुआत से अंत तक समान जगह घेरता है, एक LLM मील पकने के दौरान बढ़ता जाता है। AI द्वारा उत्पन्न किया गया हर शब्द अधिक मेमोरी घेरता है।
- "दो-चरणों वाला" खाना बनाना: ऑर्डर का पहला हिस्सा (प्रॉम्प्ट को पढ़ना) तेज़ है और इसमें बहुत अधिक दिमागी शक्ति (कंप्यूट) की आवश्यकता होती है। दूसरा हिस्सा (उत्तर जेनरेट करना) धीमा है और इसमें बहुत अधिक मेमोरी बैंडविड्थ की आवश्यकता होती है।
- अनिश्चितता: किचन को यह नहीं पता होता कि मील कब तक तैयार होगा जब तक कि वह पूरा न हो जाए।
इन विशिष्टताओं के कारण, पुराने "सबसे छोटी लाइन" या "सबसे पुरानी वस्तु बाहर करें" जैसे नियम अक्सर अराजकता पैदा करते हैं, जिससे कुछ शेफ खाली बैठे रह जाते हैं जबकि अन्य काम के बोझ से दब जाते हैं, या काउंटर अचानक जगह खत्म होने के कारण संकट में पड़ जाता है।
2. समाधान: गणितज्ञों को बुलाएं
लेखक का कहना है कि हमें अंदाज़ा लगाना बंद करना चाहिए और गणितीय अनुकूलन (mathematical optimization) का उपयोग करना शुरू करना चाहिए। इसे एक मास्टर लॉजिस्टिक्स प्लानर के रूप में सोचें जो केवल एक नियम पुस्तिका का पालन करने के बजाय, एक सुपर-कंप्यूटर का उपयोग करके किचन चलाने के परफेक्ट तरीके की गणना करता है।
पेपर चार विशिष्ट क्षेत्रों को उजागर करता है जहाँ गणित किचन को ठीक कर सकता है:
शेफों के बीच संतुलन बनाना (Load Balancing):
- वर्तमान तरीका: ऑर्डर को उस शेफ के पास भेजें जिसके पास सबसे कम टिकट हैं।
- गणितीय तरीका: गणना करें कि प्रत्येक ऑर्डर को बढ़ते समय वास्तव में कितने "काउंटर स्पेस" और "दिमागी शक्ति" की आवश्यकता होगी, और उन्हें इस तरह वितरित करें कि कोई भी शेफ सबसे धीमे शेफ के इंतज़ार में फंसा न रहे। पेपर एक वास्तविक सिस्टम (DeepSeek) का उल्लेख करता है जो इसे पूरी तरह से करने के लिए लीनियर प्रोग्रामिंग (एक प्रकार का गणित) का उपयोग करता है, जिससे समय और पैसा बचता है।
इंतज़ार की कतार (Scheduling):
- वर्तमान तरीका: लाइन में खड़े पहले व्यक्ति को परोसें।
- गणितीय तरीका: लाइन को देखें और महसूस करें, "उस व्यक्ति ने 10 पन्नों का निबंध ऑर्डर किया है, लेकिन अगले व्यक्ति को सिर्फ एक वाक्य का चुटकुला चाहिए।" पहले चुटकुले को परोसें! इससे काउंटर जल्दी खाली होता है और अधिक लोग खा पाते हैं। गणित यह अनुमान लगा सकता है कि कौन से ऑर्डर जल्दी समाप्त होंगे ताकि किचन की गति बनी रहे।
काउंटर की जगह (Caching):
- वर्तमान तरीका: जब काउंटर भर जाए तो सबसे पुरानी चीज़ को फेंक दें।
- गणितीय तरीका: यह समझना कि एक "हाई-रिज़ॉल्यूशन वीडियो" को हटाकर "छोटे थंबनेल" के लिए जगह बनाना एक बुरा सौदा है। वीडियो को दोबारा बनाना बहुत समय लेता है और बहुत महंगा पड़ता है। गणित यह गणना कर सकता है कि चीजों को फेंकने की "लागत" क्या है और महंगी चीजों को काउंटर पर बनाए रखता है।
स्टाफ की योजना बनाना (Capacity Planning):
- वर्तमान तरीका: जब लाइन लंबी हो जाए तो शेफ जोड़ते रहें।
- गणितीय तरीका: सूत्रों का उपयोग करके यह जानें कि दरवाजे खोलने से पहले ही आपको कितने शेफ की आवश्यकता है, इस आधार पर कि कितने ग्राहकों की उम्मीद है। यह रोकता है कि किचन कभी भी अत्यधिक बोझ तले दबे।
3. हम सिर्फ नियमों के साथ क्यों न टिके रहें?
पेपर उन संदेहियों को संबोधित करता है जो कहते हैं, "वर्तमान नियम ठीक काम करते हैं, बदलने की क्या ज़रूरत है?"
- "यह बड़े पैमाने पर काम करता है": लेखक स्वीकार करता है कि वर्तमान नियम ठीक-ठाक काम करते हैं, लेकिन वे नाजुक हैं। यदि कोई वायरल ऐप अचानक एक अजीब प्रकार का ऑर्डर भेज देता है, तो किचन क्रैश हो सकता है। गणित एक सुरक्षा जाल (गारंटी) प्रदान करता है कि सबसे खराब परिस्थितियों में भी किचन विफल नहीं होगा।
- "हार्डवेयर बहुत तेज़ी से बदलता है": लेखक का तर्क है कि हालांकि हार्डवेयर (ओवन) बदलता है, लेकिन किचन को व्यवस्थित करने का लॉजिक वही रहता है। गणित आपको एक ब्लूप्रिंट देता है जो तब भी काम करता है जब आप ओवन बदल देते हैं।
- "सिस्टम इंजीनियरिंग अधिक महत्वपूर्ण है": लेखक कहता है कि गणित और इंजीनियरिंग पार्टनर हैं। आपके पास दुनिया का सबसे तेज़ ओवन हो सकता है, लेकिन यदि आपकी शेड्यूलिंग खराब है, तो ओवन खाली बैठा रहेगा। गणित आपको बताता है कि ओवन को व्यस्त कैसे रखा जाए।
4. बड़ी तस्वीर
पेपर निष्कर्ष निकालता है कि LLM सर्विंग का क्षेत्र सरल नियमों के अपने "बचपन" से आगे निकल चुका है। यह एक जटिल प्रणाली में विकसित हो गया है जिसे गणितज्ञों और एल्गोरिदम विशेषज्ञों के वयस्क पर्यवेक्षण की आवश्यकता है।
इन समस्याओं को केवल इंजीनियरिंग सुधारों के बजाय गणितीय पहेलियों के रूप में मानकर, हम प्राप्त कर सकते हैं:
- अनुमान लगाने की क्षमता (Predictability): यह जानना कि सिस्टम वास्तव में कैसा व्यवहार करेगा।
- दक्षता (Efficiency): भारी मात्रा में ऊर्जा और पैसे की बचत करना।
- विश्वसनीयता (Reliability): यह सुनिश्चित करना कि चीजें पागलपन भरी होने पर भी सिस्टम क्रैश न हो।
संक्षेप में: अंदाज़ा लगाना बंद करें। गणना करना शुरू करें। AI सर्विंग का भविष्य केवल बड़े मॉडल बनाने के बारे में नहीं है; यह उन्हें चलाने के स्मार्ट, गणितीय रूप से सिद्ध तरीके बनाने के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।