Online Linear Programming for Multi-Objective Routing in LLM Serving
यह शोध पत्र LLM सर्विंग में मल्टी-ऑब्जेक्टिव रूटिंग को अनुकूलित करने के लिए बिड-प्राइस कंट्रोल और वॉर्म-स्टार्टेड ड्यूल अपडेट्स के साथ एक विज्ञान-आधारित ऑनलाइन लीनियर प्रोग्रामिंग फ्रेमवर्क प्रस्तावित करता है, जो पारंपरिक ह्यूरिस्टिक दृष्टिकोणों की तुलना में बेहतर लेटेंसी और थ्रूपुट प्रदर्शन प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त, हाई-एंड रेस्टोरेंट की रसोई चला रहे हैं। इस रसोई में कई समानांतर कुकिंग स्टेशन (GPUs) हैं, और ग्राहक (AI अनुरोध) एक-एक करके आ रहे हैं।
एक सामान्य रसोई में, आप शायद अगला ऑर्डर पहले खाली उपलब्ध शेफ के पास भेज देंगे। लेकिन इस विशिष्ट "AI रेस्टोरेंट" में, चीजें पेचीदा हैं:
- ऑर्डर अजीब हैं: कुछ ऑर्डर त्वरित ऐपेटाइज़र (छोटा टेक्स्ट) हैं, जबकि कुछ बहुत बड़े, जटिल भोजन हैं जिन्हें पकाने में लंबा समय लगता है (लंबा टेक्स्ट जनरेशन)। आपको यह नहीं पता होता कि एक ऑर्डर को पकाने में वास्तव में कितना समय लगेगा जब तक कि वह पकना शुरू न हो जाए।
- जगह कम है: प्रत्येक शेफ के पास सीमित काउंटर स्पेस (मेमोरी) है और वह एक बार में अपने चूल्हे पर कुछ ही प्लेटों को रख सकता है (बैच साइज)। यदि आप एक ही चूल्हे पर बहुत अधिक प्लेटें रख देते हैं, तो पूरा स्टेशन क्रैश हो जाता है।
- ग्राहक नखरेबाज हैं: कुछ ग्राहक चाहते हैं कि उन्हें उनका खाना तुरंत मिले (लो लेटेंसी), जबकि अन्य बस यह जानना चाहते हैं कि रसोई व्यस्त और कुशल है (हाई थ्रूपुट)। कभी-कभी, आपको चुनना पड़ता है: क्या आप एक ग्राहक को सुपर फास्ट सेवा दें, या दस ग्राहकों को थोड़ा धीमा?
पुराने तरीकों के साथ समस्या
आजकल की अधिकांश रसोई सरल नियमों का उपयोग करती है, जैसे "ऑर्डर को उस शेफ के पास भेजें जिसकी लाइन सबसे छोटी है" या "उसे भेजें जो वर्तमान में खाली है।" पेपर का तर्क है कि ये नियम ऐसे हैं जैसे घड़ी ठीक करने के लिए हथौड़े का उपयोग करना। वे यह नहीं समझते कि ऑर्डर का मूल्य क्या है या इसके लिए लगने वाली जगह की लागत क्या है। वे गति (speed) और दक्षता (efficiency) के बीच संतुलन बनाने में सक्षम नहीं हैं।
नया समाधान: "स्मार्ट प्राइस टैग" सिस्टम
लेखक एक नए तरीके का प्रस्ताव देते हैं जिससे आप "ऑनलाइन लीनियर प्रोग्रामिंग" की अवधारणा का उपयोग करके रसोई चला सकते हैं। इसे "स्मार्ट प्राइस टैग" सिस्टम के रूप में सोचें, जो हर इंच काउंटर स्पेस और हर मिनट के शेफ के समय के लिए है।
यह यहाँ चरण-दर-चरण बताया गया है:
1. शैडो प्राइस (अवसर लागत/Opportunity Cost)
कल्पना कीजिए कि एक शेफ के चूल्हे के हर स्थान पर एक छिपा हुआ "प्राइस टैग" लगा हुआ है। यह पैसा नहीं है; यह एक शैडो प्राइस (Shadow Price) है।
- यदि चूल्हा भीड़भाड़ वाला है और जगह खत्म हो रही है, तो प्राइस टैग बढ़ जाता है। यह राउटर को बताता है: "सावधान रहें! इस स्पेस का उपयोग अभी करने का मतलब है कि हम बाद में एक बड़ा, महत्वपूर्ण भोजन नहीं बना पाएंगे।"
- यदि चूल्हा खाली है, तो प्राइस टैग कम होता है। इसे अभी उपयोग करना सस्ता है।
2. निर्णय (लाभ बनाम लागत)
जब एक नया ग्राहक ऑर्डर आता है, तो राउटर केवल यह नहीं देखता कि कौन खाली है। वह एक त्वरित गणितीय जांच करता है:
- लाभ (Benefit): ग्राहक कितना खुश होगा? (क्या उन्हें उनका खाना जल्दी मिलेगा? क्या इससे रसोई की समग्र दक्षता में मदद मिलेगी?)
- लागत (Cost): उस स्पेस की "शैडो प्राइस" का योग जिसकी इस ऑर्डर को आवश्यकता है?
नियम: यदि लाभ (Benefit), लागत (Cost) से अधिक है, तो राउटर कहता है, "हाँ, इसे पकाओ!" यदि लागत बहुत अधिक है (चूल्हा अभी बहुत महंगा है), तो राउटर कह सकता है, "लाइन में प्रतीक्षा करें," या इसे किसी दूसरे, सस्ते चूल्हे पर भेज सकता है।
3. चलते-फिरते सीखना (वॉर्म स्टार्ट/Warm Start)
रसोई अराजक है। नए ऑर्डर आते रहते हैं और पुराने खत्म होते जाते हैं, जिससे "प्राइस टैग" हर सेकंड बदलते हैं।
- पुराने तरीके हर बार जब नया ऑर्डर आता है, तो शून्य से एक आदर्श योजना फिर से बनाने की कोशिश करते हैं। इसमें बहुत समय लगता है (जैसे खाना जलने के दौरान एक विशाल पहेली को हल करने की कोशिश करना)।
- यह नया तरीका एक स्मार्ट अपडेट का उपयोग करता है। यह पिछले सेकंड के मूल्यों को याद रखता है और जो कुछ भी अभी हुआ है उसके आधार पर एक छोटा, त्वरित समायोजन (एक "वॉर्म स्टार्ट") करता है। यह एक ऐसे शेफ की तरह है जो रसोई की सामान्य लय को जानता है और हर बार नया खाना सीखने के बजाय, नए ऑर्डर के लिए बस अपनी गतिविधियों में थोड़ा सा बदलाव करता है।
4. मल्टी-गोल मेनू
सबसे अच्छी बात यह है कि रसोई प्रबंधक बिना रसोई को दोबारा बनाए तुरंत लक्ष्यों के "मेनू" को बदल सकता है।
- गति चाहिए? प्रबंधक प्रतीक्षा समय (waiting time) की "कीमत" बढ़ा देता है। राउटर खाना जल्दी बाहर निकालने को प्राथमिकता देगा, भले ही रसोई थोड़ी भीड़भाड़ वाली हो जाए।
- दक्षता चाहिए? प्रबंधक खाली जगह की "कीमत" बढ़ा देता है। राउटर अधिक काम करने के लिए ऑर्डर्स को सघनता से पैक करेगा, भले ही कुछ ग्राहकों को थोड़ा लंबा इंतजार करना पड़े।
- सबसे धीमे ग्राहकों को ठीक करना है? प्रबंधक सिस्टम को विशेष रूप से "टेल" (सबसे धीमे 1% ऑर्डर) की रक्षा करने के लिए कह सकता है ताकि कोई पीछे न छूट जाए।
परिणाम
लेखकों ने एक विशाल AI रसोई के सिमुलेशन में इस "स्मार्ट प्राइस टैग" सिस्टम का परीक्षण किया। उन्होंने इसकी तुलना पुराने "सबसे छोटी लाइन" वाले नियमों से की।
- परिणाम: नया सिस्टम ट्रेड-ऑफ (समझौतों) को संतुलित करने में बहुत बेहतर था। यह बिना सिस्टम को खराब किए, जैसा कि प्रबंधक चाहता था, तेजी से या अधिक कुशलता से काम कर सकता था।
- बड़ी तस्वीर: पेपर का दावा है कि "अनुमान और जांच" (guess-and-check) वाले हीयुरिस्टिक्स के बजाय "विज्ञान-आधारित" गणितीय दृष्टिकोण का उपयोग करना बेहतर है। यह सिस्टम को एक ऐसा दिमाग देता है जो संसाधनों की वास्तविक लागत को समझता है, न कि केवल एक सरल नियम का पालन करता है।
संक्षेप में, केवल उपलब्ध शेफ को ऑर्डर भेजने के बजाय, यह सिस्टम एक स्मार्ट मैनेजर की तरह काम करता है जिसे पता होता है कि समय का हर सेकंड और काउंटर स्पेस का हर इंच कितना कीमती है, जिससे यह सुनिश्चित होता है कि चाहे कितनी भी भीड़ क्यों न हो, रसोई पूरी तरह से चलती रहे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।