Ranking Before Serving: Low-Latency LLM Serving via Pairwise Learning-to-Rank
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त कॉफी शॉप चला रहे हैं। आपके पास ग्राहकों की एक कतार (अनुरोध/requests) है जो ड्रिंक ऑर्डर करने के लिए इंतज़ार कर रहे हैं, और आपके पास एक अकेला बरिस्ता (लार्ज लैंग्वेज मॉडल या LLM) है जो एक-एक करके ड्रिंक्स बनाता है।
समस्या: "लंबा ऑर्डर" बाधा (The "Long Order" Bottleneck)
एक पारंपरिक कॉफी शॉप में, आप "जो पहले आया, उसे पहले सेवा मिले" (First Come, First Served) नियम का उपयोग करते हैं। यदि पहली पंक्ति के व्यक्ति ने एक जटिल, 20 मिनट वाला लाटे (latte) ऑर्डर किया, तो उनके पीछे वाले सभी लोगों को—भले ही वे सिर्फ एक त्वरित एस्प्रेसो चाहते हों—20 मिनट तक इंतज़ार करना होगा। इसे "हेड-ऑफ-लाइन (HOL) ब्लॉकिंग" कहा जाता है।
AI की दुनिया में, यह एक बड़ी समस्या है। कुछ AI प्रश्न सरल होते हैं और उत्तर देने में एक सेकंड लेते हैं। अन्य, विशेष रूप से नए "रीज़निंग" (तर्क करने वाले) AI मॉडल, जो गणित की समस्याओं या कोड को स्टेप-बाय-स्टेप सोचते हैं, उन्हें जवाब जेनरेट करने में मिनटों लग सकते हैं। यदि एक लंबा, सोचने वाला अनुरोध लाइन के सामने फंस जाता है, तो वह बाकी सभी को देरी से पहुँचा देता है, जिससे पूरा सिस्टम धीमा और सुस्त महसूस होने लगता है।
समाधान: "स्मार्ट प्रेडिक्टर" (PARS)
यह पेपर एक नया सिस्टम पेश करता है जिसे PARS (प्रॉम्प्ट-अवेयर रैंकिंग शेड्यूलर) कहा जाता है। इसे एक सुपर-स्मार्ट, अदृश्य मैनेजर की तरह समझें जो काउंटर के पीछे खड़ा है और बारिस्ता के काम शुरू करने से पहले ही ग्राहक के ऑर्डर स्लिप (प्रॉम्प्ट) को देख सकता है और तुरंत अंदाज़ा लगा सकता है कि ड्रिंक बनाने में कितना समय लगेगा।
आने के क्रम में लोगों को सेवा देने के बजाय, यह मैनेजर लाइन को फिर से व्यवस्थित करता है ताकि "त्वरित एस्प्रेसो" वाले ऑर्डर पहले जा सकें, उसके बाद "मीडियम" ऑर्डर, और फिर "20-मिनट वाले लाटे" वाले ऑर्डर को पीछे भेज दिया जाए। इसे "शॉर्टेस्ट-जॉब-फर्स्ट" (SJF) शेड्यूलिंग के रूप में जाना जाता है।
यह कैसे काम करता है: "पेयरवाइज" (Pairwise) ट्रिक
tricky हिस्सा यह है कि AI अप्रत्याशित है। कभी-कभी एक ही सवाल का छोटा जवाब मिलता है, और कभी-कभी संयोग से लंबा जवाब। यदि मैनेजर हर एक ऑर्डर के लिए सटीक समय (जैसे, "इसमें 42 सेकंड लगेंगे") का अनुमान लगाने की कोशिश करता है, तो वह गलत हो सकता है और लाइन बिगाड़ सकता है।
इस समस्या को हल करने के लिए, PARS एक चतुर ट्रिक का उपयोग करता है जिसे पेयरवाइज लर्निंग (Pairwise Learning) कहते हैं।
- पुराना तरीका: हर एक ऑर्डर के लिए सटीक समय का अनुमान लगाना। (जैसे, एक तरबूज का सटीक वजन बताने की कोशिश करना)।
- PARS का तरीका: बस एक बार में दो ऑर्डर्स की तुलना करना। पूछना: "क्या ऑर्डर A के लंबे समय तक चलने की संभावना ऑर्डर B से अधिक है?" (जैसे, यह कहना कि "यह तरबूज निश्चित रूप से उस सेब से भारी है")।
सिस्टम को छोटी, भ्रमित करने वाली अंतरों को अनदेखा करने और केवल स्पष्ट अंतरों पर ध्यान केंद्रित करने के लिए प्रशिक्षित किया गया है (जैसे, "यह गणित की समस्या एक साधारण अभिवादन की तुलना में बहुत कठिन है")। इन स्पष्ट तुलनाओं पर ध्यान केंद्रित करके, मैनेजर बिना किसी भ्रम के लाइन को सॉर्ट करने में बहुत कुशल हो जाता है।
परिणाम: सभी के लिए तेज़ सेवा
शोधकर्ताओं ने एक लोकप्रिय AI सर्विंग टूल, vLLM का उपयोग करके एक वास्तविक सेटिंग में इस सिस्टम का परीक्षण किया। उन्होंने पाया कि:
- भारी गति वृद्धि (Massive Speedups): छोटे कार्यों को पहले जाने देकर, उन्होंने मानक "फर्स्ट कम, फर्स्ट सर्व्ड" पद्धति की तुलना में उपयोगकर्ताओं के औसत प्रतीक्षा समय को 15.7 गुना तक कम कर दिया।
- कोई अतिरिक्त लागत नहीं: "मैनेजर" (प्रेडिक्टर) बहुत हल्का है। लाइन को सॉर्ट करने में लगभग कोई समय नहीं लगता, इसलिए यह बारिस्ता को धीमा नहीं करता है।
- किसी भी मॉडल पर काम करता है: सिस्टम इतना अच्छा है कि अनुमान लगाने में, यदि आप इसे एक प्रकार के AI (जैसे GPT-4) पर प्रशिक्षित करते हैं, तो यह पूरी तरह से अलग AI (जैसे Llama या DeepSeek) के लिए भी प्रभावी ढंग से लाइन को सॉर्ट कर सकता है, बिना दोबारा प्रशिक्षित हुए। यह एक ऐसे मैनेजर की तरह है जिसने कॉफी शॉप में ऑर्डर सॉर्ट करना सीखा और अब वह तुरंत चाय की दुकान पर भी वही काम कर सकता है।
- निष्पक्षता (Fairness): यह सुनिश्चित करने के लिए कि "20-मिनट वाले लाटे" के ऑर्डर हमेशा के लिए इंतज़ार न करते रहें, सिस्टम में एक सुरक्षा वाल्व है। यदि कोई लंबा ऑर्डर बहुत देर तक इंतज़ार करता है, तो उसे लाइन में ऊपर लाया जाता है ताकि कोई भूखा न रहे।
सारांश में
यह पेपर PARS प्रस्तुत करता है, जो एक स्मार्ट शेड्यूलिंग सिस्टम है जो AI अनुरोधों के लिए एक ट्रैफिक पुलिसकर्मी की तरह काम करता है। एक लंबे, जटिल अनुरोध को लाइन ब्लॉक करने देने के बजाय, यह एक स्मार्ट, तुलना-आधारित अनुमान लगाने वाले खेल का उपयोग करता है ताकि त्वरित अनुरोध पहले निकल सकें। यह पूरे AI सिस्टम को बहुत तेज़ और अधिक रिस्पॉन्सिव बनाता है, खासकर नए पीढ़ी के AI के साथ जो जवाब देने से पहले काफी समय तक "सोचना" पसंद करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।