SLO-Aware Compute Resource Allocation for Prefill-Decode Disaggregated LLM Inference
यह शोध पत्र थ्रूपुट, SLO और अनुरोध विशेषताओं के बाधाओं को संतुष्ट करते हुए, लार्ज लैंग्वेज मॉडल इन्फरेंस के लिए प्रीफिल-डिकोड विलगित हार्डवेयर संसाधनों के इष्टतम आवंटन को सटीक रूप से निर्धारित करने हेतु अनुभवजन्य बेंचमार्किंग के साथ सैद्धांतिक मॉडलिंग को संयोजित करने वाली एक हाइब्रिड कार्यप्रणाली प्रस्तावित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ इस शोध पत्र (paper) का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
बड़ी तस्वीर: "असेंबली लाइन" की समस्या
कल्पना कीजिए कि आप एक बहुत बड़ी, हाई-एंड बेकरी चलाते हैं जो कस्टम केक बनाती है (ये आपके Large Language Models या LLMs हैं)।
पारंपरिक रूप से, आपके पास एक ही बेकर था जो सब कुछ करता था:
- ऑर्डर पढ़ना (Prefill): वे ग्राहक के लंबे, जटिल अनुरोध को पढ़ते हैं (जैसे, "ड्रैगन के बारे में 50 पन्नों की कहानी लिखें")। इसमें बहुत अधिक दिमागी शक्ति लगती है लेकिन यह काम तेज़ी से होता है।
- केक बनाना (Decode): इसके बाद वे कहानी को शब्द-दर-शब्द लिखते हैं। यह धीमा होता है और इसके लिए एक स्थिर, लयबद्ध गति की आवश्यकता होती है।
समस्या: जब ग्राहकों की भीड़ आती है, तो बेकर फंस जाता है। यदि वे एक नया ऑर्डर पढ़ने में व्यस्त हैं, तो वे पिछले ग्राहक के लिए अगला शब्द नहीं लिख सकते। यदि वे लिखने में व्यस्त हैं, तो वे नए ऑर्डर नहीं पढ़ सकते। इससे पहले शब्द के लिए प्रतीक्षा समय (जिसे TTFT कहा जाता है) और कहानी के बाकी हिस्से के लिए टाइपिंग की गति (जिसे TPOT कहा जाता है) दोनों में देरी होती है।
समाधान (P/D Disaggregation):
इसे ठीक करने के लिए, आप बेकरी को दो अलग-अलग स्टेशनों में विभाजित करते हैं:
- स्टेशन A (Prefill): विशेष बेकर्स जो केवल ऑर्डर पढ़ते हैं और आटा तैयार करते हैं।
- स्टेशन B (Decode): विशेष बेकर्स जो केवल कहानी को शब्द-दर-शब्द लिखते हैं।
- कन्वेयर बेल्ट: एक बार जब स्टेशन A का काम पूरा हो जाता है, तो वे "आटा" (context) स्टेशन B को सौंप देते हैं।
यह बहुत अच्छा है! लेकिन अब आपके पास एक नया, पेचीदा सवाल है: मुझे स्टेशन A बनाम स्टेशन B में कितने बेकर्स की आवश्यकता है?
- यदि आप स्टेशन A में बहुत अधिक बेकर्स रखते हैं लेकिन स्टेशन B में कम, तो आटा जमा होने लगेगा और ग्राहकों को अपनी कहानी शुरू करने के लिए बहुत लंबा इंतज़ार करना पड़ेगा।
- यदि आप स्टेशन B में बहुत अधिक बेकर्स रखते हैं लेकिन स्टेशन A में कम, तो लिखने वाली टीम नए आटे की प्रतीक्षा में खाली बैठी रहेगी।
शोध पत्र का लक्ष्य: "गोल्डिलॉक्स" कैलकुलेटर
किंगसॉफ्ट क्लाउड (Kingsoft Cloud) के इस शोध पत्र ने एक गणितीय रेसिपी प्रदान की है जिससे यह पता लगाया जा सके कि लागत कम रखने और ग्राहकों को खुश रखने (SLOs या सर्विस लेवल ऑब्जेक्टिव्स को पूरा करने) के लिए आपको प्रत्येक स्टेशन के लिए वास्तव में कितने बेकर्स (GPUs) की आवश्यकता है।
वे केवल अनुमान नहीं लगाते; वे सिद्धांत (Theory) और वास्तविक दुनिया के परीक्षण (Real-World Testing) के मिश्रण का उपयोग करते हैं।
चरण 1: सिद्धांत (ट्रैफिक लाइट मॉडल)
लेखकों ने महसूस किया कि "पढ़ने" वाला स्टेशन (Prefill) एक व्यस्त चौराहे की तरह काम करता है।
- उपमा (Analogy): कल्पना करें कि एक सिंगल-लेन सड़क (Prefill GPU) है। कारें (अनुरोध/requests) रैंडम समय पर आती हैं।
- प्रतिबंध (Constraint): आप हर ड्राइवर को वादा करते हैं कि वे 2 सेकंड के भीतर चौराहे से निकल जाएंगे (TTFT)।
- गणित: यदि आप सड़क को 100% क्षमता पर चलने देते हैं, तो ट्रैफिक जाम लग जाता है, और आपका 2-सेकंड का वादा टूट जाता है। आपको प्रतीक्षा समय को कम रखने के लिए प्रवाह (flow) को थोड़ा धीमा करना होगा।
यह पेपर M/M/1 क्यूइंग थ्योरी (Queuing Theory) नामक एक प्रसिद्ध गणितीय अवधारणा का उपयोग करता है (इसे एक ट्रैफिक फ्लो कैलकुलेटर के रूप में सोचें) यह उत्तर देने के लिए कि: "यदि मैं चाहता हूँ कि प्रतीक्षा समय 2 सेकंड से कम हो, तो मैं प्रति मिनट वास्तव में कितनी कारें गुज़रने दे सकता हूँ?"
यह उन्हें प्रिफिल स्टेशन की प्रभावी गति (effective speed) देता है।
चरण 2: वास्तविक दुनिया का परीक्षण (रनिंग ट्रैक)
"लिखने" वाले स्टेशन (Decode) के लिए, गणित थोड़ा अलग है। यह एक ट्रैक पर दौड़ने वाले धावक की तरह है।
- उपमा: एक धावक एक पानी की बोतल (batch size) ले जा सकता है या दस।
- ट्रेड-ऑफ (Trade-off): 10 बोतलें ले जाना अधिक कुशल है (उच्च थ्रूपुट/throughput), लेकिन यह धावक को धीमा और थका हुआ भी बनाता है (उच्च TPOT या प्रति आउटपुट टोकन समय)।
- परीक्षण: टीम ने यह देखने के लिए प्रयोग किए कि एक धावक कितनी बोतलें ले जा सकता है इससे पहले कि वह ग्राहक की गति संबंधी आवश्यकता को पूरा करने के लिए बहुत धीमा हो जाए।
यह उन्हें डिकोड स्टेशन की प्रभावी गति (effective speed) देता है।
चरण 3: अंतिम रेसिपी
एक बार जब उन्हें पता चल जाता है:
- स्टेशन A कितनी तेज़ी से काम कर सकता है ताकि प्रतीक्षा समय कम रहे।
- स्टेशन B कितनी तेज़ी से काम कर सकता है ताकि टाइपिंग की गति बनी रहे।
- औसत "ऑर्डर" (इनपुट लंबाई) और औसत "कहानी" (आउटपुट लंबाई) कितनी लंबी है।
वे इन नंबरों को एक सरल फॉर्मूले में डालते हैं ताकि परफेक्ट रेशियो (Perfect Ratio) प्राप्त किया जा सके।
पेपर से उदाहरण:
उन्होंने पाया कि एक विशिष्ट वर्कलोड के लिए, आदर्श सेटअप 3 प्रिफिल बेकर्स और 4 डिकोड बेकर्स (एक 3P4D सेटअप) था।
- यदि उन्होंने 3 और 3 का प्रयास किया, तो लिखने वाली टीम बाधा (bottleneck) बन जाती, और ग्राहकों को धीमी टाइपिंग गति के कारण गुस्सा आता।
- यदि उन्होंने 3 और 5 का प्रयास किया, तो उन्होंने एक अतिरिक्त बेकर पर पैसा बर्बाद किया जो बस खाली खड़ा रहता।
यह क्यों महत्वपूर्ण है
इस पेपर से पहले, कंपनियों को अपनी हार्डवेयर आवश्यकताओं को समझने के लिए अनुमान लगाना पड़ता था या महंगे सिमुलेशन चलाने पड़ते थे। वे या तो बहुत अधिक महंगा हार्डवेयर खरीद लेते थे (पैसा बर्बाद करना) या बहुत कम (ग्राहकों को नाखुश करना)।
यह पेपर उन्हें एक कैलकुलेटर देता है:
- मुझे अपनी गति की आवश्यकताएं (SLOs) बताएं।
- मुझे औसत ऑर्डर का आकार बताएं।
- मैं आपको ठीक बताऊंगा कि आपको "पढ़ने" वाली टीम और "लिखने" वाली टीम के लिए कितने GPU खरीदने चाहिए ताकि आपको अपने पैसे का सबसे अधिक लाभ मिले।
सारांश
- समस्या: AI के काम को "पढ़ने" और "लिखने" में विभाजित करना कुशल है, लेकिन इसे संतुलित करना कठिन है।
- समाधान: "पढ़ने" वाले हिस्से के लिए ट्रैफिक गणित (क्यूइंग थ्योरी) और "लिखने" वाले हिस्से के लिए वास्तविक दुनिया के रनिंग टेस्ट के हाइब्रिड तरीके का उपयोग करना।
- परिणाम: एक सटीक फॉर्मूला जो कंपनियों को यह बताने के लिए कि उन्हें पैसे बचाने और उपयोगकर्ताओं को खुश रखने के लिए कितने कंप्यूटर (GPUs) खरीदने चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।