TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes
TEMPO एक मेक्सपैन-जागरूक (makespan-aware) एक्सपर्ट-पैरेलल लोड बैलेंसिंग डिस्पैचर पेश करता है जो मेमोरी- और कंप्यूट-बाउंड रिजीमों के बीच गैर-रेखीय (non-linear) एक्सपर्ट निष्पादन समय को मॉडल करता है ताकि टोकन वितरण को गतिशील रूप से अनुकूलित किया जा सके, जिससे उन मिश्रित-रिजीम परिदृश्यों में 15.5% तक थ्रूपुट लाभ और महत्वपूर्ण विलंबता (latency) में कमी प्राप्त होती है जहाँ पारंपरिक रैखिक-गणना-आधारित विधियाँ विफल हो जाती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक ऐसे शहर के लिए एक विशाल, हाई-स्पीड पिज्जा डिलीवरी सर्विस चला रहे हैं जो कभी सोता नहीं है। आपके पास समान डिलीवरी ड्राइवरों (GPUs) का एक बेड़ा है और सैकड़ों अलग-अलग विशेषज्ञ शेफ (एक AI मॉडल में "एक्सपर्ट्स") वाला एक केंद्रीय किचन है। हर बार जब कोई ग्राहक पिज्जा ऑर्डर करता है, तो सिस्टम को यह तय करना होता है कि कौन से शेफ उस काम को करेंगे और कौन सा ड्राइवर तैयार पिज्जा लेकर जाएगा। आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से "Mixture-of-Experts" (MoE) नामक एक प्रकार के मॉडल के साथ, बिल्कुल ऐसा ही होता है। ये AI मॉडल विशाल मस्तिष्क की तरह होते हैं जो हजारों छोटे, विशिष्ट उप-मस्तिष्कों से बने होते हैं। जब AI सोचता है, तो वह एक बार में अपने पूरे मस्तिष्क का उपयोग नहीं करता; वह काम को संभालने के लिए कुछ विशिष्ट विशेषज्ञों को चुनता है।
बड़ी चुनौती पूरी टीम को एक ही गति से चालू रखना है। यदि एक ड्राइवर एक बहुत बड़ा, जटिल ऑर्डर लेकर फंस जाता है जबकि बाकी सभी खाली बैठे हैं, तो पूरी डिलीवरी में देरी हो जाती है। कई वर्षों तक, वर्कलोड को संतुलित करने का मानक नियम सरल था: "बस ऑर्डर्स की संख्या को समान रूप से विभाजित करें।" यदि आपके पास 100 ऑर्डर्स हैं, तो अपने 10 ड्राइवरों में से प्रत्येक को 10 दें। यह तार्किक लग सकता था, जैसे सेबों के ढेर को समान रूप से बांटना। लेकिन क्या होगा अगर कुछ सेब भारी पत्थर हों और अन्य हल्के पंख? या क्या होगा अगर किचन का एक नियम हो कि किसी शेफ को चुनने में एक निश्चित समय लगता है, चाहे वे कितने भी पिज्जा बनाएं? पुराने नियमों ने माना था कि समय हमेशा ऑर्डर्स की संख्या से सीधे जुड़ा होता है। यह सवाल उठाता है: क्या होगा अगर यह धारणा गलत है?
इस पेपर के पीछे के शोधकर्ताओं ने, जो KlingAI में काम करते हैं, पाया कि पुराना "ऑर्डर्स गिनने" वाला नियम वास्तव में एक जाल है। उन्होंने पाया कि आधुनिक AI हार्डवेयर में, किसी विशेषज्ञ (expert) को प्रोसेस करने में लगने वाला समय केवल इस बात पर निर्भर नहीं करता कि वह कितने टोकन (शब्द या डेटा के टुकड़े) देखता है। यह एक दो-मुंही तलवार है। कभी-कभी, समय विशेषज्ञ की "रेसिपी" (वेट्स/weights) को मेमोरी बैंक से लोड करने के प्रयास द्वारा नियंत्रित होता है, जिसमें ऑर्डर कितना भी छोटा क्यों न हो, एक निश्चित समय लगता है। अन्य समय में, एक बार रेसिपी लोड हो जाने के बाद, समय ऑर्डर्स की संख्या के साथ रैखिक (linearly) रूप से बढ़ता है। पुराने तरीके, जो केवल ऑर्डर्स की संख्या देखते थे, रेसिपी लोड करने की छिपी हुई लागत को समझने में विफल रहे। वे पंखों और पत्थरों के ढेर को केवल गिनकर संतुलित करने की कोशिश कर रहे थे, जबकि उन्हें वजन करना चाहिए था।
इसे ठीक करने के लिए, टीम ने एक नया डिस्पैचर बनाया जिसे TEMPO (Time-modeled Expert-Parallel Optimization) कहा जाता है। केवल टोकन गिनने के बजाय, TEMPO एक स्मार्ट ट्रैफिक कंट्रोलर की तरह कार्य करता है जो किचन के भौतिक विज्ञान (physics) को समझता है। यह एक विशेष "कॉस्ट मॉडल" का उपयोग करता है जो सटीक रूप से मापता है कि शेफ की रेसिपी लोड करने में कितना समय लगता है और पिज्जा पकाने में कितना समय लगता है। यह समझता है कि यदि आपके पास एक "कोल्ड" एक्सपर्ट है (जिसे काफी समय से उपयोग नहीं किया गया है), तो उसके छोटे से ऑर्डर को दो ड्राइवरों के बीच विभाजित करना आपदा है क्योंकि आपको "लोडिंग शुल्क" दो बार चुकाना पड़ेगा। लेकिन यदि आपके पास एक "हॉट" एक्सपर्ट है जिसके पास ऑर्डर्स का पहाड़ है, तो उसे विभाजित करना ठीक है।
पेपर दिखाता है कि TEMPO केवल अनुमान नहीं लगाता है; यह मिलीसेकंड में अनुरोधों के हर बैच के लिए सटीक संतुलन की गणना करता है। उन्होंने वास्तविक AI मॉडलों पर इसका परीक्षण किया और पाया कि पुराने तरीके अक्सर 15% धीमे थे या अंतिम कुछ ग्राहकों के लिए महत्वपूर्ण देरी का कारण बनते थे। TEMPO, हालांकि, लाइन को सुचारू रूप से चलाता रहता है। यह एक ऐसे नियम से स्विच करने जैसा है जो कहता है कि "प्रत्येक को सेबों की समान संख्या मिले" और उस नियम की ओर जो कहता है कि "प्रत्येक को काम की समान मात्रा मिले," यह ध्यान रखते हुए कि कुछ सेब भारी हैं और कुछ शेफ जागने में धीमे हैं।
शोधकर्ताओं ने बहुत सावधानी से यह दिखाया कि यह नई विधि कहाँ काम करती है और कहाँ नहीं। उन्होंने साबित किया कि यदि "हॉट" एक्सपर्ट इतने अधिक हैं कि सिस्टम केवल डेटा की भारी मात्रा से अभिभूत हो जाता है (कंप्यूट-बाउंड रिजीम), तो पुराना टोकन-गिनती वाला तरीका वास्तव में ठीक है। लेकिन वास्तविक दुनिया में, जहाँ कुछ विशेषज्ञ व्यस्त हैं और अन्य आराम कर रहे हैं, और जहाँ "लोडिंग शुल्क" अधिक है, वहाँ TEMPO चमकता है। उन्होंने एक "फेज डायग्राम" भी बनाया, जो AI ट्रैफिक के लिए एक मौसम मानचित्र की तरह है, जो सटीक रूप से भविष्यवाणी करता है कि कब नई विधि समय बचाएगी और कब पुराना तरीका पर्याप्त है।
अंत में, यह पेपर केवल एक तेज़ एल्गोरिदम के बारे में नहीं है; यह AI में काम को संतुलित करने के बारे में हमारी सोच को बदलने के बारे में है। यह हमें सिखाता है कि आधुनिक AI की जटिल, हाई-स्पीड दुनिया में, आप केवल चीजों को गिन नहीं सकते। आपको डेटा को स्थानांतरित करने की छिपी हुई लागत और काम के विशिष्ट स्वरूप को समझना होगा। डेटा के काम को करने में लगने वाले वास्तविक समय को मापकर, TEMPO के AI मॉडलों को तेज़, अधिक कुशल और भविष्य की भारी मांगों को संभालने के लिए तैयार बनाता है। यह एक अराजक किचन को एक सुव्यवस्थित मशीन में बदल देता है, यह सुनिश्चित करता है कि कोई भी ड्राइवर इंतज़ार में न रहे जबकि पिज्जा हीट लैंप के नीचे रखा हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।