Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors
यह शोध पत्र HYMELL को प्रस्तुत करता है, जो एक हाइब्रिड तीन-स्तरीय ढांचा है जो विश्लेषणात्मक मॉडलिंग और मशीन लर्निंग को जोड़ता है ताकि NVIDIA H100 जैसे हार्डवेयर पर विविध लार्ज लैंग्वेज मॉडल आर्किटेक्चर के इन्फरेंस लेटेंसी और ऊर्जा खपत का सटीक अनुमान लगाया जा सके, जिससे 5% से कम की त्रुटि प्राप्त होती है और कुशल, हार्डवेयर-मुक्त डिज़ाइन स्पेस एक्सप्लोरेशन सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, बात करने वाला रोबोट बनाने की कोशिश कर रहे हैं जो कहानियाँ लिख सके, गणित की समस्याएँ हल कर सके और इंसानों की तरह बातचीत कर सके। इस रोबोट को 'लार्ज लैंग्वेज मॉडल' (LLM) कहा जाता है। इसे काम करने के लिए एक सुपर-फास्ट कंप्यूटर दिमाग की आवश्यकता होती है, जो आमतौर पर एक ग्राफिक्स प्रोसेसिंग यूनिट (GPU) होता है, यह वही चिप है जो हाई-एंड वीडियो गेम कंप्यूटर में पाई जाती है। लेकिन पेच यह है कि ये रोबोट इतने बड़े और समझदार होते जा रहे हैं कि इन्हें चलाना अविश्वसनीय रूप से महंगा होता जा रहा है। ये भारी मात्रा में बिजली निगल जाते हैं और सोचने में बहुत समय लेते हैं, जिससे इन्हें अस्पतालों या स्कूलों जैसी वास्तविक दुनिया की स्थितियों में उपयोग करना कठिन हो जाता है।
बड़ा सवाल यह है कि वैज्ञानिक क्या पूछ रहे हैं: "हम यह कैसे जान सकते हैं कि एक रोबोट बनाने से पहले ही उसे कितनी ऊर्जा और समय की आवश्यकता होगी?" अभी, यह जानने के लिए, आपको आमतौर पर रोबोट को बनाना पड़ता है, उसे चलाना पड़ता है, और विशेष उपकरणों के साथ उसे मापना पड़ता है। यह धीमा, महंगा है, और इसके लिए आपके पास वास्तविक सुपर-कंप्यूटर का होना आवश्यक है। यदि आप सबसे कुशल डिज़ाइन खोजने के लिए एक हजार अलग-अलग रोबोट डिज़ाइन आज़माना चाहते हैं, तो आपको उन सभी को एक-एक करके बनाना और टेस्ट करना होगा, जिसमें अनंत समय लगेगा और बहुत बड़ी लागत आएगी।
यहीं पर यूनिवर्सिटी ऑफ सदर्न कैलिफोर्निया के शोधकर्ताओं की एक टीम एक नए विचार के साथ सामने आती है जिसे HYMELL कहा जाता है। HYMELL को एक "क्रिस्टल बॉल" (भवि счет बताने वाला गोला) की तरह समझें। रोबोट बनाने और परीक्षण करने के बजाय, यह उपकरण आपको सटीक रूप से बता सकता है कि आपका रोबोट कितना तेज़ और कितना ऊर्जा-खपत करने वाला होगा। यह पुराने ज़माने के गणितीय सूत्रों और आधुनिक मशीन लर्निंग के चतुर मिश्रण का उपयोग करता है ताकि इन विशाल मॉडलों को चलाने की लागत का अनुमान लगाया जा सके। शोधकर्ताओं ने अपने इस 'क्रिस्टल बॉल' का परीक्षण एक शक्तिशाली चिप NVIDIA H100 पर किया और पाया कि यह रोबोट की गति और ऊर्जा उपयोग की भविष्यवाणी अद्भुत सटीकता के साथ कर सकता है—अक्सर 5% से भी कम की त्रुटि के साथ। इसका मतलब है कि इंजीनियर अब बिना सुपर-कंप्यूटर खरीदे या परिणाम के लिए दिनों तक प्रतीक्षा किए, अपने लैपटॉप पर हजारों अलग-अलग डिज़ाइन आज़मा सकते हैं ताकि सबसे कुशल डिज़ाइन खोजा जा सके।
तीन-स्तरीय जासूस
HYMELL कैसे काम करता है इसे समझने के लिए, कल्पना करें कि आप एक विशाल, बहु-परतीय केक बेक करने में लगने वाले समय और आपके ओवन द्वारा उपयोग की जाने वाली बिजली का अनुमान लगाने की कोशिश कर रहे हैं। आप केवल अंतिम केक को देखकर कुल समय का अनुमान लगाने की कोशिश कर सकते हैं, लेकिन यह अक्सर गलत होता है क्योंकि आप छोटी बारीकियों को छोड़ देते हैं। इसके बजाय, HYMELL एक तीन-स्तरीय जासूस की तरह कार्य करता है, जो समस्या को छोटे, प्रबंधनीय टुकड़ों में तोड़ देता है।
स्तर 1: सूक्ष्म सामग्रियां (एनालिटिकल मॉडलिंग)
सबसे पहले, सिस्टम रोबोट के मस्तिष्क की सबसे छोटी "सामग्रियों" को देखता है। ये बुनियादी गणितीय क्रियाएं हैं जैसे संख्याओं के विशाल ग्रिडों (जिन्हें GEMM कहा जाता है) को गुणा करना, डेटा को सामान्य करना (RMSNorm), और अटेंशन स्कोर की गणना करना (Softmax)। शोधकर्ताओं ने महसूस किया कि ये सूक्ष्म क्रियाएं इस आधार पर अलग-अलग व्यवहार करती हैं कि काम कितना बड़ा है।
- उपमा: एक छोटी रसोई के कार्य जैसे एक प्याज काटने के बारे में सोचें। यदि आपके पास केवल एक प्याज है, तो इसमें लगने वाला समय मुख्य रूप से इस बात पर निर्भर करता है कि फ्रिज तक जाने, चाकू उठाने और काटने शुरू करने में कितना समय लगता है (इसे "लॉन्च-बाउंड" कहा जाता है)। लेकिन यदि आपको पहाड़ों जैसा प्याज का ढेर काटना है, तो समय मुख्य रूप से काटने की गति और प्याज को इधर-उधर ले जाने की गति पर निर्भर करता है (यह "मेमोरी-बाउंड" है)।
- HYMELL इन सूक्ष्म सामग्रियों की लागत की गणना करने के लिए गणितीय सूत्रों का उपयोग करता है, चाहे काम छोटा हो या बहुत बड़ा। यह केवल अनुमान नहीं लगाता; यह इन क्रियाओं की आधारभूत लागत का पता लगाने के लिए भौतिकी-आधारित नियमों का उपयोग करता है।
स्तर 2: रेसिपी ब्लॉक्स (मशीन लर्निंग)
इसके बाद, सिस्टम इन सूक्ष्म सामग्रियों को बड़े "ब्लॉक्स" में समूहित करता है, जैसे कि 'अटेंशन ब्लॉक' (जो रोबोट को महत्वपूर्ण शब्दों पर ध्यान केंद्रित करने में मदद करता है) और 'फीड-फॉरवर्ड नेटवर्क' (जो इसे जानकारी संसाधित करने में मदद करता है)।
- उपमा: मान लीजिए कि आप जानते हैं कि एक प्याज काटने में कितना समय लगता है और अंडे फेंटने में कितना समय लगता है। लेकिन जब आप उन्हें एक ऑमलेट बनाने के लिए मिलाते हैं, तो कुछ अतिरिक्त चरण होते हैं: खोल तोड़ना, कटोरा साफ करना, और शायद थोड़ा इंतज़ार करना। ये अतिरिक्त चरण साधारण गणित से गणना करना कठिन है।
- इसलिए, HYMELLE एक छोटा, स्मार्ट कंप्यूटर प्रोग्राम (एक मशीन लर्निंग मॉडल) का उपयोग करता है ताकि ये "अतिरिक्त चरण" सीखे जा सकें। यह स्तर 1 से प्राप्त गणित-आधारित अनुमानों को देखता है और डेटा को फिर से व्यवस्थित करने या कार्यों के बीच स्विच करने जैसे वास्तविक दुनिया के जटिल ओवरहेड्स के लिए एक सुधार कारक (correction factor) जोड़ता है। यह इसे पूरे "रेसिपी ब्लॉक" की लागत की बहुत सटीक भविष्यवाणी करने की अनुमति देता है।
स्तर 3: पूरा केक (एंड-टू-एंड प्रेडिक्शन)
अंत में, सिस्टम पूरी बातचीत के दौरान पूरे रोबोट की लागत का अनुमान लगाने के लिए सभी ब्लॉक्स को एक साथ जोड़ता है।
- उपमा: अब आपके पास ऑमलेट, केक और सलाद के लिए लगने वाला समय है। लेकिन एक पूरा भोज आयोजित करने में केवल समय जोड़ने से कहीं अधिक शामिल है। आपको ओवन के गर्म होने, रसोई के भीड़भाड़ वाले होने और काउंटर से मेज तक बर्तन ले जाने में लगने वाले समय की चिंता करनी होगी।
- HYMELL सभी ब्लॉक्स की लागत को लेने और उनमें ये "सिस्टम-लेवल" प्रभाव जोड़ने के लिए एक अन्य स्मार्ट कंप्यूटर प्रोग्राम का उपयोग करता है। यह उन चीजों पर विचार करता है जैसे कि एक साथ कितने लोग प्रश्न पूछ रहे हैं (बैच साइज) और क्या रोबोट एक लंबा प्रॉम्प्ट पढ़ रहा है या बस एक-एक शब्द उत्पन्न कर रहा है। यह कुल समय और ऊर्जा की आवश्यकता की अंतिम, सटीक भविष्यवाणी प्रदान करता है।
उन्होंने क्या पाया
शोधकर्ताओं ने LLaMA 3, Mistral और Qwen जैसे प्रसिद्ध रोबोट मॉडलों का उपयोग करके एक शक्तिशाली NVIDIA H100 GPU पर इस तीन-स्तरीय जासूस का परीक्षण किया। परिणाम प्रभावशाली थे।
- उच्च सटीकता: सूक्ष्म सामग्रियों (स्तर 1) के लिए, भविष्यवाणियां वास्तविकता के बहुत करीब थीं, जिनमें त्रुटियां अक्सर 4% से कम थीं। पूरे रोबोट (स्तर 3) के लिए, सिस्टम ने कई मॉडलों के लिए समय और ऊर्जा उपयोग की भविष्यवाणी 5% से कम की त्रुटि के साथ की। उदाहरण के लिए, जब LLaMA 3 8B मॉडल का परीक्षण किया गया, तो "प्रीफिल" चरण (प्रॉम्प्ट पढ़ना) के दौरान समय के लिए त्रुटि केवल 4.19% और ऊर्जा के लिए 2.92% थी, और "डिकोड" चरण (शब्द उत्पन्न करना) के दौरान यह और भी कम (लगभग 1.5%) थी।
- गति और लचीलापन: चूंकि HYMELL ब्लूप्रिंट (आर्किटेक्चरल पैरामीटर्स) के आधार पर भविष्यवाणी करता है न कि रोबोट को चलाकर, यह अविश्वसनीय रूप से तेज़ है। यह इंजीनियरों को तुरंत हजारों डिज़ाइन परिवर्तनों का पता लगाने की अनुमति देता है। उदाहरण के लिए, वे पूछ सकते हैं, "क्या होगा यदि हम अटेंशन हेड्स की संख्या दोगुनी कर दें?" और सेकंडों में उत्तर प्राप्त कर सकते हैं, जो दिखाता है कि एक विशिष्ट सेटअप के लिए 64 हेड्स सबसे ऊर्जा-कुशल विकल्प हो सकते हैं।
- विभिन्न हार्डवेयर पर काम करना: टीम ने यह भी दिखाया कि यह विधि केवल एक प्रकार के कंप्यूटर तक सीमित नहीं है। उन्होंने एक अलग GPU (NVIDIA RTX A6000) पर परीक्षण किया और सिस्टम ने अच्छी तरह से काम किया, जिसमें त्रुटियां लगभग 8% के आसपास रहीं। यह सुझाव देता है कि यदि आप एक नए कंप्यूटर चिप पर HYMELL का उपयोग करना चाहते हैं, तो आपको पूरा पहिया फिर से बनाने की आवश्यकता नहीं है; आपको बस उस नए चिप के बुनियादी व्यवहार को एक बार मापना होगा, और बाकी सिस्टम अपने आप ढल जाएगा।
यह क्या नहीं है
यह ध्यान रखना महत्वपूर्ण है कि HYMELL क्या नहीं करता है। यह कोई जादुई छड़ी नहीं है जो आपको शून्य से रोबोट बनाना सिखाती है, न ही यह पूरी तरह से वास्तविक परीक्षण की आवश्यकता को प्रतिस्थापित करता है। यह एक भविष्यवाणी उपकरण है। शोधकर्ता स्पष्ट रूप से कहते हैं कि हालांकि उनका मॉडल बहुत सटीक है, फिर भी इसमें छोटी त्रुटियां हैं, विशेष रूप से जब यह रोबोट के विभिन्न हिस्सों के बीच बहुत जटिल अंतःक्रियाओं या विभिन्न प्रकार के मेमोरी ऑप्टिमाइजेशन के बीच स्विच करते समय होता है। साथ भी, जबकि उन्होंने एकल कंप्यूटरों पर परीक्षण किया, उन्होंने उल्लेख किया कि कई कंप्यूटरों (मल्टी-जीपीयू) के साथ मिलकर काम करने वाले इन रोबोटों के काम करने की भविष्यवाणी करने के लिए सिस्टम में कुछ और चरणों को जोड़ने की आवश्यकता होगी, जिसे उन्होंने अभी तक पूरी तरह से हल नहीं किया है।
यह क्यों मायने रखता है
HYMELL की सुंदरता यह है कि यह एक धीमे, महंगे अनुमान के खेल को एक तेज़, सटीक विज्ञान में बदल देता है। गणितीय सूत्रों की विश्वसनीयता और मशीन लर्निंग के लचीलेपन को जोड़कर, यह डिजाइनरों को अधिक हरित, तेज़ और कुशल AI बनाने के लिए एक शक्तिशाली उपकरण प्रदान करता है। हर विचार का परीक्षण करने के लिए बिजली और समय जलाने के बजाय, वे इस "क्रिस्टल बॉल" का उपयोग उन्हें बनाने से पहले ही सर्वोत्तम डिज़ाइन खोजने के लिए कर सकते हैं, जो कृत्रिम बुद्धिमत्ता के अधिक टिकाऊ भविष्य का मार्ग प्रशस्त करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।