← नवीनतम पेपर
🤖 machine learning

WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs

WattGPU एक नया ढांचा पेश करता है जो केवल सार्वजनिक मेटाडेटा का उपयोग करके, अनदेखे GPU और LLM पर लार्ज लैंग्वेज मॉडल्स की बिजली खपत और इन्फरेंस लेटेंसी (inference latency) की सटीक भविष्यवाणी करता है, जो हार्डवेयर प्रोफाइलिंग की आवश्यकता के बिना पारंपरिक भौतिक आधारों (physical baselines) से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-Martínez

प्रकाशित 2026-07-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-Martínez

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोड ट्रिप के लिए कार किराए पर लेने की कोशिश कर रहे हैं, लेकिन आपको नहीं पता कि आपके विशिष्ट सामान और रूट के लिए कौन सी कार सबसे अधिक ईंधन-कुशल (fuel-efficient) होगी। आमतौर पर यह जानने के लिए, आपको बाजार में मौजूद हर एक कार को अपने सटीक सामान के साथ शारीरिक रूप से चलाना होगा, गैस को मापना होगा, और यात्रा का समय लेना होगा। इसमें बहुत समय लगेगा और बहुत पैसा खर्च होगा।

यह पेपर WattGPU पेश करता है, जो कंप्यूटर चिप्स (GPUs) और AI मॉडल्स (LLMs) के लिए एक "क्रिस्टल बॉल" (भविष्य बताने वाला यंत्र) है। हर कार चलाने के बजाय, WattGPU केवल उनके स्पेसिफिकेशन शीट्स (spec sheets) को देखकर यह अनुमान लगा सकता है कि एक विशिष्ट AI मॉडल कितनी ऊर्जा का उपयोग करेगा और वह एक विशिष्ट कंप्यूटर चिप पर कितनी तेजी से चलेगा।

यह कैसे काम करता है, इसका विवरण सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:

समस्या: "अनुमान लगाने का खेल"

बड़ी कंपनियाँ और छोटे व्यवसाय AI चैटबॉट्स का उपयोग अधिक से अधिक कर रहे हैं। इन चैटबॉट्स को चलाने के लिए शक्तिशाली कंप्यूटर चिप्स (GPUs) की आवश्यकता होती है।

  • समस्या: सभी चिप्स एक समान नहीं होते। एक छोटे AI मॉडल को एक विशाल, शक्तिशाली चिप पर चलाना एक सेमी-ट्रक पर साइकिल का टायर लगाने जैसा है—यह भारी मात्रा में ईंधन (बिजली) बर्बाद करता है।
  • पुराना तरीका: सबसे अच्छा मिलान खोजने के लिए, ऑपरेटरों को हर AI मॉडल और कंप्यूटर चिप के संयोजन का भौतिक परीक्षण करना पड़ता था। यह महंगा है, धीमा है, और इसके लिए सारा हार्डवेयर पास होना आवश्यक है।
  • कमी: मौजूदा उपकरण अनुमान तो लगा सकते थे, लेकिन वे तब विफल हो जाते थे जब उनका सामना किसी ऐसे नए चिप या नए AI मॉडल से होता था जिसे उन्होंने पहले कभी नहीं देखा था।

समाधान: WattGPU (द "स्पेक शीट ओरकल")

लेखकों ने दो स्मार्ट प्रेडिक्शन मॉडल (एक बहुत ही उन्नत कैलकुलेटर की तरह) बनाए हैं जिन्हें केवल सार्वजनिक जानकारी की आवश्यकता होती है:

  1. AI का "रिज्यूमे": यह कितना बड़ा है? इसमें कितने लेयर्स हैं? (Hugging Face से मेटाडेटा)।
  2. चिप का "स्पेक शीट": यह कितनी तेज है? इसमें कितनी मेमोरी है? इसकी अधिकतम पावर लिमिट क्या है? (निर्माता के स्पेसिफिकेशन)।

जादुई ट्रिक:
यह सिस्टम विभिन्न चिप्स और AI मॉडल्स के "व्यक्तित्व" को सीखता है। एक बार प्रशिक्षित होने के बाद, यह एक बिल्कुल नए चिप को देख सकता है जिसे इसने पहले कभी नहीं देखा है और एक नए AI मॉडल को देख सकता है जिसे यह पहले कभी नहीं मिला है, और सटीक रूप से अनुमान लगा सकता है:

  • पावर ड्रॉ (Power Draw): यह कितनी वॉट बिजली सोखेगा?
  • लेटेंसी (Latency/ITL): इसे टेक्स्ट का एक शब्द (टोकन) जेनरेट करने में कितना समय लगेगा?

उपमा: रेस्टोरेंट की रसोई

सोचिए कि AI मॉडल एक रेसिपी (विधि) है और GPU एक रसोई है।

  • कुछ रेसिपी सरल होती हैं (टोस्ट बनाना); कुछ जटिल होती हैं (एक 10-कोर्स का भव्य भोज)।
  • कुछ रसोई में छोटे चूल्हे होते हैं; दूसरों में औद्योगिक ओवन होते हैं।

पुराना तरीका: आपको यह देखने के लिए हर रसोई में रेसिपी बनानी पड़ती है कि वह कितनी गैस का उपयोग करती है और उसमें कितना समय लगता है।
WattGPU तरीका: आप रेसिपी की सामग्री की सूची और रसोई के चूल्हे के आकार को देखते हैं। सिस्टम भविष्यवाणी करता है: "यदि आप इस विशिष्ट रेसिपी को उस विशिष्ट रसोई में पकाते हैं, तो यह आपकी सोच से 13% कम गैस का उपयोग करेगी, और इसमें प्रति व्यंजन 5 सेकंड लगेंगे।"

उन्होंने क्या सिद्ध किया?

शोधकर्ताओं ने 42 अलग-अलग AI मॉडल्स और 8 अलग-अलग सर्वर-ग्रेड कंप्यूटर चिप्स के विशाल डेटासेट पर WattGPU का परीक्षण किया। उन्होंने एक सख्त परीक्षण पद्धति का उपयोग किया जिसे "लीव-वन-आउट" (Leave-One-Out) कहा जाता है, जो एक ऐसी परीक्षा की तरह है जहाँ आपको उस विशिष्ट प्रश्न को पढ़ने से पहले पढ़ाई करने से मना किया जाता है जिसका उत्तर आपको देना है।

  • परिणाम:
    • पावर प्रेडिक्शन (Power Prediction): यह अविश्वसनीय रूप से सटीक था। ऑफलाइन कार्यों (बैच प्रोसेसिंग) के लिए, यह 3.4% से भी कम का अंतर था। सर्वर कार्यों (रियल-टाइम चैट) के लिए, यह 13.5% से कम का अंतर था।
    • स्पीड प्रेडिक्शन (Speed Prediction): रियल-टाइम चैट के लिए, यह 8.5% से कम का अंतर था।
    • रैंकिंग (Ranking): यह यह बताने में उत्कृष्ट था कि एक चिप दूसरी चिप से बेहतर क्यों है, भले ही सटीक संख्याएँ एकदम सही न हों।

यह क्यों महत्वपूर्ण है (द "आहा!" मोमेंट)

पेपर एक विशिष्ट उदाहरण का उपयोग करके एक आश्चर्यजनक निष्कर्ष को उजागर करता है: Llama 3.1 8B

  • यदि आप केवल चिप के "ईंधन दक्षता रेटिंग" (TDP) को देखते हैं, तो आप सोच सकते हैं कि एक छोटा, कम-शक्ति वाला चिप (L4) सबसे अच्छा विकल्प है।
  • हालाँकि, WattGPU ने भविष्यवाणी की कि यह छोटा चिप गति की आवश्यकताओं को पूरा करने के लिए बहुत धीमा होगा।
  • "स्पष्ट" उच्च-शक्ति वाला चिप (H100) तेज़ था लेकिन एक मध्यम आकार के चिप (A30) की तुलना में 43% अधिक ऊर्जा बर्बाद कर रहा था जो उतना ही तेज़ था।
  • सबक: WattGPU ने "गोल्डिलॉक्स" (Goldilocks) चिप को खोज निकाला—वह जो पर्याप्त तेज़ है लेकिन ऊर्जा बर्बाद नहीं करता है। इस टूल के बिना, लोग गलत चिप चुन लेते और भारी मात्रा में बिजली और पैसा बर्बाद करते।

यह क्या नहीं कर सकता (सीमाएं)

पेपर ईमानदार है कि WattGPU अभी क्या नहीं कर सकता:

  • यह मानक, "डेंस" (dense) AI मॉडल्स पर सबसे अच्छा काम करता है। यह अभी तक जटिल "मिक्सचर ऑफ एक्सपर्ट्स" (Mixture of Experts) मॉडल्स (जो विशेषज्ञों की एक टीम की तरह काम करते हैं) या अत्यधिक संकुचित (quantized) मॉडल्स को नहीं संभाल पाता है।
  • यह रियल-टाइम चैट की तुलना में "ऑफलाइन" बैच प्रोसेसिंग की गति के मामले में थोड़ा संघर्ष करता है, क्योंकि सॉफ्टवेयर एक साथ बड़े बैचों को प्रोसेस करते समय अलग तरह से व्यवहार करता है।

निचोड़ (The Bottom Line)

WattGPU एक ऐसा टूल है जो आपको भौतिक परीक्षण को छोड़ने की अनुमति देता है। केवल सार्वजनिक स्पेसिफिकेशन का उपयोग करके, यह ऑपरेटरों को उनके AI के लिए सही कंप्यूटर चिप चुनने में मदद करता है, जिससे उन्हें हर संभावना का परीक्षण करने के लिए हार्डवेयर से भरा लैब बनाने की आवश्यकता नहीं होती, और इससे पैसा और बिजली दोनों की बचत होती है। यह AI परिनियोजन (deployment) के "अनुमान लगाने के खेल" को एक गणनात्मक भविष्यवाणी में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →