← नवीनतम पेपर
🤖 machine learning

The Model Parking Tax: Quantifying the Hidden Energy Cost of Always-On GPU Model Deployment

यह शोध पत्र अनुभवजन्य रूप से यह प्रदर्शित करता है कि AI मॉडलों को GPU मेमोरी में रखे रखने की ऊर्जा लागत मुख्य रूप से VRAM अधिभोग (occupancy) के बजाय CUDA कॉन्टेक्स्ट के DVFS ट्रांज़िशन से होने वाली विवेकी (discrete) शक्ति वृद्धि द्वारा संचालित होती है, जो यह प्रकट करता है कि मॉडल परिनियोजन (deployment) के लिए ऊर्जा-इष्टतम रणनीति मॉडल के आकार के बजाय अनुरोध आगमन दरों और कोल्ड-स्टार्ट विलंबता (latency) पर निर्भर करती है।

मूल लेखक: Sai Sathvik Vadari

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sai Sathvik Vadari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "द मॉडल पार्किंग टैक्स" (The Model Parking Tax) पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

मुख्य विचार: AI पर "पार्किंग टैक्स"

कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट चलाते हैं। आपका एक नियम है: "एक बार जब वीआईपी (VIP) मेहमान के लिए मेज सजा दी गई, तो हम उसे हमेशा के लिए सजा हुआ रखेंगे, भले ही वहां कोई बैठा न हो।"

क्यों? क्योंकि यदि कोई नया मेहमान आता है, तो आप मेज सजाने में (बर्तन, नैपकिन, मेनू) समय बर्बाद नहीं करना चाहते। आप चाहते हैं कि वे तुरंत बैठें और खाना शुरू करें।

AI की दुनिया में, कंपनियाँ शक्तिशाली कंप्यूटर चिप्स, जिन्हें GPUs कहा जाता है, के साथ भी ऐसा ही करती हैं। जब वे किसी AI मॉडल (जैसे कि एक चैटबॉट) को GPU पर लोड करते हैं, तो वे उसे वहां छोड़ देते हैं, जो 24/7 चलता रहता है, भले ही कोई उससे सवाल न पूछ रहा हो। वे ऐसा "कोल्ड स्टार्ट" (cold start) की देरी से बचने के लिए करते—यानी मॉडल को शुरू से लोड करने में लगने वाला समय।

समस्या: यह पेपर तर्क देता है कि इन AI मॉडल्स को GPU पर "पार्क" करके रखना बिजली की बहुत बर्बादी है, और वह भी एक ऐसे कारण से जिसकी किसी ने उम्मीद नहीं की थी।

छिपा हुआ खर्च: यह कार के "आकार" के बारे में नहीं है

ज्यादातर लोग मानते हैं कि एक बड़े AI मॉडल (जैसे कि 70-बिलियन-पैरामीटर वाला विशाल मॉडल) को GPU पर रखने में एक छोटे मॉडल (जैसे कि 7-बिलियन-पैरामीटर वाला मॉडल) की तुलना में बहुत अधिक बिजली खर्च होगी, क्योंकि बड़ा मॉडल GPU की मेमोरी (VRAM) में अधिक जगह घेरता है।

पेपर की बड़ी खोज: यह गलत है।

लेखकों ने तीन अलग-अलग प्रकार के हाई-एंड GPUs (H100, A100, और L40S) पर इसका मापन किया। उन्होंने पाया कि मॉडल को "पार्क" करने की बिजली की लागत लगभग पूरी तरह से इंजन चालू करने पर निर्भर करती है, न कि इस पर कि कार गैरेज में कितनी जगह लेती है।

उपमा: चालू खड़ी कार (Idling Car)

GPU को एक कार के इंजन की तरह समझें:

  1. खाली आइडल (Bare Idle): कार बंद है। इंजन ठंडा है। यह लगभग कोई गैस (ईंधन) खर्च नहीं करता।
  2. "कॉन्टेक्स्ट" (इंजन चालू है): जैसे ही आप कार शुरू करने के लिए चाबी घुमाते हैं (एक "CUDA context" बनाते हैं), इंजन तुरंत चलने के लिए उच्च गति पर रेस (rev) लेने लगता है।
    • चौंकाने वाली बात: एक बार जब वह इंजन इस गति पर पहुँच जाता है, तो इससे कोई फर्क नहीं पड़ता कि आपने ट्रंक में एक छोटी साइकिल रखी है या एक बड़ा ट्रक। इंजन अभी भी उसी उच्च गति पर चल रहा है, और उतनी ही मात्रा में गैस जला रहा है।

इस पेपर में इसे "मॉडल पार्किंग टैक्स" (Model Parking Tax) कहा गया है।

  • टैक्स: एक निश्चित मात्रा में बिजली (चिप के आधार पर 26 और 66 वॉट के बीच) जो आप कोई भी मॉडल लोड करते ही चुकाते हैं।
  • आश्चर्य: अधिक मेमोरी जोड़ने से, जिससे एक बड़ा मॉडल समा सके, खर्च में लगभग शून्य अतिरिक्त वृद्धि होती है। चाहे आप 1GB का मॉडल पार्क करें या 64GB का, बिजली का बिल समान रहता है।

उन्होंने यह कैसे पता लगाया

शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने दो काम किए:

  1. वास्तविक दुनिया की निगरानी: उन्होंने एक डेटा सेंटर में 18 दिनों तक 14 वास्तविक GPUs पर नज़र रखी और लाखों माप लिए। उन्होंने देखा कि जब एक मॉडल लोड किया गया, तो बिजली का उपयोग बढ़ गया, लेकिन मॉडल का आकार बदलने से बिजली के उपयोग में कोई बदलाव नहीं आया।
  2. नियंत्रित प्रयोग: उन्होंने तीन अलग-अलग प्रकार के GPUs लिए और व्यवस्थित रूप से उनकी मेमोरी को खाली से लेकर पूरी तरह भरने तक भरा, जैसे बाल्टी में पानी भरना। उन्होंने हर चरण पर बिजली के स्तर को मापा।
    • परिणाम: बिजली का ग्राफ एकदम सपाट (flat) था। बाल्टी में अधिक "पानी" (मेमोरी) डालने से "इंजन" को अधिक मेहनत करने की आवश्यकता नहीं पड़ी।

"ब्रेकइवन" (Breakeven) क्षण

तो, क्या हमें गैस बचाने के लिए इंजन बंद कर देना चाहिए? पेपर कहता है हाँ, लेकिन केवल तभी जब आप पर्याप्त समय तक प्रतीक्षा करें।

उन्होंने एक "ब्रेकइवन पॉइंट" की गणना की। यह वह समय है जो आपको इंजन बंद करने और बाद में इसे फिर से शुरू करने से पहले इंतजार करना होगा, ताकि यह सस्ता पड़े।

  • गणित: अधिकांश आधुनिक सेटअपों के लिए, यदि आपको 1 से 5 मिनट तक कोई अनुरोध (request) नहीं मिलता है, तो इंजन को बंद कर देना और बाद में फिर से लोड करना वास्तव में सस्ता होता है।
  • चुनौती: छोटे मॉडल सबसे बड़े अपराधी हैं। वे सेकंडों में लोड हो जाते हैं, इसलिए उन्हें उपयोग के तुरंत बाद बंद कर दिया जाना चाहिए। लेकिन बड़े मॉडल लोड होने में अधिक समय लेते हैं, इसलिए आप उन्हें थोड़ा लंबे समय तक चालू रख सकते हैं। हालांकि, पेपर नोट करता है कि "टैक्स" दोनों के लिए समान है, इसलिए यदि उन्हें चालू छोड़ा गया, तो छोटे मॉडल सबसे अधिक बर्बादी करते हैं।

समाधान: एक स्मार्ट शेड्यूलर

लेखकों ने एक सरल "स्मार्ट पार्किंग मीटर" (एक शेड्यूलर) बनाया। मॉडल्स को हमेशा के लिए चालू रखने के बजाय, यह सिस्टम जाँच करता है: "क्या आखिरी अनुरोध के बाद 5 मिनट से अधिक का समय बीत गया है?"

  • यदि हाँ: इसे बंद कर दें।
  • यदि नहीं: इसे चालू रखें।

जब उन्होंने इसका परीक्षण किया, तो उन्होंने मानक "हमेशा चालू" (always-on) पद्धति की तुलना में 8% से 23% बिजली बचाई, और उपयोगकर्ता के अनुभव में कोई खास देरी नहीं हुई।

निष्कर्ष (The Bottom Line)

  • मिथक: "हमें बड़े AI मॉडल्स को 24/7 GPU पर रखना चाहिए क्योंकि उन्हें लोड होने में बहुत समय लगता है।"
  • वास्तविकता: उन्हें चालू रखने की लागत एक निश्चित "पार्किंग शुल्क" है जो GPU के इंजन के रेस लेने के कारण होता है। मॉडल का आकार मायने नहीं रखता।
  • समाधान: हमें इन मॉडल्स को बहुत अधिक बार बंद कर देना चाहिए। यदि किसी मॉडल का उपयोग कुछ मिनटों से नहीं हुआ है, तो उसे बंद कर दें। इससे प्रदर्शन को नुकसान पहुँचाए बिना भारी मात्रा में ऊर्जा (संभवतः पूरे उद्योग में सालाना सैकड़ों गीगावाट-घंटे) बचाई जा सकती है।

संक्षेप में: आपको इंजन चालू रखने की ज़रूरत नहीं है सिर्फ इसलिए क्योंकि आपके पास एक बड़ा ट्रंक (डिग्गी) है। यदि आप गाड़ी नहीं चला रहे हैं, तो कार बंद कर दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →