← नवीनतम पेपर
🤖 AI

SweetSpot: An Analytical Model for Predicting Energy Efficiency of LLM Inference

यह शोध पत्र SweetSpot को प्रस्तुत करता है, जो एक विश्लेषणात्मक मॉडल है जो इष्टतम इनपुट-आउटपुट लंबाई संयोजनों की पहचान करके LLM इन्फरेंस की गैर-रेखीय ऊर्जा दक्षता की सटीक भविष्यवाणी करता है, जिससे अनुकूलन योग्य जनरेशन रणनीतियों के माध्यम से महत्वपूर्ण ऊर्जा कटौती सक्षम होती है।

मूल लेखक: Hiari Pizzini Cavagna, Andrea Proia, Giacomo Madella, Giovanni B. Esposito, Francesco Antici, Daniele Cesarini, Zeynep Kiziltan, Andrea Bartolini

प्रकाशित 2026-04-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hiari Pizzini Cavagna, Andrea Proia, Giacomo Madella, Giovanni B. Esposito, Francesco Antici, Daniele Cesarini, Zeynep Kiziltan, Andrea Bartolini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "The LLM Bakery" नामक एक विशाल, हाई-टेक बेकरी चला रहे हैं।

इस बेकरी में, आपके पास विशाल ओवन (AI मॉडल्स) हैं जो सामग्री की एक सूची (इनपुट) लेते हैं और उसे ताज़ा ब्रेड (आउटपुट) में बदल देते हैं।

लंबे समय तक, लोगों को लगता था कि ब्रेड बनाना बहुत सरल है: "यदि मैं 100 सामग्रियां उपयोग करता हूँ, तो लागत 10होगी।यदिमैं200सामग्रियांउपयोगकरताहूँ,तोलागत10 होगी। यदि मैं 200 सामग्रियां उपयोग करता हूँ, तो लागत 20 होगी।" उन्होंने माना कि ऊर्जा की लागत एक सीधी रेखा थी, जैसे कि एक ढलान (ramp)।

लेकिन इस पेपर के लेखकों ने, जो बोलोग्ना विश्वविद्यालय के शोधकर्ताओं की एक टीम है, एक आश्चर्यजनक खोज की। उन्होंने पाया कि ऊर्जा की लागत सीधी रेखा नहीं है। यह एक रोलरकोस्टर की तरह है।

यहाँ उनकी खोज की कहानी है, जिसे "SweetSpot" कहा गया है।

1. बेकिंग के दो चरण (Two Phases of Baking)

रोलरकोस्टर को समझने के लिए, आपको यह समझना होगा कि बेकरी कैसे काम करती है। इसके दो अलग-अलग चरण हैं:

  • चरण A: तैयारी (Prefill)
    एक भी लोफ (loaf) बेक करने से पहले, शेफ को आपके द्वारा दी गई सामग्रियों की पूरी सूची पढ़नी पड़ती है। यदि आप उन्हें एक छोटी सूची देते हैं (जैसे, "एक सैंडविच बनाओ"), तो यह जल्दी हो जाता है। लेकिन यदि आप उन्हें एक 50 पन्नों का उपन्यास देते हैं ("इस पूरी किताब के आधार पर एक सैंडविच बनाओ"), तो शेफ को शुरू करने से पहले हर एक शब्द पढ़ना होगा। यह "पढ़ने" वाला चरण महंगा है और सूची जितनी लंबी होती जाती है, यह उतना ही अधिक महंगा होता जाता है (यह केवल दोगुना महंगा नहीं होता; यह चार गुना महंगा हो जाता है!)।
  • चरण B: बेकिंग (Decode)
    एक बार तैयारी पूरी हो जाने के बाद, शेफ एक बार में एक लोफ बेक करना शुरू करता है। प्रत्येक लोफ एक स्थिर, अनुमानित मात्रा में ऊर्जा लेता है। चाहे आप 1 लोफ बेक करें या 100, प्रति लोफ लागत लगभग समान रहती है।

2. "Sweet Spot" की खोज

शोधकर्ताओं ने महसूस किया कि ऊर्जा दक्षता (आप अपने बिजली के बिल के बदले में कितनी ब्रेड पाते हैं) पूरी तरह से चरण A और चरण B के बीच के संतुलन पर निर्भर करती है।

  • "लंबा इनपुट, छोटा आउटपुट" का जाल:
    कल्पना कीजिए कि आप शेफ को एक 50 पन्नों का उपन्यास (विशाल इनपुट) देते हैं लेकिन उससे सिर्फ एक ब्रेड का टुकड़ा (नन्हा आउटपुट) मांगते हैं।
    • परिणाम: शेफ किताब पढ़ने में अपनी सारी ऊर्जा खर्च कर देता है, और फिर रुक जाता है। आपने एक नन्हे से टुकड़े के लिए बहुत बड़ी कीमत चुकाई। यह सबसे खराब दक्षता है।
  • "छोटा इनपुट, छोटा आउटपुट" का जाल:
    कल्पना कीजिए कि आप शेफ को एक छोटी सूची (छोटी इनपुट) देते हैं और उससे एक नन्हा सा टुकड़ा (नन्हा आउटपुट) मांगते हैं।
    • परिणाम: शेफ एक नन्हा सा टुकड़ा बेक करने के लिए ओवन सेट करने (तैयारी के खर्च) में बहुत समय बिताता है। सेटअप की लागत "अमोर्टाइज" (बंटी हुई) नहीं हो पाती। यह भी अक्षम है।
  • "Sweet Spot" (सही संतुलन):
    अब, कल्पना कीजिए कि आप शेफ को एक मध्यम सूची (मध्यम इनपुट) देते हैं और उससे एक पूरा लोफ या दो मांगते हैं (मध्यम आउटपुट)।
    • परिणाम: शेफ सूची पढ़ता है (एक उचित लागत), और फिर इतनी ब्रेड बेक करता है कि उस पढ़ने की लागत "सार्थक" लगे। सेटअप की लागत को कई लोफों में फैला दिया जाता है। यह शिखर दक्षता है।

शोधकर्ताओं ने पाया कि इन AI मॉडल्स को चलाने का सबसे ऊर्जा-कुशल तरीका लंबे प्रॉम्प्ट या छोटे जवाबों के साथ नहीं है। बल्कि यह छोटे-से-मध्यम प्रॉम्प्ट और मध्यम लंबाई के जवाबों के साथ है।

3. "SweetSpot" मॉडल

टीम ने एक गणितीय सूत्र (एक "मैप") बनाया जिसे SweetSpot कहा जाता है।

इसे ऊर्जा के लिए एक GPS की तरह समझें। यदि आप GPS को बताते हैं, "मेरे पास 500 शब्दों का इनपुट है," तो मॉडल बिल्कुल गणना कर सकता है कि आपको अपने पैसे का सबसे अच्छा मूल्य (या "वॉट के बदले ब्रेड") पाने के लिए कितने शब्दों के आउटपुट की मांग करनी चाहिए।

उन्होंने परीक्षण के लिए कई अलग-अलग "ओवन" (Llama, Gemma, Falcon जैसे AI मॉडल) और सुपर-फास्ट कंप्यूटरों (NVIDIA H100 GPUs) का उपयोग किया। उनका मैप अविश्वसनीय रूप से सटीक था, जिसने ऊर्जा उपयोग की 98% सटीकता के साथ भविष्यवाणी की।

4. यह क्यों मायने रखता है?

आप पूछ सकते हैं, "मुझे एक AI चैट की ऊर्जा लागत की चिंता क्यों करनी चाहिए?"

  • पैमाना (The Scale): कल्पना कीजिए कि एक कंपनी हर दिन इन लाखों चैट्स को चला रही है। यदि वे वर्तमान में "लंबा इनपुट, छोटा आउटपुट" विधि (एक शब्द के उत्तर के लिए उपन्यास पढ़ना) का उपयोग कर रहे हैं, तो वे भारी मात्रा में बिजली बर्बाद कर रहे हैं।
  • बचत: शोधकर्ताओं ने दिखाया कि केवल प्रॉम्प्ट और जवाब की लंबाई को बदलकर "Sweet Spot" तक पहुँचकर, कंपनियाँ अपनी ऊर्जा खपत को 33 गुना तक कम कर सकती हैं।
  • वास्तविक दुनिया का प्रभाव: इसका मतलब है कि हम AI को बदले बिना इसे चलाना सस्ता और पर्यावरण के अनुकूल बना सकते हैं। हमें बस यह बदलने की ज़रूरत है कि हम उससे सवाल कैसे पूछते हैं।

एनालॉजी (उपमा) सारांश

AI को एक टैक्सी यात्रा की तरह समझें:

  • इनपुट वह समय है जो ड्राइवर आपके घर से आपको लेने के लिए आने में बिताता है।
  • आउटपुट वह दूरी है जो आप कार में तय करते हैं।

यदि ड्राइवर आपको लेने के लिए 50 मील का सफर तय करता है (विशाल इनपुट) लेकिन आप उससे केवल 1 ब्लॉक जाने के लिए कहते हैं (नन्हा आउटपुट), तो आप एक छोटी सी यात्रा के लिए बहुत अधिक भुगतान कर रहे हैं। यह एक बुरा सौदा है।

यदि ड्राइवर आपको 1 ब्लॉक की दूरी पर लेने आता है, और आप भी केवल 1 ब्लॉक की यात्रा करते हैं, तो आप अभी भी "पिकअप" के प्रयास के लिए भुगतान कर रहे हैं, जो बेकार लगता है।

Sweet Spot तब होता है जब ड्राइवर आपको पास से लेने आता है (छोटा/मध्यम इनपुट) और आप एक अच्छी, लंबी यात्रा करते हैं (मध्यम आउटपुट)। आपको अपने पैसे का सबसे अधिक मूल्य मिलता है।

मुख्य बात (The Bottom Line):
यह पेपर हमें सिखाता है कि ऊर्जा और पैसे बचाने के लिए, हमें बस उसे वह सब कुछ नहीं खिलाना चाहिए जो हमारे पास है। हमें रणनीतिक होना चाहिए। कभी-कभी, अपने प्रॉम्प्ट को संक्षिप्त करना (Summarizing) या थोड़ा लंबा उत्तर मांगना AI को बहुत अधिक कुशलता से काम करने में मदद कर सकता है। यह ऊर्जा दक्षता को एक रहस्य से एक अनुमानित विज्ञान में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →