← नवीनतम पेपर
💻 computer science

An Empirical Study of Sustainability in Prompt-driven Test Script Generation Using Small Language Models

यह अनुभवजन्य अध्ययन प्रॉम्प्ट-संचालित यूनिट-टेस्ट जनरेशन में लघु भाषा मॉडलों (2B-8B पैरामीटर) के पर्यावरणीय प्रभाव और प्रदर्शन संबंधी ट्रेड-ऑफ्स की जांच करता है, जो यह प्रकट करता है कि मॉडल का चयन और प्रॉम्प्ट संरचना ऊर्जा खपत, कार्बन उत्सर्जन और टेस्ट कवरेज को महत्वपूर्ण रूप से प्रभावित करती है।

मूल लेखक: Pragati Kumari, Novarun Deb

प्रकाशित 2026-04-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pragati Kumari, Novarun Deb

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक बेकरी के लिए एक परफेक्ट केक (एक सॉफ्टवेयर टेस्ट स्क्रिप्ट) बनाने की कोशिश कर रहे हैं। अतीत में, आपके पास केवल विशाल, औद्योगिक आकार के ओवन (लार्ज लैंग्वेज मॉडल्स - LLMs) थे जो कुछ भी बेक कर सकते थे लेकिन उनमें इतनी बिजली खर्च होती थी जिससे एक छोटा शहर रोशन किया जा सके।

हाल ही में, छोटे, अधिक कुशल ओवन (स्मॉल लैंग्वेज मॉडल्स - SLMs) उपलब्ध हुए हैं। इन्हें चलाना सस्ता है और ये छोटे किचन में भी फिट हो जाते हैं। लेकिन कोई नहीं जानता था: इन छोटे ओवनों को चलाने में वास्तव में कितनी ऊर्जा लगती है? क्या आपके द्वारा दी गई रेसिपी (नुस्खा) मायने रखती है? और क्या बेकरी का स्थान (पावर ग्रिड) इस बात को बदल देता है कि बेकिंग की प्रक्रिया कितनी "गंदी" (प्रदूषणकारी) है?

यह पेपर इन छोटे ओवनों का एक वैज्ञानिक स्वाद-परीक्षण (taste-test) और ऊर्जा ऑडिट है। यहाँ इसका सरल विवरण दिया गया है:

1. मुख्य प्रश्न: "ग्रीन" बनाम "गुड"

शोधकर्ता जानना चाहते थे कि क्या वे बहुत अधिक कार्बन (हवा को प्रदूषित किए बिना) जलाए बिना उच्च गुणवत्ता वाली टेस्ट स्क्रिप्ट (अच्छे केक) प्राप्त कर सकते हैं। उन्होंने 2 से 8 बिलियन "मस्तिष्क कोशिकाओं" (पैरामीटर्स) वाले मॉडल्स पर ध्यान केंद्रित किया—जो AI का "गोल्डिलॉक्स" ज़ोन है: न बहुत बड़ा, न बहुत छोटा।

उन्होंने चार मुख्य प्रश्न पूछे:

  • रेसिपी मायने रखती है: क्या एक बहुत विस्तृत निर्देश (प्रॉम्ट) लिखना, एक साधारण निर्देश की तुलना में अधिक ऊर्जा का उपयोग करता है?
  • स्थान मायने रखता है: क्या स्वच्छ पवन ऊर्जा (जैसे नीदरलैंड) वाले देश में बेकिंग करना, कोयले की गंदी बिजली (जैसे अमेरिका के कुछ हिस्से या सिंगापुर) वाले देश की तुलना में कार्बन फुटप्रिंट को बदल देता है?
  • कंप्रेशन (दबाव) मायने रखता है: यदि हम मॉडल की मेमोरी को छोटा (क्वांटाइजेशन) करते हैं ताकि यह तेज़ हो सके, तो क्या इससे ऊर्जा बचती है, या क्या यह केक के स्वाद को बिगाड़ देता है?
  • ट्रेड-ऑफ़ (समझौता): यदि हम ग्रह को बचाने या एक परफेक्ट केक पाने में से किसी एक को चुनना चाहते हैं, तो हमें सबसे अच्छा ओवन कैसे चुनना चाहिए?

2. प्रयोग: एक नियंत्रित किचन

इसका परीक्षण करने के लिए, शोधकर्ताओं ने 164 कोडिंग पहेलियों (HumanEval बेंचमार्क) के एक मानक सेट का उपयोग किया। उन्होंने इन पहेलियों को एक मेनू की तरह माना।

  • ओवन (मॉडल्स): उन्होंने पांच अलग-अलग छोटे AI मॉडल्स का परीक्षण किया (जैसे Phi-3.5, Mistral, Llama-3)।
  • रेसिपी (प्रॉम्ट्स): उन्होंने निर्देशों के चार संस्करण बनाए, जो एक साधारण "एक टेस्ट बनाएं" (APV0) से लेकर एक जटिल, रोल-प्लेइंग निर्देश जैसे "एक विशेषज्ञ टेस्टर के रूप में कार्य करें, इन सख्त नियमों का पालन करें, और इस प्रारूप का उपयोग करें" (APV3) तक विस्तृत हैं।
  • ईंधन (ऊर्जा): उन्होंने ठीक कितनी बिजली इस्तेमाल हुई और कितनी CO2 उत्सर्जित हुई, इसे मापने के लिए CodeCarbon नामक टूल का उपयोग किया।
  • स्थान: चूंकि उन्होंने Google के क्लाउड कंप्यूटर्स का उपयोग किया, इसलिए "किचन" दुनिया भर में घूमता रहा। कभी ओवन नेवाडा (गंदा ग्रिड) में था, तो कभी नीदरलैंड (स्वच्छ ग्रिड) में।

3. नए उपकरण: "ग्रीननेस" को मापना

शोधकर्ताओं को एहसास हुआ कि केवल "सटीकता" (accuracy) देखना पर्याप्त नहीं है। उन्होंने लोगों को चुनने में मदद करने के लिए दो नए स्कोरकार्ड बनाए:

  • "सस्टेनेबिलिटी वेलोसिटी इंडेक्स" (SVI): इसे एक कार दक्षता स्कोर की तरह समझें। यह इस बात का संयोजन है कि कार कितनी तेज चलती है, कितना ईंधन उपयोग करती है, और कितनी सुरक्षित है। एक उच्च स्कोर का अर्थ है कि मॉडल तेज़, स्वच्छ है और एक साथ अच्छे टेस्ट भी बनाता है।
  • "ग्रीन एफ-बीटा स्कोर" (GFβ): यह एक डायल (घुमाने वाला बटन) है जिसे आप घुमा सकते हैं।
    • यदि आप डायल को 0.1 पर घुमाते हैं, तो सिस्टम ग्रह को बचाने (सबसे कम कार्बन) को प्राथमिकता देता है।
    • यदि आप डायल को 10 पर घुमाते हैं, तो सिस्टम परफेक्ट टेस्ट कवरेज (सर्वश्रेष्ठ गुणवत्ता) को प्राथमिकता देता है, भले ही इसमें थोड़ी अधिक ऊर्जा खर्च हो।
    • यह एक मैनेजर को यह तय करने में मदद करता है: "क्या मुझे सबसे हरित विकल्प चाहिए, या सबसे अच्छी गुणवत्ता वाला विकल्प?"

4. उन्होंने क्या पाया (चौंकाने वाले तथ्य)

  • स्थान ही सर्वोपरि है: सबसे बड़ा कारक मॉडल खुद नहीं था, बल्कि वह स्थान था जहाँ वह चल रहा था। एक अक्षम मॉडल जो सुपर-क्लीन विंड ग्रिड पर चल रहा है, वह एक सुपर-कुशल मॉडल की तुलना में अधिक "ग्रीन" हो सकता है जो कोयले के गंदे ग्रिड पर चल रहा है।
  • जटिलता की लागत: AI को बहुत जटिल, विस्तृत प्रॉम्ट देना (APV3) थोड़ा अधिक ऊर्जा का उपयोग करता है, लेकिन अक्सर इसके परिणामस्वरूप बेहतर टेस्ट स्क्रिप्ट मिलते हैं। यह थोड़ा अतिरिक्त पेट्रोल खर्च करने जैसा है ताकि एक बेहतर रास्ता मिल सके।
  • कोई एक विजेता नहीं: कोई एक "सर्वश्रेष्ठ" मॉडल नहीं था।
    • कुछ मॉडल्स तेज़ और स्वच्छ थे लेकिन कम टेस्ट बनाते थे।
    • कुछ बेहतरीन टेस्ट बनाते थे लेकिन उन्हें अधिक समय और शक्ति की आवश्यकता थी।
    • सबक: आपको काम के लिए सही उपकरण चुनना होगा। यदि आपको गति चाहिए, तो मॉडल A चुनें। यदि आपको गुणवत्ता चाहिए, तो मॉडल B चुनें।

5. सभी के लिए सीख

यह पेपर सॉफ्टवेयर डेवलपर्स और प्रबंधकों को बताता है: "केवल यह न पूछें कि 'AI स्मार्ट है?' बल्कि यह पूछें कि 'क्या AI ग्रीन है?'"

यदि आप सॉफ्टवेयर बना रहे हैं, तो आपको केवल सबसे बड़े, सबसे शक्तिशाली AI को नहीं चुनना चाहिए। इसके बजाय, आपको:

  1. अपना स्थान जांचें: यदि आप अपना कोड ऐसे क्षेत्र में चला सकते हैं जहाँ स्वच्छ ऊर्जा उपलब्ध है, तो ऐसा ही करें।
  2. अपने डायल को एडजस्ट करें: तय करें कि आप गति/गुणवत्ता या ऊर्जा बचाने में से किसे अधिक महत्व देते हैं, और सही मॉडल चुनने के लिए नए स्कोरिंग टूल्स का उपयोग करें।
  3. प्रॉम्ट्स के बारे में स्मार्ट बनें: एक थोड़ा लंबा, स्पष्ट निर्देश आपको लंबे समय में पैसा और कार्बन बचाने में मदद कर सकता है क्योंकि यह काम को पहली बार में ही सही तरीके से पूरा कर देता है।

संक्षेप में: स्थिरता केवल इंजन के आकार के बारे में नहीं है; यह ईंधन, ड्राइवर, मार्ग और गंतव्य के बारे में भी है। यह अध्ययन हमें अधिक हरित तरीके से चलाने के लिए एक मानचित्र प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →